2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事在具身智能领域上演。8月中旬,Skild AI发布机器人基础模型S1:给机器人看一遍任务演示视频,它就能在不微调、不做额外post-training的情况下,尝试完成此前没有训练过的新任务,任务时长可达10分钟、包含几十个操作步骤。
S1发布一周前,Generalist AI的GEN-1.5同样把One-Shot Learning作为核心能力——机器人只看一个示范,就能在数秒内学习新任务,无需梯度更新或微调,并支持从人类示范到机器人执行的Sim-to-Real迁移。两家公司的动作都指向同一件事:让机器人学会利用更长的多模态上下文。
In-Context Learning在语言模型领域已被验证:2020年OpenAI在GPT-3论文中定义ICL,不给模型做参数更新,只在输入里提供示例,模型就能在单次前向推理中执行新任务;过去三年上下文从4K扩展到1M,让模型能一口气读完一本书。但具身模型面对的是完全不同的复杂度——视觉观测、语言指令与动作序列交织,真实任务非马尔可夫,信息量高出几个数量级。

直到今年7月,李飞飞、Jim Fan、Yuke Zhu等合著的RoboTTT才第一次系统地把“上下文Scaling”搬到机器人视觉运动策略上。8月,Generalist与Skild的成果让具身领域的ICL讨论骤升。而国内创业公司可可矩阵(COCO Matrix)选择更早介入:成立于今年4月,创始人高宇翔从傅利叶带出从遥操作、数据采集到模型部署的完整经验,试图把ICL从后训练前置到预训练阶段。
可可矩阵的技术支点是“条件表征”:团队认为适合机器人的视觉表征不应只由“看到什么”决定,还应该由“现在想做什么”决定,模型根据任务条件与动作意图动态提取不同层级信息。实验显示,在同样训练设置和算力下,把动作头压到约60M参数,效果仍可超过动作头约1.1B的对照方案——这支撑了“强理解、轻生成”的方向判断。
落地指标也在变化。团队称简单抓取类任务在One-Shot Adaptation后完成率可稳定在80%以上,并强调Self-Correction——第一次失败后,机器人利用失败轨迹修正再尝试。未来衡量机器人智能的指标可能从“任务成功率”转向“第一次成功平均耗时”,因为它对应的是机器人的教学成本与学习效率。

具身ICL能否真正跑通,仍取决于多模态数据、长上下文记忆与推理成本等问题的解决。但方向已经清晰:除了Scale模型、数据与任务覆盖,让机器人在部署后还能从示范、历史与交互中持续获得新能力,正在成为新的Scaling维度。机器人每一次“看一遍就学会”,背后都是长上下文推理与算力的持续消耗,让这类负载跑得稳定、算得清楚,同样是星战科技在GPU算力平台与算力调度方向上关注的场景。