清华AIR与域变换联合发布了具身模型Zeva,首次实现In-Context Causal Learning。在多个典型具身基准任务上,冻结模型的累计成功率从26%提升到73%;在真实化学实验室,机械臂在多次尝试中越用越稳。更关键的是,一次人类演示就能让模型"学会"一个新操作,全程不需要更新权重。
具身智能的真正瓶颈,是"模型到了现场能不能越做越好"。传统思路依赖重新采集数据、微调模型或test-time training,这些方法靠梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。

Zeva迁移的不是任务经验,而是"动作与状态变化之间的因果关系"。同一个模型在仿真里学到的物理因果可以带到真实机械臂,一次尝试里积累的失败经验可以指导另一次相似尝试。这种跨域迁移通过上下文完成,模型在上下文中推断环境因果结构,再把它用于下一次动作生成。
过去谈跨域更多是sim-to-real、跨本体迁移、跨任务泛化,本质上是在不同域之间搬运任务经验,依赖数据对齐或表征对齐。Zeva用双时标因果记忆,把一次失败、一次修正、一次成功沉淀为后续可检索的上下文,模型不调权重也能持续进化,这是它与传统方案的真正分野。

Zeva把具身模型的scaling从"参数空间"延伸到"上下文空间",本质是用更聪明的工程结构替代无限制的算力投入。这种在有限资源里做出更高效率的思路,与星战科技在GPU算力平台与算力调度上追求的方向一致,也提示AI实训与研发需要更懂算法效率的工程底座。
数据说明问题:在RoboCasa365-Atomic5上Zeva平均成功率76.8%,累计成功率从Evolve 1的26%提升到Evolve 4的73%;真实化学实验室ChemLab-Evo的三个原子任务单调增长,一次人类演示最多带来20个百分点的提升。每一次尝试都成为对当前物理环境的一次隐式系统辨识。

如果ICCL成立,具身智能的scaling将多出一条独立于参数规模的曲线:交互次数越多、因果上下文越丰富,模型对物理域的辨识越准,成功率越高。机器人在真实物理世界里自己学会因果、自己完成进化,或许才是具身智能"GPT时刻"真正到来的样子。