智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。公司称,模型强化机器人物理感知与动态预判,助力具身智能实现更高阶的物理交互。发布同期,它首次参评具身智能评测平台RoboColiseum,即在核心的“扰动适应”子榜以平均分0.692登顶。
RoboColiseum的考察方式很“刁钻”:通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令做多样化改写,检验模型在非理想环境中的稳定性与泛化能力。扰动适应被公认是四个能力维度里最具挑战的一环——不是实验室里的温室考试,而是在各种意外中检验真本事。

能顶住“不完美”,靠的是原生全模态底座。官方介绍中,模型在语言理解上覆盖多元动词、句式与表达方式的等价指令空间,只锁定意图本身;视觉上综合多视角信息,当单路画面受遮挡或偏移,系统仍能借其他视角理解场景继续执行;训练阶段则主动引入光照变化、画面污损等非理想条件,让模型学会从有限线索中作出可靠判断。
模型的底气还来自数据策略。“真实基座+生成增强”意味着高质量真实数据(如与诺亦腾合作的高精度动作捕捉)作为底座,再用原生全模态能力做百倍级的数据扩增:在恪守物理约束的前提下切换背景、光照、物体形态,产出海量训练样本。模型既当“考生”,也当“出题人”,数据与模型互相驱动形成飞轮。

把时间线拉长看,这是智象在不到一个月内发布的第二款世界模型:此前交互式世界模型HiDream-O1-World刚在WBench的Navi分榜以80.9分登顶。交互式世界模型解决“理解与推演”,具身世界模型解决“操作与执行”,两者互补,指向一家公司对“统一世界模型基座”的押注。
从技术叙事看,具身世界模型与仿真评测的热度,反映的是行业对“物理世界正确性”的焦虑:机器人不能只会在仿真里听话,还要在真实的光照、遮挡与干扰下稳定完成任务。而训练这样的模型,意味着海量多模态数据的处理与高强度的算力消耗,评测、数据与训练三者正在形成新的闭环。

对产业而言,HiDream-O1-Embodied登顶带来的不只是榜单信号,更是具身智能路线的参照:谁能在“不完美环境”里保持稳定,谁就更接近把模型从模拟搬进真实。这类模型从训练到评测都高度依赖规模化GPU算力与数据调度能力,也正是星战科技在GPU算力平台与算力调度方向上持续投入所对应的应用场景。