大火的“世界模型”,真的不能拿一张消费级显卡跑吗?蚂蚁灵波给出的答案是可以。7月,他们把LingBot-World 2.0的14B主模型开源,能够做到小时级持续生成、丰富的动作与事件交互,并在相应配置下实现720p/60fps的高清实时体验;近日,团队又发布1.3B轻量版,面向消费级单卡GPU,可在本地实现实时世界生成。 世界模型与普通视频生成的区别在于“持续”。生成一段视频,输入提示后等几十秒甚至几分钟很正常;但世界模型要在用户每走一步、每转一次视角时接着往下生成,等于在生成一个持续演进的世界。 从14B到1.3B,并不是先把大模型做出来再砍小,而是先把一条训练路线走通,小模型是路线走到最后自然出现的产物。团队先训练因果世界模型,让当前状态只依赖过去的信息;又设计MoBA机制,在原有掩码中加入一部分双向注意力,缓解长上下文下的过拟合与画质退化。
文章图片 2
高质量骨干网络还有一个现实问题:慢。每一帧都要经过很多步去噪,直接用于实时交互成本太高。于是团队做一致性蒸馏,把原本多步的去噪轨迹压缩到少数几步,再加入分布匹配蒸馏,让模型在自己的长时自回归轨迹上继续训练,减少累计漂移。这套压缩把实时世界生成的成本降了下来。 从工程视角看,世界模型的普及不只是模型变小,更是推理成本与算力供给的问题。当同一套模型需要同时服务云端高质量生成和端侧实时交互,如何按任务分配算力、让推理在成本可控的前提下稳定运行,就成了关键。星战科技在GPU算力平台与大模型API广场上的方向,正是让不同规格的模型按需取用、按负载调度,把门槛真正降下来。
文章图片 4
这一年的三次开源,回答的其实是递进的三个问题:能不能做出来,能不能做得久、做得真,以及能不能让更多人跑起来。这次蚂蚁灵波还把因果预训练与双向Teacher一并放出,社区可以在上游模型上继续做后训练、蒸馏、压缩和垂直场景适配。 世界模型的上半场比的是生成得更久、更真,下半场比的很可能是普通人手上那张卡也跑得动。真正让一项技术扩散开的,往往不是最强的版本,而是第一个足够小、足够便宜、能被拿来试一试的版本。
文章图片 6