前脚友商还在为你追我赶生成几秒钟的电子榨菜视频卷到头秃,后脚李飞飞创办的World Labs微微一笑把桌子掀了:全球首个多模态世界模型Atlas正式登场。按照官方定义,Atlas是一款面向空间智能的omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。 最直观的炸场操作是相机控制生成。以前玩视频生成模型多少有点玄学抽奖,镜头运动全凭运气;Atlas则直接把相机位姿参数当作底层原生输入,只要丢进去1到6张普通照片、定好运镜轨迹,就能生成最长1分钟、1440p分辨率的画面,空间几何丝滑一致。更夸张的是它的空间脑补力:输入一张只拍到机器人正面的照片,Atlas能把自己脑补出整条路径,给一张泳池边角照,它能补出没拍到的草坪和远山。 种种操作背后绕不开一个术语:空间上下文。大语言模型看上文接下文,Atlas则是给每张图片绑死三维坐标和深度,在脑子里搭出一个带轴网的房间。很多能力的底层其实都绕不开多视角合成:把来自不同角度的图片和视频一起塞进同一个三维空间,判断相对位置,补足没拍到的区域,再生成新的视角。输入视角越多,它就越像在做带空间约束的多视角融合,把零散画面拼成连续可漫游的三维场景。
文章图片 2
第二张王牌是空间重建。传统的3D高斯泼溅或点云扫描得扛着专业设备围着目标转几十圈,拍几百上千张照片;Atlas只需把2到25张游客视角的地面平拍照片塞进去,就能还原建筑的全部细节。在多个公开数据集上,它的稀疏视角重建误差明显低于同类方案,输出直接对接点云和3D Gaussian Splatting,能无缝接进自家的渲染平台,实现高帧率即时渲染。 技术底座上,World Labs掏出了一套硬核的组合拳:多模态自回归扩散Transformer。它兼采两大主流范式长处——自回归像语言模型预测下一个词那样在时空序列中逐级预测新的空间状态,扩散机制用去噪确保连续高维信号的画质与几何精度,Transformer则以最成熟的矩阵乘法结构为底座,无缝适配现有大规模算力集群,让Atlas能同时享受语言模型的KV Cache、分布式推理优化与扩散模型的采样蒸馏。
文章图片 4
更远的目标指向具身智能与机器人。现在搞机器人训练的人都清楚,最大痛点就是虚拟训练场不够用:去真实环境反复试错,数据采集慢、成本高;换到仿真环境,又得先花大量人力搭建3D场景、材质与光照。业内估算,完全靠传统方式收集足够规模的机器人训练数据,最终成本可能达到100万亿美元量级。Atlas的Real to Sim路线相当于省掉了中间大量人工搭建仿真世界的工作。 拿手机拍两段24帧的工厂或房间视频喂给模型,Atlas就能吐出一个高精度的3D物理空间,机器人可以钻进这个孪生空间疯狂跑图试错,甚至机器人走到哪,它就当场渲染出机载摄像头应该看到的画面与深度图。机械臂碰箱子、拉柜门、捏海绵,Atlas都能模拟受力反馈——录一段真实现场,就能衍生出千万种光照、摆放与障碍物条件。
文章图片 6
在针对镜头运动控制的盲测里,Atlas面对同类视频模型的胜率从75%一路冲到94%。从ImageNet解决让机器在像素中识别世界,到如今李飞飞死磕的,是机器看见一张图之后究竟有没有理解背后的三维空间以及下一秒会发生什么。Atlas所代表的空间智能,某种程度上是给已经发达的语言智能加上一层关于几何、物理、时间和行动的世界经验。值得关注的是,World Labs在Atlas身上强调的另一个关键词是Scaling:随着参数量和计算力成倍上翻,模型展现出类似大语言模型那样突然开窍的涌现能力,暴力Scaling依然是版本答案。这类多模态大模型的训练与推理,对算力集群的规模与调度效率提出了更高要求,也印证了算力底座在未来AI竞争中的核心地位,这正是星战科技在GPU算力平台与算力调度方向上长期投入判断的价值所在。