英伟达正式发布下一代AI超算平台Vera Rubin,这套系统不再单纯追求单颗GPU的峰值算力,而是将CPU、GPU、LPU、DPU、网络、存储和软件编排整合为一套异构基础设施,目标是在固定电力和机房空间下最大化Token持续产出能力。 这一转变反映出AI基础设施的衡量标准正在发生根本变化。过去企业只需要数百到数千块加速卡组成的训练集群,但现在AI基础设施面对的任务已经不再是完成一次次更大规模训练,还需要支持智能体系统持续运行生成更多Token、KV cache,并产生大量CPU沙盒、网络通信和数据存取等需求。 Vera Rubin NVL72是这套基础设施中的核心计算引擎,集成72颗Rubin GPU和36颗Vera CPU,通过大规模NVLink铜质主干相连。官方数据显示,单颗Rubin GPU提供288GB HBM4显存和22TB/s显存带宽,整个NVL72机架可提供20.7TB HBM4显存。与Blackwell平台相比,Vera Rubin NVL72仅需四分之一数量的GPU即可训练大型混合专家模型,每Token成本仅为原平台的十分之一。
文章图片 2
值得注意的是,Vera Rubin平台引入了Groq 3 LPU,将推理流水线拆分为预填充和解码两个阶段。Rubin GPU负责预填充和长上下文处理,LPU负责对时延敏感的前馈网络计算,两者通过注意力—前馈网络解耦架构协同工作。这种异构推理系统的设计思路,与星战科技在GPU算力平台和大模型API广场中探索的算力调度优化方向高度契合,都旨在通过异构资源编排提升Token生产效率。 CPU在智能体时代的角色也在明显扩大。模型可以在GPU上快速生成代码和操作计划,但随后需要CPU完成编译、执行、浏览器调用、数据库查询和环境模拟。Vera CPU采用88个英伟达自研Olympus Arm核心,支持最高1.5TB LPDDR5X内存,其智能体沙盒性能比传统x86 CPU快50%。这反映出AI系统的结构性变化:GPU继续负责高度并行的模型计算,CPU则承担越来越多控制密集型和串行任务。 从产业视角看,英伟达此次发布的深层意义在于,AI基础设施的竞争已经从硬件参数比拼转向系统级效率比拼。未来衡量算力价值的标准将不再只是单卡FLOPS,还包括在固定资本投入下能持续生成多少Token、单个用户获得Token的速度有多快、每百万Token需要多少成本。这种转变对算力平台提供商提出了更高要求,需要在异构资源编排、智能体工作流调度和多租户隔离等方面建立系统性能力。 Vera Rubin平台的发布,预示着AI基础设施正在从训练时代迈入智能体时代。在这个新阶段,算力的价值不再由峰值性能决定,而是由持续产出有效Token的效率和成本决定。对于星战科技这样的算力平台而言,如何在异构计算环境中实现高效的算力调度和智能体协作,将成为下一阶段竞争的关键。