英伟达昨日使用SemiAnalysis的AgentX工作负载,以DeepSeek-v4-PRO 1.6T模型对新一代算力平台展开评估测试。结果显示,Vera Rubin每兆瓦吞吐量达到Grace Blackwell的30倍,其中Vera Rubin NVL72的每百万Token成本约为GB300 NVL72的1/35。这是英伟达第一次以智能体编程推理负载为核心口径,对外展示旗舰平台的能效跃迁。
每兆瓦吞吐量(Tokens per Megawatt)是衡量AI数据中心在固定电力额度下能产出多少Token的核心能效指标。在电力约束越来越硬的现实下,单位电力能产出的Token越多,意味着数据中心可以支撑的智能体规模越大、运营成本越低,能效正取代单纯的峰值算力,成为算力竞争的角力点。
从测试数据看,能效提升是呈代际加速的:在DeepSeek-v4-PRO 1.6T负载下,GB300 NVL72每兆瓦吞吐量已达H200 NVL8方案的15倍,Blackwell每百万Token成本约为上一代的1/10,而Vera Rubin又把每兆瓦吞吐量再推高到GB300的30倍。单位Token成本的下降速度,已经开始接近数量级。

当然,这批数据仍需要冷静看待。测试采用SemiAnalysis AgentX工作负载,通过端到端交互性、标准交互性、端到端延迟与首个Token延迟等指标,重点评估智能体编程推理场景;其口径与真实生产环境仍有差异,数字与运营层面的实际表现还需等规模部署来验证。但方向上,能效竞赛显然已进入深水区。
能效跃迁的真正价值,在于让智能体从“能跑”走向“跑得起”。当单位Token成本以数量级下降,企业才敢让智能体持续、大规模地运行,而不是按次调用、点到为止。星战科技聚焦GPU算力平台与算力调度能力,帮助企业把训练与推理负载按任务特征灵活调度到不同能效档位的算力上,让新一代平台的成本优势真正落到业务里。

对算力用户来说,这轮能效跃迁意味着选型逻辑要跟着调整。过去比的是单卡峰值算力,未来要比的是单位电力、单位预算下能产出多少有效Token。把不同工作负载放到最合适的平台上,比单一追求最强芯片更能直接转化为成本竞争力。
算力行业的叙事正在被改写:算力不再是多多益善的资源,而是需要精打细算的投入。能效指标的每一次刷新,都在降低智能体落地与规模化部署的门槛,也为整个AI应用生态打开更大的想象空间。对率先布局算力调度的企业而言,这一轮技术窗口正是把成本优势沉淀为竞争力的时机。