9月8日,在Arm Everywhere China年度大会上,Arm发布新一代数据中心计算子系统Neoverse CSS N4,并公布Arm AGI CPU的最新生态进展。Arm还宣布与新紫光集团深化合作,计划在中国成立联合通用人工智能创新中心。在GPU长期占据AI话题中心的背景下,这次发布的重点却是一个更“传统”的角色——CPU。
Arm的逻辑与智能体的运行方式有关。随着AI应用从生成内容转向执行任务,一个智能体在完成推理之外,往往还要检索数据、访问数据库、调用外部工具,并与多个模型或其他智能体协同。这些操作不一定适合全部交给GPU处理,也由此增加了数据中心对通用CPU、内存带宽和高速I/O的需求。
作为可配置程度较高的计算子系统,CSS N4单颗裸片可配置8至128个CPU核心,最高频率3.8GHz,并首次在Neoverse N系列CSS中支持LPDDR6内存和PCIe 7.0,PCIe通道最高可达128条。Arm称,与上一代CSS N3相比,其单插槽性能最高提升至2倍,每瓦性能最高提升25%,内存带宽最高提升75%。

这些指标对应的,恰恰是智能体带来的“模型之外的活儿”。Agent沙箱用于隔离代码和工具调用,DPU承接网络与数据移动,KV Cache保存推理中间状态。随着Agent数量和并发任务增加,这些此前位于GPU周边的计算负载,可能进一步推高CPU、内存和网络资源的消耗。Arm并不认为CPU会替代GPU,而是强调二者协同。
对国内AI基础设施而言,这条路线指向的是更细致的异构算力组合。当一台服务器上同时安排GPU、CPU、网络与存储任务,能否按负载把不同类型的芯片放到合适的位置,会直接影响整体效率与成本。星战科技在GPU算力平台上持续投入的方向之一,正包括异构资源的统一纳管与调度,让模型推理与周边执行任务共享同一套可编排的资源。
在国内,火山引擎正在基于Arm平台建设下一代云服务,并计划推出首批采用Arm AGI CPU的智能体沙箱解决方案。Agent沙箱需要支持快速启动、权限控制、弹性扩容和故障隔离,本身就会消耗较多CPU与内存。类似方向也已出现在其他云平台,说明智能体基础设施的竞争,正从“谁的GPU推理更快”扩展到谁能更有效地承接模型周边的执行任务。

Arm同时更新了中国市场与全球生态进展,OpenAI、Meta、Cloudflare、Oracle、SAP等公司被列为围绕AGI CPU开发系统或解决方案的伙伴。智能体AI仍处早期,但一个趋势已经清晰:基础设施要处理的,不只是模型本身,还有模型之外越来越复杂的编排与协同。