浪潮信息在2026开放计算大会上发布了两款重磅产品:业界首款CPU原生液冷整机柜服务器和元脑SD200超节点AI服务器企业版,同时上线多模融合API。这一发布的背景是AI基础设施的核心任务正在发生根本性转变——从支撑大模型推理转向支撑海量智能体的规模化运行与高质量Token的持续生产。 据IDC数据,2025年中国AI Agent企业级市场规模约190亿元,预计2025至2028年复合增长率超过110%。Gartner的判断更直接,2026年将有40%的企业应用集成任务型AI Agent。大模型推理阶段,AI基础设施只需要支撑一次输入一次输出。进入Agent阶段,基础设施要支撑的是任务拆解、工具调用、多轮协作和持续运行,这对算力提出了完全不同的要求。 这背后其实是两个方向的能力缺口。一个是海量Agent能不能规模化、稳定地运行起来。一个Agent应用要先把任务拆开,再一步步调用工具、来回协作,背后同时运转的可能是一整群Sub-Agent。部署到企业之后,Agent的数量更是可能高达成千上万。另一个是多个模型能不能协同工作,让Agent变得更聪明。有的模型擅长逻辑推理,有的擅长写文本,这种能力上的偏科没法靠堆参数量解决,需要多个模型分工协作、互相补台。
文章图片 2
这两件事要真正落地,都必须有底层算力基础设施打头阵。新需求来临后,基础设施的第一个变化是CPU变得更重要。以前的问答模式下,大模型推理是一次输入一次输出,更多依靠GPU运行。但Agent不一样,它要做任务拆解、调用工具、多轮协作、汇总结果,这些整型运算和逻辑推理运行在CPU之上。而且Agent不是跑一次就"下班",很多Agent必须常年在线,运行时间被大幅拉长。所以在AI Infra行业里,算力配比也在发生变化,从过去以GPU为中心,走向多元算力系统协同。 CPU的重要性上来之后,紧接着要面对的是功率密度问题。浪潮信息副总经理赵帅介绍,国内的AI机柜功率今年内就要冲到300千瓦,全球部分机柜已经进入兆瓦级。如果CPU侧还停留在单柜几千瓦的密度,根本没法匹配数据中心全新的电力基础设施。随着机柜功率不断攀升,散热就成了问题,传统风冷单机柜散热40到50千瓦的上限早就撑不住了,液冷方案成了必选项。 为了实现Agent的规模化运行,浪潮信息发布了业界首款CPU原生液冷整机柜服务器。这台服务器单柜最大可支持384颗基于开放OCM架构的CPU处理器,兼容x86和ARM,可以支撑4万+个Agent协同运行。这个规模是浪潮信息今年4月发布的"企千虾"方案的40倍。OCM架构能够兼容不同代际、不同架构的处理器,不用为每一代新芯片重新设计整套系统,研发周期因此被大幅压缩。
文章图片 4
星战科技在构建OPC智能体协作平台时,同样面对智能体规模化部署和算力调度的核心挑战。企业客户在部署AI智能体时,需要的不仅是单次问答的准确性,更是能够将业务工作流自动转化为可复用Skill的系统能力。星战科技通过多模型灵活调度和跨系统连接,让智能体能够根据任务复杂度动态选择最合适的推理策略,同时通过算力调度确保高并发场景下的稳定运行。这种能力在Agent规模化部署场景下尤为关键,因为不同类型的智能体任务对算力资源的需求差异很大,需要平台能够智能调度、动态优化。 多个大模型同时参与一次任务,对底层算力提出了更高的要求。元脑SD200超节点去年发布时已经能同时部署4个万亿参数大模型,token生成时间做到8.9毫秒,是国内首个突破10毫秒大关的产品。今年这个数字进一步压到4.77毫秒,是国内首个跑进5毫秒的方案,首Token延迟也降低了35%。这些提升背后是多Token预测、W4A8精度方案和JIT即时编译这类软硬协同优化在起作用。 如今CPU、GPU和软件平台三者的分工正在变得更紧密。软件平台负责模型接入、任务编排、资源调度、权限治理和结果融合,CPU承载Agent实例、工具调用、沙箱运行和业务系统交互,GPU负责模型推理与Token生成。三者协同才能支撑海量Agent稳定运行和复杂任务高效执行。这条链路里任何一环掉队,整个Agent应用都跑不顺畅。这也让Agent时代基础设施的竞争重点发生了变化,过去比的是谁对单一模型的支持能力更强,现在比的是谁系统级协同能力做得更好。