WAIC 2026上,太初元碁发布了HCU异构融合计算架构和新一代国产AI自研芯片T2 Ultra。这颗芯片的核心设计思路是把CPU和AI算力核放在同一条高速总线上,支持M:N可重构配比——CPU负责智能体调度和数据预处理,XPA算力阵列专注大模型推理计算,配合共享分级存储实现冷热数据动态调度。同一颗芯片既能独立承担完整计算任务,也能作为加速卡协同工作。
这一发布并非孤例。今年WAIC上,华为展出了Atlas 950 SuperPoD超节点,沐曦发布了曦景S系列超节点,阿里平头哥也拿出了真武M890×磐久AL128超节点。国盛证券在近期研报中直接点明:国产超节点迎来量产元年,算力竞争范式正从单点峰值性能全面转向系统级全栈效率的比拼。单卡比拼的时代已经落下帷幕,大规模计算系统性能的较量正式开启。
这种转变的底层驱动力来自Agentic AI时代的算力需求变化。传统AI训练和推理集群通常采用单路CPU搭配4至8颗GPU的固定配置,CPU长期仅负责任务下发和资源托管。进入智能体时代,智能体需要自主完成任务拆解、工作流编排、外部工具调用、长期记忆管理的全闭环运行,CPU在规划、决策类通用计算中的算力权重出现结构性提升。AMD CEO苏姿丰在财报电话会上透露,单个计算节点中CPU与GPU的数量正从过去的一对多逐步趋近一比一。

星战科技在构建GPU算力平台时,同样面临异构资源管理的核心挑战。企业客户的算力环境往往是多代际、多品牌芯片混合部署,如何在不增加运维复杂度的前提下实现算力的统一调度和弹性分配,是算力平台能否真正落地的关键。星战科技通过算力调度引擎支持异构资源的统一纳管和动态分配,让企业能够灵活组合不同芯片资源,根据任务负载自动匹配最优算力方案。

生态迁移是国产算力面临的另一道硬门槛。太初元碁同步发布了人工智能开发者社区2.0,完成了对Megatron-LM、DeepSpeed、飞桨、PyTorch、vLLM等主流框架的适配。行业调研显示,完整适配周期约需3到6个月,其中约60%的工作量集中在性能调优阶段。国产算力能否从可用走向好用,生态建设的速度决定了产业化落地的速度。
从更宏观的视角看,WAIC 2026释放的信号非常清晰:国产算力已经过了靠单点参数刷存在感的阶段,真正的较量是体系化能力与生态协同效率的综合比拼。能够同时提供芯片架构创新、系统级调度能力和完善开发者生态的厂商,才有望在下一轮洗牌中占据有利位置。