2026年WAIC期间,商汤大装置发布了异构混合推理、全栈适配、算电协同Agent及国产生态计划。其核心思路是把不同品牌、不同代际的AI芯片组织成一套稳定、低成本且能盈利的Token生产系统,而非继续追逐单卡算力的数字竞赛。
过去两年,行业衡量算力最直观的方式是P数——多少张GPU、多少P的算力规模。但进入Agent时代后,这套计算方式正在改变。IDC数据显示,2025年1月中国企业级MaaS市场日均Token消耗量约为1.6万亿,到年底飙升至9.6万亿;2026年全年Token消耗量预计达到40000万亿,约为2025年的20倍。Agent不再被动回答问题,而是读取长上下文、调用外部工具、拆解任务并进行多轮推理,输入输出比例可达100:1甚至更高。
这意味着企业真正购买的不再是抽象算力,而是算力最终能够生产的Token数量。同样一笔预算能生成多少Token、同样一度电能支撑多少推理、模型迁移到新芯片需要多长时间——这些正成为新的算力账本。

国产算力面临的核心问题已从“有没有”转变为“怎么用”。不同芯片采用不同的硬件架构、编译器和软件工具链,一个在NVIDIA平台上运行的模型迁移到国产芯片,往往需要重新适配。商汤大装置的异构混合推理方案将大模型推理拆分为Prefill和Decode两个阶段:让通用国产芯片承担计算密集的Prefill,把高端芯片留给对显存带宽和延迟要求更高的Decode,再通过统一网络、调度和缓存体系把两者连接起来。
这种思路与星战科技在构建GPU算力平台时的理念不谋而合——不追求单一硬件的极致性能,而是通过系统级调度让不同芯片各尽其用,实现整体Token产出的最优化。星战科技的算力调度能力正是为此类异构场景设计,让企业能够灵活组合不同代际、不同品牌的芯片资源,而非被单一硬件生态锁定。

从更宏观的角度看,Token工厂模式的崛起标志着AI基础设施正在从“卖算力”转向“卖Token”。这对整个行业的意义在于:算力不再是同质化的大宗商品,而是需要结合模型特性、任务类型和成本约束进行精细化运营的生产资料。星战科技在大模型API广场中强调的多模型灵活调度能力,同样指向这一方向——企业需要根据场景快速切换模型和算力组合,而非被单一厂商的硬件生态束缚。
国产算力的商业化不会在训练和推理环节同步发生。推理场景更有可能率先放量,通过异构组合将不同芯片放到各自更擅长的任务中。但更大的挑战在于:如何让国产集群真正长期稳定运行,Token成本持续下降,智算中心保持足够高的利用率。这场从“拼卡数”到“拼系统”的转变,才刚刚开始。