2026世界人工智能大会上,Token成为出现频率最高的词汇之一。一位来自杨浦的个人创业者站在展馆门口算了一笔账:他做AI短漫剧应用,每月在Seedance上的API调用费要花掉上千元。而在展馆另一头,厂商们正热火朝天地讨论如何把Token做成工厂,大规模、标准化、像印钞票一样输出Token。
启明创投主管合伙人周志峰在WAIC论坛上抛出一组基于OpenRouter的数据:美国企业使用中国模型构建AI应用的Token占比,从2025年上半年的4.5%上升至2026年年中的46%。中国日均Token调用量从2024年初的约1000亿增长至140万亿,增幅超千倍。Token已成为贯穿AI产业链的核心燃料。
Token工厂的本质是将底层算力、模型、推理引擎打包成标准化服务,按量售卖、按需交付。清华大学背景的清程极智提出Token前店后厂模式,PPIO发布面向Agent时代的智能Token工厂,范式智能创始人戴文渊透露2026年一季度Token收入已超过去年全年。如果集群利用率做到极致,Token工厂的毛利率可能达到70%至80%。

但Token与Token并不等值。中国工程院院士郑纬民指出,Token的实际商业价值由首字延迟、生成速度、并发承载能力、服务稳定性四大指标共同决定。行业普遍存在模型虚标、算力质量不透明、计费模式粗放等问题。不同Token工厂、不同模型厂商定价方式五花八门,折扣力度差距明显,目前无法统一定价。
星战科技在构建大模型API广场和GPU算力平台时,同样面对Token效率和成本优化的核心挑战。企业客户在调用大模型API时,需要的不仅是模型能力的接入,更是能够根据任务复杂度自动选择最合适模型的调度能力。星战科技通过多模型灵活适配和算力调度,让企业能够根据场景需求动态组合不同模型和推理策略,避免被单一模型的算力瓶颈或成本结构所限制。

大模型领域的杰文斯悖论还在持续:Token越来越便宜,需求规模反而爆发式增长,算力总支出持续增加。一位深耕企业级智能体领域的创业者坦言,今年帮客户落地智能体项目,客户最关心的问题已经从能做什么变成了Token要花多少钱。以前谈AI大家兴奋的是能力,现在热潮褪去开始算账了。
面向Agent时代,行业不能只依赖算力规模扩张,还需要通过模型、系统与芯片的协同设计,持续提升单位算力的智能产出和任务交付效率。如果Token继续翻倍加上模型尺寸越来越大,对Infra的挑战将持续增加。谁能在Token这个新石油的炼化链条上跑得最快,谁就可能成为AI时代最大的赢家。