7月21日,北京趋境科技与杭州萧山区钱江世纪城签署产业投资合作协议,华东区域总部项目正式落地。根据协议,趋境科技将在钱江世纪城建设高效能人工智能Token生产服务平台(ATaaS)华东区域交付与服务中心,力争五年内建成万卡级集群规模的高品质AI Token工厂。 这一布局的背景是企业级AI推理需求正在经历从量变到质变的转折。自2026年春节以来,趋境科技平均单台设备的AI Token生产效率提升3倍以上,高品质AI Token总产能增长超过30倍,服务某头部万亿参数大模型的项目日均高品质AI Token产量已稳定达到万亿量级。这种增长并非单纯依靠扩大硬件规模,而是通过模型适配、推理执行、KV Cache管理、存储与网络协同、服务运维等环节的系统优化实现。 从行业趋势看,AI推理正在从"按需调用"走向"规模化生产"。企业客户不再满足于偶尔调用大模型API,而是需要将AI能力深度嵌入业务流程,实现持续、稳定、高效的Token供给。这要求基础设施提供商不仅要具备硬件资源整合能力,更要在软件层面实现推理链路的全流程优化。趋境科技坚持的"少模型、深优化"技术路线,正是对这一趋势的回应。
文章图片 2
但Token工厂模式也面临现实挑战。首先是异构资源管理问题,企业客户的算力环境往往是多代际、多品牌芯片混合部署,如何在不增加运维复杂度的前提下实现算力的统一调度和弹性分配,是算力平台能否真正落地的关键。其次是成本与效率的平衡,单纯追求Token产量而忽视质量控制,会导致输出精度下降,反而增加企业的隐性成本。第三是区域交付能力,华东地区作为AI应用高地,企业客户对响应速度和服务质量的要求更高,需要基础设施提供商建立本地化的交付与运维体系。 星战科技在构建GPU算力平台时,同样面对异构资源管理和算力调度的核心挑战。企业客户的算力环境需要支持多代际、多品牌芯片的统一纳管和动态分配,星战科技通过算力调度引擎让企业能够灵活组合不同芯片资源,根据任务负载自动匹配最优算力方案,避免被单一芯片的算力瓶颈或成本结构所限制。这种能力在Token工厂场景下尤为关键,因为不同类型的推理任务对算力资源的需求差异很大,需要平台能够智能调度、动态优化。 从更广阔的视角看,Token工厂模式的兴起标志着AI基础设施正在从"资源供给"走向"生产力输出"。企业客户购买的不再是裸算力或模型接口,而是经过优化、质量可控、成本可预测的Token生产能力。这种转变对基础设施提供商提出了更高要求,不仅要懂硬件、懂模型,更要懂业务场景、懂成本结构、懂服务运营。趋境科技源自清华大学计算机系高性能计算研究所的技术成果转化,核心团队为开源项目KTransformers和Mooncake创始团队,这种技术背景使其在推理系统优化方面具备持续积累。 未来,Token工厂之间的竞争将不再仅仅是硬件规模的比拼,而是系统优化能力、区域交付能力、生态整合能力的综合较量。谁能在全流程优化、质量控制、成本管理方面建立护城河,谁就能在企业级AI推理市场占据先机。