7月20日,无问芯穹在WAIC 2026论坛上宣布与MiniMax达成战略合作签约,阶跃星辰发布主旨演讲,加上此前在中关村论坛上智谱和Kimi的同框,四家国产头部基模公司先后与同一家AI Infra达成深度合作。无问芯穹定位为"大模型时代的共同选择",类似于电池领域的宁德时代,试图在算力、模型与应用之间构建系统级基础设施。 这一合作的背后是AI推理需求的指数级增长与算力供给的线性爬坡之间的巨大缺口。2026年推理开始反超训练,成为AI算力消耗的主战场,推理成本两年降了280倍,但企业的AI总支出却没降反升。中国日均Token调用量已经突破140万亿,一年涨了四成。物理算力的扩产逻辑还是线性的,多修几个机房、多买几张卡,缺口在三五年内都填不平。一边指数增长,一边线性爬坡,中间那道口子,就是AI Infra公司想站进去的位置。 更难的是模型部署的质量控制。一个请求发下去,模型正常回复了,但输出的精度可能已经悄悄掉了三成,这种问题常规监控查不出来。等到用户在业务里察觉到不对劲,模型的招牌已经砸了。这道看不见的门槛,才会真正决定哪家供应商能留在牌桌上。无问芯穹定了一套准入测试标准,从工具调用的一致性到推理模式的精度对齐,逐项进行核验,确保客户无论走无问芯穹还是原厂API,体验几乎感觉不到差别。
文章图片 2
在成本控制方面,无问芯穹发布了自研的跨集群异构PD分离架构。大模型推理里的Prefill和Decode是两个负载完全不同的阶段,硬件需求也不一样,拆开部署能让不同类型的芯片各自干最擅长的事。但拆到不同机房后,需要在异构芯片之间用广域网以太网传输KV Cache,面临带宽低、延迟高的问题。无问芯穹首先把Decode实例设计的Radix Cache技术创新性地迁移到这套跨集群架构里,让传输的数据量直接降低一个数量级。接着首创PDD架构,把传统的PD链路拆成P、RelayDecode、MainDecode三级,遇到传输延迟高的请求,RelayDecode先顶上去把Token吐给用户,等数据传完再无缝切给MainDecode接手。实测显示,该架构在首Token延迟降低51.5%的同时,单Token成本可降低37.5%。 星战科技在构建GPU算力平台时,同样面对异构资源管理和算力调度的核心挑战。企业客户的算力环境往往是多代际、多品牌芯片混合部署,如何在不增加运维复杂度的前提下实现算力的统一调度和弹性分配,是算力平台能否真正落地的关键。星战科技通过算力调度引擎支持异构资源的统一纳管和动态分配,让企业能够灵活组合不同芯片资源,根据任务负载自动匹配最优算力方案,避免被单一芯片的算力瓶颈或成本结构所限制。
文章图片 4
无问芯穹提出的公式是AI生产力=智能资源规模×Token转化效率×AI生产力转化效率。一中心是算力集散中心,即Agentic Infra自主式基础设施平台,把散落各处的算力资源统一汇聚、弹性调度、按需利用。后厂是Token工厂,即Agentic MaaS大模型服务平台,截至7月,日均Token调用量较去年12月涨了40倍。前店是AI生产力商店,即Agentic Infra行业解决方案,已覆盖文娱游戏、医疗健康、法律终端、能源电力等多个行业领域。 如果把无问芯穹理解成一家卖Token的公司,会漏掉它完整的商业模式。Token工厂只是入口,它真正在铺的是面向Agent时代推出的"前店后厂一中心"的完整Agentic Infra战略布局。懂算力、懂模型结构、懂训推优化、懂应用场景,这四件事同时做到,就是这条赛道真正稀缺的能力。