Uber在2026 AI工程师大会上公开了软件工厂愿景。数据显示,从2026年2月到8月,全员智能体周活跃用户增长7倍,周智能体请求量增长9.4倍,而AI总支出自4月以来保持相对稳定。目前超过70%的代码合并请求由智能体生成,3600多个智能体技能每天被调用超过3万次。 智能体规模上去了,成本却容易失控,这是多数企业的共同焦虑。AI账单随采用率线性上涨,用得多、烧得多,规模红利很快被成本吞噬。Uber的做法,恰恰是给这个循环踩了刹车。
文章图片 2
Uber用固定模型的对照测试量化收益:每千次模型请求的成本较峰值下降近34%,每次会话的成本较6月峰值下降52%。关键是成本下降来自工程优化而非简单降价——同一模型、同一任务,通过更聪明的路由与上下文管理,单位成本被系统性压低。 传统省成本的方式靠压低单价、降级能力,往往牺牲质量。Uber发现真正的大头是无效Token浪费:上下文窗口膨胀、提示词缓存过期、多轮轮询开销、模型路由不当,都在悄悄烧钱。把这些漏洞堵住,成本才有本质改善。
文章图片 4
这套方法论的本质,是把AI成本治理从"选便宜模型"升级为"平台级调度与管控"。星战科技在大模型API广场与算力调度方向持续布局,正是要帮企业把不同模型、不同计费策略统一到可管理、可观测的成本体系里,让每一分Token支出都能算清账。 Uber的另一关键动作是MCP统一网关:1000多个MCP服务器集中路由,工具Schema按需加载,把单会话5万至7万的Token预加载开销降下来。智能体工具生态越繁荣,上下文工程越重要,谁把工具接入做得越轻,谁的成本优势越明显。
文章图片 6
智能体从"能不能用"走向"划不划算",成本治理成为企业AI落地的必修课。Uber用真实业务数据证明,规模扩大与单位成本下降可以兼得,关键是建立可度量、可优化的工程体系,而不是一味堆模型或砍能力。