9月2日,谷歌发布Gemini 3.8 Flash,单价一分没涨:输入每百万token 0.75美元,输出3.75美元。但Artificial Analysis当天的实测却显示,完成同一个任务的总成本涨了40%,模型每个任务多消耗了30%的输出token。价格表没动、账单却动了,这个矛盾里藏着下一代模型竞争的真正战场。 先看能力规格。Gemini 3.8 Flash在DeepSWE长周期软件工程上追到离Claude Opus 5只差0.3分,价格不到对方六分之一;综合推理、金融智能体等基准同样靠前,生成速度约305token/秒,是独立机构测过最快的商用模型之一。模型已进入Gemini App、AI Studio与编程平台,Cursor等开发工具在发布当天完成接入,走的正是开发者入口的走量路线。 这次升级的核心设计,是模型会更努力地完成任务。面对复杂任务,模型执行更多推理步骤、更频繁地迭代调用工具,每一步的推理、工具与验证循环都消耗输出token,步骤翻倍token自然上涨,高算力模式下放大效应更明显。Artificial Analysis测出的链条很完整:单任务输出token增加约30%,折算成单任务总成本上升约40%,即便如此,单任务约0.58美元的成本仍落在智能与成本的性价比前沿上。
文章图片 2
更深一层的变化在于定价路径。优惠价到期后,模型单价将翻倍至输入1.50美元、输出7.50美元,用量涨一轮、单价再涨一轮,两波叠加才是完整价格路径;谷歌同时保留3.7 Flash作为低成本选项。这套Flash三周级迭代节奏,瞄准的是编程Agent与自动化工作流——当前token消耗增长最快、也是各家API收入主战场的场景。 同场发布的网络安全版本则走了另一条门控路线,只通过受信访问计划向约650家机构开放,与Anthropic把前沿模型锁进可信访问计划的逻辑一致。这提示一个趋势:前沿能力正在分层,面向开发者生态的走量版本与面向受监管高价值任务的受控版本各司其职,能力开放程度正成为新的战略杠杆。
文章图片 4
基准口径的边界需要讲清。官方主打的基准全部领先,但第三方核对了完整榜单后,画面并不均匀:边界清晰、终点明确的专业任务,它能贴着旗舰打;需要自主规划下一步的开放任务,差距会被拉开。且所有对比数据均为厂商自测口径,发布日基准与生产环境表现历来存在差距,成本侧的实际影响也取决于任务结构,短问答几乎不受token放大影响,长链路Agent任务才是成本上升的重灾区。 当各家每token单价逐渐咬平,完成一个任务烧多少token就成了新的定价杠杆。推理更深、步骤更多的模型天然更贵,即便价目表一动不动;Anthropic两天前把缓存读取价砍了75%,打的也是同一本账。对开发者而言,选型时盯住单任务成本而非单价,正成为大模型API时代的通用准则,这也对大模型API广场这类聚合入口提出了按任务效果而非按单价比较的新要求。
文章图片 6
价格战的第二阶段,比的是谁的账单更会藏。模型厂商把降本手段从明面单价下探到token消耗与缓存读取的工程层,企业采购则必须建立更精细的任务级计量。谁能把模型路由、缓存与任务评测做成透明可核算的体系,谁就能在这场藏账单的暗战里保持清醒,这也是星战科技在大模型API广场方向上持续建设的价值所在。