近日,在Alphabet发布财报前一天,谷歌一口气推出了三款全新的Gemini模型,全部属于主打快速、低成本的Flash系列,重点聚焦于提升复杂智能体工作流中的运行效率,并降低token消耗。核心特性很明确:效率优先于绝对性能。短短一周内,xAI的Grok 4.5、OpenAI的多版本GPT-5.6以及Kimi K3相继发布,大模型军备竞赛进入白热化,而谷歌给出的回应是:更便宜的模型。 根据谷歌官方信息,这一全新Flash系列共包括三款模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及面向安全场景的Gemini 3.5 Flash Cyber。其中Gemini 3.6 Flash在编程、知识型任务以及多模态推理能力上均有所提升,同时将平均输出token消耗降低了17%,部分场景最多可减少65%的输出token。Flash-Lite每秒可生成350个token,面向高吞吐的智能体搜索和大规模文档处理场景。Flash Cyber则针对网络安全任务专门优化,在CyberGym基准测试中取得83.2%的成绩。 这一策略背后的行业判断很清晰:大多数AI使用场景,并不需要前沿级大脑,而是一个足够快、足够便宜的模型。谷歌CEO Sundar Pichai表示,企业已经在透支全年token预算,组合使用Flash系列模型每年可以为企业节省超过10亿美元。当模型能力逐渐成为行业共识,真正的竞争力开始从绝对性能转向单位token的性价比。这标志着大模型竞争从拼最强进入拼最省的新阶段。
文章图片 2
从行业视角看,谷歌的效率优先策略与星战科技在GPU算力平台和算力调度领域的布局方向高度一致。如何让有限的算力资源发挥最大效能、如何为企业提供更经济的AI基础设施、如何在性能与成本之间找到最优平衡点,正是星战在构建大模型API广场和AI实训平台过程中持续探索的核心问题。大模型竞争的下半场,不只是模型本身的较量,更是模型组合、芯片、推理框架与算力调度平台的系统级竞争。
文章图片 4
对于企业用户而言,选择大模型的标准正在从单一性能指标转向成本、效率、可调度的综合考量。谷歌用牺牲峰值性能换取效率的策略,为大模型行业提供了一个新的竞争维度。在企业开始精打细算token成本的年份,谁能用最低的成本提供最稳定的服务,谁就能在中端市场占据优势。这场赌局能否成立,取决于算力基础设施的持续优化和模型调度能力的不断进化。