7月21日,谷歌DeepMind一次性发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三款模型。主力模型3.6 Flash在编码基准测试中Token消耗最高降低65%,输入输出价格均低于上一代。轻量款Flash-Lite输出速度达每秒350 Token,多项测试中反超体量更大的Gemini 3 Flash。网络安全专用模型Cyber则面向政府机构开放,用于漏洞识别与修复。 这一轮发布的背景是,大模型厂商之间的竞争已经从参数规模比拼,进入成本与效率的精细化运营阶段。企业客户在部署AI智能体时,关心的不再是最强模型,而是最合适的模型组合。谷歌此次策略清晰:用不同定位的模型覆盖从高频文档处理到高精度安全检测的全场景需求。 从行业趋势看,大模型正在从通用能力展示转向垂直场景深耕。Flash-Lite的反超说明,轻量模型通过针对性优化,完全可以在特定任务上超越更大模型。这种主脑拆解任务、分身批量执行的架构,正在成为企业级AI部署的主流模式。
文章图片 2
但成本控制并非易事。Token消耗降低意味着同样的算力预算可以跑更多任务,但也对模型调度、缓存策略、批处理效率提出更高要求。企业需要的不是单一最强模型,而是能够根据任务复杂度自动选择合适模型的智能调度系统。 星战科技在构建大模型API广场和GPU算力平台时,同样面临算力供给与成本控制的平衡挑战。企业客户在部署AI智能体时,需要的不仅是单一最强模型,而是能够根据任务复杂度自动选择合适模型的调度能力。星战科技通过算力调度、多模型灵活适配和异构资源管理,让企业能够根据场景需求动态组合不同模型和算力资源,避免被单一模型的算力瓶颈所限制。 值得注意的是,谷歌同时宣布启动Gemini 4的预训练,这是其史上规模最大的前沿模型训练。这意味着当前三连发只是过渡方案,真正的旗舰竞争尚未开始。对于企业客户而言,能用上且便宜的才是当下现实,旗舰再强也需先落地。
文章图片 4
大模型竞争已经进入新阶段。参数规模的军备竞赛告一段落,成本、效率、场景适配成为新的竞争维度。谷歌此次三连发,既是对现有产品线的补充,也是对下一代旗舰的预热。企业客户需要的是能够持续迭代、灵活调度的模型服务,而非一次性交付的最强参数。