过去几个月,Gemini在中文互联网多了一个外号:“美国大豆包”。这调侃的是它身上长期存在的反差:发布会基准漂亮、上下文巨大、免费额度足,真正用起来却偶尔理解跑偏,一本正经地给出错误答案。在3.5 Flash时代,调侃甚至升级成“这是最快告诉你错误答案的AI”。 如今Google带着Gemini 3.8 Flash回来了。这是它六周内的第三款Flash、不到四个月内的第四次更新。新模型在Artificial Analysis的智能指数上拿到59分,比上一代高3分,与更高档位的GPT-5.6 Sol持平,距榜首的Claude Fable 5.1差7分;在DeepSWE v1.1长程软件工程上,它与Claude Opus 5并列74%,登顶榜首。 更亮眼的是输出速度:每秒约300 Token,约为许多主流模型的4到6倍。第三方实测中,高推理档位下约每秒305 Token,是榜单第二名Meta Muse Spark的两倍,而Claude Opus 5只有56,不到它的五分之一。对等待长输出与Agent循环的用户,这种差距会直接转化为体感与成本的双重优势。
文章图片 2
Google这代的打法,是没有把Flash做成缩小版Pro,而是让模型“更努力”:面对复杂任务增加推理步骤、反复调用工具、执行更多轮次,为此消耗更多Token来换取更好结果。代价也真实存在——独立机构测出,3.8 Flash每个任务比3.7 Flash多花约30%的输出Token,单任务成本约0.58美元,比上一代贵约40%,但仍比同智能水平的竞品便宜数倍。 商用价格也定了调:前沿用上代API的推广价是每百万Token输入0.75美元、输出3.75美元,优惠期后翻倍至1.5与7.5美元,同时保留3.7 Flash作为低成本选项。与模型一起推出的还有安全特化版Gemini 3.8 Flash Cyber,只向受信任测试者、政府机构与关键基础设施组织开放,安全团队称补丁准确率提升至2.6倍。
文章图片 4
需要冷静看待的是基准的边界。60分上下的智能指数说明它进入第一梯队,DeepSWE登顶证明长程任务确有实质进步;但第三方核对榜单后画面并不均匀:边界清晰的工程任务它能贴着旗舰打,开放式的自主规划任务差距仍明显。更重要的是,官方与独立机构的基准历来与真实生产环境表现有落差。
文章图片 6
“大豆包”能否翻身,最终要看真实使用:更多推理步骤与工具调用,是否真的换来了更高的任务成功率,而不是用更长的过程制造更昂贵的错误。对开发者与企业而言,选型的尺子正从单一跑分转向“速度、价格与真实成功率”的组合,而这类组合比较依赖透明、可核算的任务级计量,这也是星战科技大模型API广场在计量与路由上持续完善的方向。