前几个月,OpenAI 和 Anthropic 轮番把旗舰模型往前推,谷歌却相对安静。Flash 几乎三周一更,3.6、3.7、3.8 连续往前,但代表能力上限的 Pro 线迟迟没有动静。直到最近,大模型盲测竞技场 Arena 里出现一个挂着 gemini-3.8-flash 名字的模型,却在写代码、做 SVG 和跑 Agent 任务上明显又跳了一截,开发者很快猜测它其实是尚未发布的 Gemini 4 Pro。 一张在社区疯传的 benchmark 对比表,把它在软件工程、终端 Agent、专家级知识推理和电脑操作等测试上的成绩写成全面领先,甚至突破了 2000 Elo。但表格与所谓内部截图都没有官方背书,唯一能确认的,只是这个匿名模型和正式版 3.8 Flash 之间肉眼可见的差距。 更值得注意的是谷歌明显加快让 AI 参与模型研发的速度。路透社今年 8 月披露,谷歌联合创始人 Sergey Brin 一直在推动 Gemini 提速,并把递归自我改进列为重点关注方向;谷歌还发布 Dream-RSI 论文,研究如何让 Agent 通过不断改进探索策略实现递归自我改进。Anthropic 也公开表示,截至今年 8 月,Claude 已能主导其 26% 的 AI 研发任务。
文章图片 2
然而,“减速倡议”喊得很响,共同规则却没有建立起来。单独放慢意味着把领先窗口让给对手,于是 Anthropic 的 Opus 5.2、OpenAI 的 GPT-6 Sol 等下一代模型的测试痕迹接连出现。几家公司已经可以一起说“应该谨慎”,但一到“谁先减、其他公司减不减”,共识就迅速消失。 这场加速最终要落到算力上。模型迭代越快,训练与推理对算力调度效率的要求就越高。星战 GPU 算力平台与异构集群方案聚焦算力纳管与动态调度,帮助企业在多卡、多集群环境下提升 GPU 利用率,让持续加速的研发与推理需求不至于被低效的基础设施拖住。 当 AI 开始参与制造更强的 AI,被加速的不只是模型能力,还有模型进化的速度。而人类理解、评估和控制它的速度,未必能同步加快。这既是能力问题,也是治理与工程问题。
文章图片 4
减速的声音还没落地,新一轮竞赛已经开始。对行业而言,真正稀缺的从来不只是某一个更强的模型,而是能把算力、工程和治理同时跟上的系统能力。