据The Information独家爆料,谷歌正在研发一款代号Frozen v2的神秘服务器芯片,核心思路是把Gemini模型的部分底层架构永久蚀刻进硅片。不是让模型跑在芯片上,而是让模型长在芯片里。参与项目的谷歌员工预计,按每瓦特能处理的Token数量计算,这款芯片将比谷歌最新一代TPU高效6到10倍,最快2028年部署。消息一出,Alphabet股价应声上涨3.7%。 Frozen这个名字是字面意思:把模型“冻”进硅片。无论是英伟达GPU还是谷歌TPU,本质上都是通用芯片,运行时必须做海量实时决策,不停搬运数据、反复查询计算路径。Frozen v2则只为Gemini一个模型而生,把关键决策路径直接内建进电路,省下的每一步冗余都变成实打实的能效。此前的初版Frozen方案更激进,试图直接把模型权重烧进芯片,但因模型更新后芯片即报废而被搁置。Frozen v2是折中版:不烧权重,只固化架构,只要Gemini底层架构不大改,芯片就能持续使用。 谷歌之所以下这步险棋,根本原因是算力真的不够用了。Google Cloud已被迫开始拒绝外部客户订单,6月甚至签下合同每月向SpaceX支付9.2亿美元租用11万张英伟达GPU算力。一家全球最大的云计算公司向火箭公司租算力,这个画面足以说明AI军备竞赛的疯狂程度。全行业都在往推理芯片上押注:SambaNova、d-Matrix在做,OpenAI和微软在做,亚马逊有Trainium和Inferentia,英伟达自己也豪掷200亿美元拿下Groq的技术授权。
文章图片 2
但十倍能效的代价是僵化。只有后续Gemini沿用设计时的同一底层架构,Frozen v2才能继续工作。谷歌实际上是在赌未来几年不需要大改Gemini的架构。从纯Transformer到MoE混合专家,从密集推理到稀疏激活,模型架构迭代速度极快。因此Frozen v2不会做到TPU的产量规模,更像一次有限度的试验:赌对了就是印钞机,赌错了就当交学费。 这一趋势对国内算力市场的启示在于:当硬件和软件的边界越来越模糊,单纯堆叠通用GPU的思路正在触顶。星战科技在构建GPU算力平台时,已经意识到系统级优化比单卡性能更重要——通过算力调度、多模型灵活适配和异构资源管理,让不同芯片在各自擅长的任务上发挥最大价值,而不是等待某一张“万能卡”解决所有问题。 从更深层看,谷歌Frozen v2的出现标志着AI竞争正在从“拼模型”走向“拼物理”。软硬件协同的尽头是软硬件合体,谁能在芯片层面为自家模型量身定制计算路径,谁就能在能效上获得数量级的优势。这对国内算力基础设施的启示很明确:未来的竞争不仅是模型能力的比拼,更是从芯片架构到推理系统全栈优化的较量。星战科技在大模型API广场和算力调度上的持续投入,正是为了帮助企业在这一转变中保持灵活性——无论底层硬件如何演进,都能通过系统级调度实现最优的Token产出。