过去一周,全球 AI 开发者都在追问同一个问题:突然出现在 OpenRouter 上的匿名模型 Ox Alpha 来自哪家实验室?它没有公布开发者、参数规模和技术报告,却在短短几天内冲上热门榜,凭借代码生成、复杂推理和长时间 Agent 任务的表现引发大量猜测。昨晚谜底揭晓:它正是智谱最新发布的 GLM-5.3-Flash。
Ox Alpha 最早于 8 月 20 日匿名登陆 OpenRouter,测试版本提供 104 万 Token 上下文,并一度向用户免费开放。这种近乎“无限量免费”的测试方式,让它在几天内获得大量真实用户。Stripe 联合创始人 Patrick Collison 体验后表示“非常令人印象深刻”,不少开发者发现它在理解大型代码仓库和连续调用工具方面,并不像一款普通的低成本模型。

匿名上线更像一次大规模公开盲测:先隐藏厂商与模型名称,让开发者根据实际效果打分,再公布身份与技术细节。相比直接发布基准测试成绩,这种方式能减少品牌认知对评价的影响,也能在正式发布前获得更大规模的真实负载与用户反馈。智谱此前在 Pony Alpha 上也采用过类似策略。
GLM-5.3-Flash 是一款混合专家模型,3200 亿总参数,每次处理 Token 只激活约 180 亿参数。与 GLM-4.5 系列相比,激活参数从 320 亿降到 180 亿,模型层数从 92 层减到 45 层。它的逻辑是用更少的实际计算量保留接近大模型的能力,在模型能力、推理速度与部署成本之间寻找平衡,这也是“Flash”的题中之义。

最值得注意的是,匿名测试期间产生的全部流量,均由部署在国产 AI 芯片上的大规模集群承载。国产芯片承接头部模型的大规模公测流量,意味着国产算力已经从“能用”走向“扛得住真实负载”。对行业来说,这是一个比 Benchmark 数字更有说服力的信号,也凸显了国产算力与国产模型的协同价值,这与星战科技推动国产算力落地、服务大模型 API 生态的方向高度一致。
从行业视角看,“盲测+免费”的发布方式,正在成为模型厂商获取真实反馈、验证工程能力的新打法。它考验的不只是模型效果,更是推理集群的稳定性与成本控制能力——能否承载海量并发流量,本身就是一次压力测试。

一个匿名模型引发的全球关注,折射出国产大模型的进步正在被海外开发者重新认识。模型能力之外,推理成本、国产算力支撑与生态服务能力,正在共同决定一款模型能走多远。