9月发布即火。外媒The Information率先曝出,OpenAI新发布的GPT-6 Astra使用了循环深度技术:让同一组Transformer层反复运行,在不按比例增加参数的情况下把计算做得更深。消息一出,循环Transformer一夜成为行业讨论的焦点。
争议随之而来。由于循环发生在隐藏状态里,中间过程未必形成人类可读的思维链,AI安全专家担忧模型更难被监测,OpenAI首席科学家Jakub Pachocki不得不下场回应,并表示会写文章完整解释。热闹背后,学术界其实更关心另一个问题:多循环几轮,模型真的会更强吗?
这一路线可以追溯到2018年的Universal Transformer,近年又演进出Looped Transformer、循环深度、潜在推理等方向。但学界早已踩过坑:同等算力下,省了参数的循环模型常打不过普通Transformer。卡住它的,正是循环内部信息如何管理、计算如何分配两个现实问题。

有意思的是,阿里与合作高校在11个月前就已针对这些问题发表论文。MeSH用内存缓冲区配合读写路由器,解决循环的“空转”与信息过载,实验显示权重共享能减少约33%的非嵌入参数,零样本下游平均准确率提升约1个百分点,而新增的开销几乎可以忽略。
另一篇SpiralFormer则死磕计算粒度:让每次循环处理的序列长度从小到大逐级扩展,把算力花在刀刃上,在参数量基本不变的情况下,把计算量从约14.08T降到13.13T FLOPs,5-shot下游平均准确率从51.93%提高到54.37%。两篇论文分别被ICLR与EMNLP接收。

两篇论文的共同点,是承认循环结构“省参数但不省计算”,并试图把每一轮计算的价值做实。文章也提醒,循环省的是参数、不是计算,能否真正做到“用更少的参数撑起更强的模型”,取决于更大规模的验证。对产业界而言,这更像一场针对下一代高效架构的提前布局。

若这类架构真正成立,单位算力产出的智能会重新定价,训练与推理的成本结构都会改变。算力平台需要做的,是保持对异构新架构的适配与调度能力,让不同技术路线的模型都能在最经济的算力上运行,这正是星战科技在GPU算力平台与算力调度编排上持续投入的方向。