GPT-6 Astra 发布前两天,The Information 抛出一篇报道,说 OpenAI 在这个模型里用了一项秘密技术——recurrent depth(循环深度)。
Sebastian Raschka(前威斯康星大学教授,《Build a Reasoning Model (From Scratch)》作者)在 Astra 发布后写了一篇长文,把这个技术的来龙去脉全部拆了开来。

computer-use training workflow 总览
先把 Astra 本身放一边。文章的核心是:它把循环 Transformer(Looped Transformer)的机制、真实成本和研究谱系一次讲透了。
这个 Loop 到底是什么
一句话概括:让同一组 Transformer 层反复走多遍,而不是继续堆叠新层。

Raschka 以刚开源的 Nanbeige4.2-3B 为例。这个模型只有 22 个 Transformer 块,但让输入循环通过这 22 个块 2 次——展开来看相当于一个 44 层的模型,而权重只存 22 份。第 23 次块应用复用的是第 1 块的权重,第 24 次复用第 2 块,依此类推。

Nanbeige4.2-3B:22个块的堆栈循环两次,橙色箭头标出回环

同一路径展开成两遍,共44次块应用,但只保存22组权重
这笔账得算清楚。参数确实省了——大约是常规 44 块模型的一半(Nanbeige 的 3B 参数里,embedding 和输出层就占了约 25%)。但另外两笔开销一分没省:前向和反向的计算量与 44 块模型相近,KV cache 也一样大——两次循环里同一层的中间状态并不相同。Nanbeige 试过跨遍共享 KV cache,体积减半但性能明显下降,发布版只能用独立缓存。顺带一提,如果只是"从头训练一个 44 层模型再循环压缩",效果不如从零直接训练循环结构;而循环次数上,2 次是性价比最优解,3 次以上收益递减、训练还不稳定。

传统加深与循环复用的参数量对比
所以循环深度不是"免费加深",而更像用一半的权重预算,买回完整深度的计算。这引出一个自然的追问:既然不省算力,图什么?
循环次数还能"按需分配"
有意思的是,循环次数本身也可以是个灵活旋钮,而且这条线的源头比大多数人想的早得多。
2018 年的 Universal Transformer 就设计了自适应停止:一个小型可训练函数在每一步为每个位置输出"停止概率",累积超过阈值就停。不同 token 可以经历不同次数的循环——本质上是在按 token 分配算力。字节跳动的 Ouro-Thinking 2.6B 把这个思路推到极端:48 个块循环 4 次,共 192 次块应用,配一个学习到的出口门控。(Raschka 也指出了个尴尬细节:它在 HuggingFace 上的开源实现是先算完全部 4 遍再选出口,循环数实际被硬编码了。)

Universal Transformer 的自适应停止机制
2025 年的 Mixture-of-Recursions(MoR) 则把这个旋钮交给了路由器:一个学习出来的小型 router 看每个 token 的隐状态(包含上下文),决定它过几遍递归块——同一个词在不同位置可以享受不同深度。路由方式有两种:expert-choice 是每一步挑哪些 token 继续循环,token-choice 是开头一次性给每个 token 分配 1、2 或 3 次的路径。

MoR 的两种路由:expert-choice 与 token-choice
MoR 的实验还送了一个重要教训:在最小的 135M 规模上,普通 Transformer 反而更好——只看小模型会得出"循环没用"的相反结论;模型够大之后,MoR 才追平甚至反超,尤其在小训练预算下。这也是为什么循环架构的验证必须上规模。

四种模型规模、三种算力预算下的验证损失对比
循环买到的,是推理而不是知识
到目前为止,"省参数的加深"听起来只是工程上的精打细算。真正让循环 Transformer 有分量的,是两项关于"它到底买到了什么"的研究。
第一项来自 Zhu et al.(2025 年 6 月),他们把"记忆"和"推理"拆开测。记忆实验里,固定参数量之下,循环几乎不增加模型能存储和检索的知识——容量只跟着独立参数量走。推理实验里,复用块却在不加任何参数的前提下提升了多步数学题的表现。两相对照,结论很干净:循环是"计算"机制,不是"存储"机制。它买到的是思考的算力,不是知识的容量。

Zhu et al. 的记忆实验:容量随参数量增长,与块应用次数关系不大
第二项是 2026 年 9 月的 SMELT,直接把这笔账算到了 54B 非嵌入参数的规模。它用的是 MoE 架构,中间一半的块应用两次,然后做三步补偿:缩小隐藏维度抵消多出来的计算量、增加专家数量把参数总量补回去、调整注意力头配置让 KV cache 保持可比。拟合 scaling 曲线后的结论是:达到相同的验证损失,循环版所需的训练算力少约 6.8% 到 18%。换句话说,在同等算力预算下,循环是净赚的。

SMELT 的架构调整示例:宽度、专家数、块应用、参数、算力与KV cache的对应关系
在这两项之间,还有 Geiping et al. 的"潜在推理"模型值得一提:3.5B 参数、800B token 训练,4 个共享块夹在 2 个首块和 2 个末块之间,每轮循环把首块输出与上一轮的隐状态拼接、经线性投影再送入共享块。推理时循环次数可以固定预算(8、32、64 次),也可以用相邻两轮输出分布的 KL 散度低于阈值来自适应停止。收益因任务而异:常识类的 HellaSwag 大约 8 轮就饱和,而 GSM8K 和 HumanEval 这类多步推理任务确实从更多循环中受益。

Geiping et al. 潜在推理模型的概念图:拼接、投影与循环
隐藏思维链是个伪危机吗
回到爆料的另一个卖点:循环让 Astra 的推理"更难监控"。
先看 Astra 本身。它仍是推理模型,训练范式没有根本变化——RLVR 加中间推理痕迹。据黄仁勋透露,模型本体在约 10 万块 Grace Blackwell GPU 上训练;OpenAI 还买了数万台 Mac mini 和 Mac Studio,不过 Mac 只是 RL 的交互环境:任务提示、截图、模型预测鼠标键盘动作、harness 执行、再截图,循环往复,用成功信号训练——Astra 在计算机使用上的跃升是这样做出来的。

Astra 计算机使用能力的 RL 训练循环
争议点在 token 用量:Astra 在同等准确率下,比 GPT-5.6 Sol 用了明显更少的 token。The Information 把这解读为"推理被藏进架构、监控性倒退"。Raschka 的判断相反:更短的思维链更可能说明模型错得更少、回溯更少——他给了一个很贴的类比,准备充分的学生,考试时草稿纸用得更少。旁证是反方向的:能力更弱的 Luna 在接近的性能下比 Sol 多用了约 80% 的 token。

GPT-6 Astra 各基准随输出 token 数变化的准确率
参考来源:
GPT-6 Astra, Looped Transformers, and Hidden Reasoning
https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and