昨天,OpenAI 正式发布了 GPT-6 Astra,今天已全量上线。与此同时,The Information 的一篇独家报道把它的「老底」揭了个干净:Astra 的秘密武器,很可能是一种叫 recurrent depth(循环深度)的架构技术。

随后研究者 @nrehiew_ 发了一条长推文,把 looped transformer 技术方向上的五篇关键论文串成了一条完整线索。我们不妨沿着这条时间线,看看 GPT-6 Astra 背后究竟藏着什么。

一张时间表看懂循环深度的八年

普通 Transformer 的一次前向传播中,每层参数只被用一次;而 Looped Transformer(循环 Transformer)则会把同一组参数反复使用多次。 这些「循环」玩法,统统可以归到 recurrent depth 这个概念之下,大致有四种:

- 整模型循环(model-loop):把整个模型的输出隐状态重新作为输入喂回去——最经典的范式;
- 层块循环(block-loop):只循环中间某一段连续的层;
- 逐层循环(layer-loop):每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好;
- 潜变量条件化:用某种潜在输出作为后续循环的条件。

Recurrent Depth 架构示意
最关键的一点在于:循环结构 是固定的、预先配置好的——每个 token 获得完全相同的计算量。这与「想多久算多久」的自适应计算形成鲜明对照。

Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广。它把 Transformer 的可并行性和全局感受野,与 RNN 的循环归纳偏置(recurrent inductive bias)结合了起来——同一组参数在时间步(深度方向)上反复应用。

Universal Transformer 结构图
UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。
为什么它重要? UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 方向的所有工作,思想源头基本都能回溯到这里。
三、定名之作:Scaling up Test-Time Compute with Latent Reasoning

如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作。The Information 报道中 Astra 使用的技术,名字正出自这里。
3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」
主流推理模型(o 系列、R1 系列)依赖生成更多 token 来扩展测试时计算——思维链越长,算力消耗越多。这篇论文走了一条截然不同的路:通过迭代一个循环块,在测试时把网络「展开」到任意深度,让模型直接在潜在空间中隐式推理。
这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉难以用语言表达的思维类型。

不同循环深度下的性能
3.2 怎么训练的?
- 架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接;
- 训练时随机采样循环次数(用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒;
- 规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。
3.3 效果:3.5B 打出 50B 的等效表现
作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升,最高可达到约 50B 参数模型的等效计算水平——而物化参数只有 3.5B。

性能随测试时循环次数增长
和同训练配置、同数据的非循环基线对比,差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。

循环 vs 非循环基线对比
3.4 最迷人的部分:潜在空间里到底发生了什么?
这篇论文最有「科幻感」的贡献,是对潜在空间动力学的可视化分析。作者发现,模型在循环过程中展现出了可识别的、类似「思考」的几何结构。

数学问题中的潜在空间轨迹

前面几项工作都需要从头训练循环结构,这篇论文则抛出了一个十分实用的问题:已经训练好的 开源模型,能不能直接在推理时「套个循环外壳」就变强? 答案是:可以,但姿势很重要。

免训练循环包装器
朴素地把层块原样循环通常会掉点。突破口来自数学视角——pre-norm Transformer 块可以看作某个 ODE 上的前向欧拉步(forward Euler step)。这样一来,「循环」就不再是简单重复,而是把「一个大步」替换为「多个阻尼小步」,也就是对同一个数值近似做精细化(Runge-Kutta 风格)。

RK 积分 vs 朴素循环
4.2 效果:7 个模型家族全面验证
论文在 7 个模型家族(稠密、稀疏 MoE、MLA+MoE)上做了开箱即用验证,全程没有逐格调参。

各基准上的提升
从结果表看,提升覆盖面相当广:Qwen3-4B-Instruct MMLU-Pro 从 0.5714 → 0.5979(+2.64pp)、GPQA-Main +2.01pp;Llama-3.2 系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite 等也普遍有 0.7~2.3 个百分点的提升。

主要结果表
论文还总结了一套实用配方:循环窗口 n=4 是甜点,n≥6 就会出现性能悬崖。这项工作最大的意义在于:循环深度不再是大厂的专利,任何人都可以在今天已有的开源模型上免费蹭到一波提升。
五、重要的泼冷水:LoopCoder-v2 发现「循环两次就够了」

如果说前面的论文都在说「循环真香」,这篇论文则贡献了本方向最重要的反直觉发现:循环不是越多越好,两次就是最优,三次以上反而回退。 这也是科普推文中「looping more than two times actually led to regressions」的出处。
顺序循环有个致命缺点:延迟和 KV cache 会随循环次数线性增长。作者提出的 PLT(Parallel Loop Transformer)借助跨循环位置偏移(CLP)和共享 KV 的门控滑窗注意力,把延迟与 KV 内存都压到近似常数,从而让「循环几次」成了一个可以自由研究的实验变量。

并行循环 Transformer(arXiv:2606.18023, Figure 1)
5.2 主实验:18T token 从头训练 7B 代码模型
作者用相同配方从头训练了不同循环次数的 7B PLT 代码模型家族(18T token 预训练 + 对齐的指令微调),结果相当戏剧性。

主要结果(arXiv:2606.18023, Table 2)
5.3 为什么第三次循环反而有害?
诊断分析给出了清晰的机制解释。

各循环的贡献分解(arXiv:2606.18023, Figure 7)
这个「强烈的非单调循环次数效应」是整个领域必须直面的约束。值得玩味的是:如果 Astra 真的用了 recurrent depth,OpenAI 大概率已经找到了绕过「两次就饱和」瓶颈的办法——否则根本解释不了 Astra 展现出的那种断崖式领先。至于究竟是什么办法,恐怕就是 OpenAI 不愿写进发布页的部分了。
六、规模化验证:Loop the Loopies!

这是五篇论文中最「工程硬核」的一篇,正面回应了循环架构所面临的最大质疑:
给定 N 倍的预训练计算量,直接把参数量扩大 N 倍,通常比把模型循环 N 次更划算。
如果这个质疑成立,循环深度就永远只是学术玩具。Loopie 的任务就是打破这个魔咒。
6.1 Layer-loop:更好的循环粒度
论文系统对比了不同循环粒度的扩展性,发现逐层循环(layer-loop)比整模型循环(model-loop)扩展性更好——这也正是前文科普推文引用的结论。

Layer-loop vs Model-loop 扩展性
6.2 Loopie 系列:20B-A2B 与 6B-A0.6B
Loopie 发布了两个 MoE 模型:20B 总参/2B 激活与 6B 总参/0.6B 激活。大量消融实验(包括与一个 vanilla 30B-A3B 模型的对照)表明:在相同计算预算下,Loopie 明显超越普通 Transformer 基线。

Loopie 主结果
配合作者提出的新型后训练方法(SPT,Supervised Pre-training),Loopie 逐步发展出了强推理能力。与同量级 MoE 推理模型的对比相当有说服力。

与同级 MoE 推理模型对比
这篇论文释放出的信号很明确:循环深度已经跨过了「学术玩具 → 可规模化训练范式」的临界点。时间线也颇为微妙——论文 7 月挂出,Astra 9 月发布。
1. Universal Transformers https://arxiv.org/abs/1807.03819
2. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach https://arxiv.org/abs/2502.05171
3. Training-Free Looped Transformers https://arxiv.org/abs/2605.23872
4. LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling https://arxiv.org/abs/2606.18023
5.Loop the Loopies! https://arxiv.org/abs/2607.16051
6. OpenAI. _GPT-6 Astra https://openai.com/index/gpt-6-astra/=
7. Stephanie Palazzolo (The Information). _Secret Technique Behind OpenAI’s Astra Model Sparks Security Concerns_. 2026-09-02.
8.https://x.com/kimmonismus/status/2095045887131087357
9. https://x.com/nrehiew_/status/2095115984873062675
本文梳理的五篇论文,从架构机理到训练策略再到工程实现,基本串起了循环深度这条技术线的主干脉络。如果对这类前沿架构拆解感兴趣,也欢迎来 云栈社区 一起聊。