找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

5590

积分

0

好友

777

主题
发表于 4 天前 | 查看: 4| 回复: 0

昨天,OpenAI 正式发布了 GPT-6 Astra,今天已全量上线。与此同时,The Information 的一篇独家报道把它的「老底」揭了个干净:Astra 的秘密武器,很可能是一种叫 recurrent depth(循环深度)的架构技术。

The Information 关于 GPT-6 Astra 循环深度技术的报道截图

随后研究者 @nrehiew_ 发了一条长推文,把 looped transformer 技术方向上的五篇关键论文串成了一条完整线索。我们不妨沿着这条时间线,看看 GPT-6 Astra 背后究竟藏着什么。

Looped Transformer 概念推文与递归编码器-解码器架构

一张时间表看懂循环深度的八年

循环深度技术发展时间线(2018-2026)

一、什么是 Looped Transformer?

普通 Transformer 的一次前向传播中,每层参数只被用一次;而 Looped Transformer(循环 Transformer)则会把同一组参数反复使用多次。 这些「循环」玩法,统统可以归到 recurrent depth 这个概念之下,大致有四种:

循环深度概念理解:整模型循环、层块循环、逐层循环

  1. 整模型循环(model-loop):把整个模型的输出隐状态重新作为输入喂回去——最经典的范式;
  2. 层块循环(block-loop):只循环中间某一段连续的层;
  3. 逐层循环(layer-loop):每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好;
  4. 潜变量条件化:用某种潜在输出作为后续循环的条件。

Recurrent Depth 三段式架构图:Prelude-Recurrent Block-Coda

Recurrent Depth 架构示意

最关键的一点在于:循环结构 是固定的、预先配置好的——每个 token 获得完全相同的计算量。这与「想多久算多久」的自适应计算形成鲜明对照。

二、一切的源头:Universal Transformers

Universal Transformers 论文封面

Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广。它把 Transformer 的可并行性和全局感受野,与 RNN 的循环归纳偏置(recurrent inductive bias)结合了起来——同一组参数在时间步(深度方向)上反复应用。

Universal Transformer 递归编码器-解码器结构图

Universal Transformer 结构图

UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。

为什么它重要? UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 方向的所有工作,思想源头基本都能回溯到这里。

三、定名之作:Scaling up Test-Time Compute with Latent Reasoning

Recurrent Depth 论文标题页

如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作。The Information 报道中 Astra 使用的技术,名字正出自这里。

3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」

主流推理模型(o 系列、R1 系列)依赖生成更多 token 来扩展测试时计算——思维链越长,算力消耗越多。这篇论文走了一条截然不同的路:通过迭代一个循环块,在测试时把网络「展开」到任意深度,让模型直接在潜在空间中隐式推理。

这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉难以用语言表达的思维类型。

不同循环深度下各基准准确率折线图

不同循环深度下的性能

3.2 怎么训练的?

  • 架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接;
  • 训练时随机采样循环次数(用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒;
  • 规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。

3.3 效果:3.5B 打出 50B 的等效表现

作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升,最高可达到约 50B 参数模型的等效计算水平——而物化参数只有 3.5B。

测试时循环次数与性能关系折线图

性能随测试时循环次数增长

和同训练配置、同数据的非循环基线对比,差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。

循环模型 vs 非循环基线 benchmark 对比表

循环 vs 非循环基线对比

3.4 最迷人的部分:潜在空间里到底发生了什么?

这篇论文最有「科幻感」的贡献,是对潜在空间动力学的可视化分析。作者发现,模型在循环过程中展现出了可识别的、类似「思考」的几何结构。

潜在空间 PCA 可视化散点图

数学问题中的潜在空间轨迹

四、免训练玩法:Training-Free Looped Transformers

Training-Free Looped Transformers 论文标题页

前面几项工作都需要从头训练循环结构,这篇论文则抛出了一个十分实用的问题:已经训练好的 开源模型,能不能直接在推理时「套个循环外壳」就变强? 答案是:可以,但姿势很重要。

免训练循环包装器架构流程对比图

免训练循环包装器

4.1 关键洞察:把 Transformer 块看作 ODE 的一步

朴素地把层块原样循环通常会掉点。突破口来自数学视角——pre-norm Transformer 块可以看作某个 ODE 上的前向欧拉步(forward Euler step)。这样一来,「循环」就不再是简单重复,而是把「一个大步」替换为「多个阻尼小步」,也就是对同一个数值近似做精细化(Runge-Kutta 风格)。

RK 积分与朴素循环验证损失对比散点图

RK 积分 vs 朴素循环

4.2 效果:7 个模型家族全面验证

论文在 7 个模型家族(稠密、稀疏 MoE、MLA+MoE)上做了开箱即用验证,全程没有逐格调参。

免训练循环在多个基准上的性能提升柱状图

各基准上的提升

从结果表看,提升覆盖面相当广:Qwen3-4B-Instruct MMLU-Pro 从 0.5714 → 0.5979(+2.64pp)、GPQA-Main +2.01pp;Llama-3.2 系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite 等也普遍有 0.7~2.3 个百分点的提升。

免训练循环结果表

主要结果表

论文还总结了一套实用配方:循环窗口 n=4 是甜点,n≥6 就会出现性能悬崖。这项工作最大的意义在于:循环深度不再是大厂的专利,任何人都可以在今天已有的开源模型上免费蹭到一波提升。

五、重要的泼冷水:LoopCoder-v2 发现「循环两次就够了」

LoopCoder-v2 论文标题页

如果说前面的论文都在说「循环真香」,这篇论文则贡献了本方向最重要的反直觉发现:循环不是越多越好,两次就是最优,三次以上反而回退。 这也是科普推文中「looping more than two times actually led to regressions」的出处。

5.1 工程创新:并行循环 Transformer(PLT)

顺序循环有个致命缺点:延迟和 KV cache 会随循环次数线性增长。作者提出的 PLT(Parallel Loop Transformer)借助跨循环位置偏移(CLP)和共享 KV 的门控滑窗注意力,把延迟与 KV 内存都压到近似常数,从而让「循环几次」成了一个可以自由研究的实验变量。

并行循环 Transformer 架构与收益分析图

并行循环 Transformer(arXiv:2606.18023, Figure 1)

5.2 主实验:18T token 从头训练 7B 代码模型

作者用相同配方从头训练了不同循环次数的 7B PLT 代码模型家族(18T token 预训练 + 对齐的指令微调),结果相当戏剧性。

LoopCoder-v2 主要结果表

主要结果(arXiv:2606.18023, Table 2)

5.3 为什么第三次循环反而有害?

诊断分析给出了清晰的机制解释。

循环贡献分解条形图

各循环的贡献分解(arXiv:2606.18023, Figure 7)

这个「强烈的非单调循环次数效应」是整个领域必须直面的约束。值得玩味的是:如果 Astra 真的用了 recurrent depth,OpenAI 大概率已经找到了绕过「两次就饱和」瓶颈的办法——否则根本解释不了 Astra 展现出的那种断崖式领先。至于究竟是什么办法,恐怕就是 OpenAI 不愿写进发布页的部分了。

六、规模化验证:Loop the Loopies!

Loop the Loopies 论文标题页

这是五篇论文中最「工程硬核」的一篇,正面回应了循环架构所面临的最大质疑:

给定 N 倍的预训练计算量,直接把参数量扩大 N 倍,通常比把模型循环 N 次更划算。

如果这个质疑成立,循环深度就永远只是学术玩具。Loopie 的任务就是打破这个魔咒。

6.1 Layer-loop:更好的循环粒度

论文系统对比了不同循环粒度的扩展性,发现逐层循环(layer-loop)比整模型循环(model-loop)扩展性更好——这也正是前文科普推文引用的结论。

Layer-loop 与 Model-loop 扩展性对比折线图

Layer-loop vs Model-loop 扩展性

6.2 Loopie 系列:20B-A2B 与 6B-A0.6B

Loopie 发布了两个 MoE 模型:20B 总参/2B 激活与 6B 总参/0.6B 激活。大量消融实验(包括与一个 vanilla 30B-A3B 模型的对照)表明:在相同计算预算下,Loopie 明显超越普通 Transformer 基线。

Loopie 主结果与吞吐对比图

Loopie 主结果

配合作者提出的新型后训练方法(SPT,Supervised Pre-training),Loopie 逐步发展出了强推理能力。与同量级 MoE 推理模型的对比相当有说服力。

Loopie 与同规模 MoE 模型对比

与同级 MoE 推理模型对比

这篇论文释放出的信号很明确:循环深度已经跨过了「学术玩具 → 可规模化训练范式」的临界点。时间线也颇为微妙——论文 7 月挂出,Astra 9 月发布。

1. Universal Transformers https://arxiv.org/abs/1807.03819
2. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach https://arxiv.org/abs/2502.05171
3. Training-Free Looped Transformers https://arxiv.org/abs/2605.23872
4. LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling  https://arxiv.org/abs/2606.18023 
5.Loop the Loopies! https://arxiv.org/abs/2607.16051
6. OpenAI. _GPT-6 Astra  https://openai.com/index/gpt-6-astra/=
7. Stephanie Palazzolo (The Information). _Secret Technique Behind OpenAI’s Astra Model Sparks Security Concerns_. 2026-09-02.
8.https://x.com/kimmonismus/status/2095045887131087357
9. https://x.com/nrehiew_/status/2095115984873062675

本文梳理的五篇论文,从架构机理到训练策略再到工程实现,基本串起了循环深度这条技术线的主干脉络。如果对这类前沿架构拆解感兴趣,也欢迎来 云栈社区 一起聊。




上一篇:三角洲行动登顶畅销总榜:天美用景德镇御窑联动让玩家为一只鸭疯狂
下一篇:知识图谱本体论+RAG+Agent落地:老刘说NLP社区纳新
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-10 17:00 , Processed in 1.261139 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表