找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入云原生前端项目实战教程50G互联网架构师面试指南
大模型全栈开发课程企业级DevOps全栈实践零基础产品经理就业课程

5031

积分

0

好友

650

主题
发表于 1 小时前 | 查看: 3| 回复: 0

GPT-6 Astra 发布前两天,The Information 抛出一篇报道,说 OpenAI 在这个模型里用了一项秘密技术——recurrent depth(循环深度)

Sebastian Raschka(前威斯康星大学教授,《Build a Reasoning Model (From Scratch)》作者)在 Astra 发布后写了一篇长文,把这个技术的来龙去脉全部拆了开来。

computer-use training workflow 总览
computer-use training workflow 总览

先把 Astra 本身放一边。文章的核心是:它把循环 Transformer(Looped Transformer)的机制、真实成本和研究谱系一次讲透了。

这个 Loop 到底是什么

一句话概括:让同一组 Transformer 层反复走多遍,而不是继续堆叠新层

三种 Transformer 架构对比:22 blocks 1 pass vs 22 blocks 2 passes vs 44 blocks 1 pass

Raschka 以刚开源的 Nanbeige4.2-3B 为例。这个模型只有 22 个 Transformer 块,但让输入循环通过这 22 个块 2 次——展开来看相当于一个 44 层的模型,而权重只存 22 份。第 23 次块应用复用的是第 1 块的权重,第 24 次复用第 2 块,依此类推。

Nanbeige 4.2 (3B) 模型架构:22层循环两次
Nanbeige4.2-3B:22个块的堆栈循环两次,橙色箭头标出回环

Nanbeige 4.2 (3B) 展开循环后的两遍处理流程
同一路径展开成两遍,共44次块应用,但只保存22组权重

这笔账得算清楚。参数确实省了——大约是常规 44 块模型的一半(Nanbeige 的 3B 参数里,embedding 和输出层就占了约 25%)。但另外两笔开销一分没省:前向和反向的计算量与 44 块模型相近,KV cache 也一样大——两次循环里同一层的中间状态并不相同。Nanbeige 试过跨遍共享 KV cache,体积减半但性能明显下降,发布版只能用独立缓存。顺带一提,如果只是"从头训练一个 44 层模型再循环压缩",效果不如从零直接训练循环结构;而循环次数上,2 次是性价比最优解,3 次以上收益递减、训练还不稳定。

传统加深与循环复用的参数对比
传统加深与循环复用的参数量对比

所以循环深度不是"免费加深",而更像用一半的权重预算,买回完整深度的计算。这引出一个自然的追问:既然不省算力,图什么?

循环次数还能"按需分配"

有意思的是,循环次数本身也可以是个灵活旋钮,而且这条线的源头比大多数人想的早得多。

2018 年的 Universal Transformer 就设计了自适应停止:一个小型可训练函数在每一步为每个位置输出"停止概率",累积超过阈值就停。不同 token 可以经历不同次数的循环——本质上是在按 token 分配算力。字节跳动的 Ouro-Thinking 2.6B 把这个思路推到极端:48 个块循环 4 次,共 192 次块应用,配一个学习到的出口门控。(Raschka 也指出了个尴尬细节:它在 HuggingFace 上的开源实现是先算完全部 4 遍再选出口,循环数实际被硬编码了。)

Universal Transformer 自适应停止机制
Universal Transformer 的自适应停止机制

2025 年的 Mixture-of-Recursions(MoR) 则把这个旋钮交给了路由器:一个学习出来的小型 router 看每个 token 的隐状态(包含上下文),决定它过几遍递归块——同一个词在不同位置可以享受不同深度。路由方式有两种:expert-choice 是每一步挑哪些 token 继续循环,token-choice 是开头一次性给每个 token 分配 1、2 或 3 次的路径。

MoR 的两种路由:expert-choice 与 token-choice
MoR 的两种路由:expert-choice 与 token-choice

MoR 的实验还送了一个重要教训:在最小的 135M 规模上,普通 Transformer 反而更好——只看小模型会得出"循环没用"的相反结论;模型够大之后,MoR 才追平甚至反超,尤其在小训练预算下。这也是为什么循环架构的验证必须上规模。

四种模型规模、三种算力预算下的验证损失对比
四种模型规模、三种算力预算下的验证损失对比

循环买到的,是推理而不是知识

到目前为止,"省参数的加深"听起来只是工程上的精打细算。真正让循环 Transformer 有分量的,是两项关于"它到底买到了什么"的研究。

第一项来自 Zhu et al.(2025 年 6 月),他们把"记忆"和"推理"拆开测。记忆实验里,固定参数量之下,循环几乎不增加模型能存储和检索的知识——容量只跟着独立参数量走。推理实验里,复用块却在不加任何参数的前提下提升了多步数学题的表现。两相对照,结论很干净:循环是"计算"机制,不是"存储"机制。它买到的是思考的算力,不是知识的容量。

VLD 模式下的信息熵对比:重复块对记忆容量的影响
Zhu et al. 的记忆实验:容量随参数量增长,与块应用次数关系不大

第二项是 2026 年 9 月的 SMELT,直接把这笔账算到了 54B 非嵌入参数的规模。它用的是 MoE 架构,中间一半的块应用两次,然后做三步补偿:缩小隐藏维度抵消多出来的计算量、增加专家数量把参数总量补回去、调整注意力头配置让 KV cache 保持可比。拟合 scaling 曲线后的结论是:达到相同的验证损失,循环版所需的训练算力少约 6.8% 到 18%。换句话说,在同等算力预算下,循环是净赚的。

SMELT 架构调整:宽度、专家数与块应用的对应关系
SMELT 的架构调整示例:宽度、专家数、块应用、参数、算力与KV cache的对应关系

在这两项之间,还有 Geiping et al. 的"潜在推理"模型值得一提:3.5B 参数、800B token 训练,4 个共享块夹在 2 个首块和 2 个末块之间,每轮循环把首块输出与上一轮的隐状态拼接、经线性投影再送入共享块。推理时循环次数可以固定预算(8、32、64 次),也可以用相邻两轮输出分布的 KL 散度低于阈值来自适应停止。收益因任务而异:常识类的 HellaSwag 大约 8 轮就饱和,而 GSM8K 和 HumanEval 这类多步推理任务确实从更多循环中受益

Geiping 潜在推理模型:共享块循环32遍的概念图
Geiping et al. 潜在推理模型的概念图:拼接、投影与循环

隐藏思维链是个伪危机吗

回到爆料的另一个卖点:循环让 Astra 的推理"更难监控"。

先看 Astra 本身。它仍是推理模型,训练范式没有根本变化——RLVR 加中间推理痕迹。据黄仁勋透露,模型本体在约 10 万块 Grace Blackwell GPU 上训练;OpenAI 还买了数万台 Mac mini 和 Mac Studio,不过 Mac 只是 RL 的交互环境:任务提示、截图、模型预测鼠标键盘动作、harness 执行、再截图,循环往复,用成功信号训练——Astra 在计算机使用上的跃升是这样做出来的。

Astra 计算机使用能力的 RL 训练闭环
Astra 计算机使用能力的 RL 训练循环

争议点在 token 用量:Astra 在同等准确率下,比 GPT-5.6 Sol 用了明显更少的 token。The Information 把这解读为"推理被藏进架构、监控性倒退"。Raschka 的判断相反:更短的思维链更可能说明模型错得更少、回溯更少——他给了一个很贴的类比,准备充分的学生,考试时草稿纸用得更少。旁证是反方向的:能力更弱的 Luna 在接近的性能下比 Sol 多用了约 80% 的 token。

GPT-6 Astra 在四项基准测试中随输出 token 变化的准确率
GPT-6 Astra 各基准随输出 token 数变化的准确率

参考来源:


GPT-6 Astra, Looped Transformers, and Hidden Reasoning
https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and



上一篇:Anthropic公开RSI落地方法论:Claude主导26%研发与3万Agent监控
下一篇:缓存一致性排查:凌晨三点烧烤店引出的 Redis 与 MySQL 并发脏数据
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-21 01:50 , Processed in 0.636647 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表