
近日公开的一项漏洞涉及 OpenAI、Anthropic 和谷歌在 API 调用之间传递隐藏 AI 推理的方式,研究人员借此从会话日志中恢复了内部推理内容和机密信息,包括 API 密钥和密码。
这一弱点直接影响三家提供商推理 API 所使用的加密推理对象。在一个会话中创建的推理块可以被重放到另一个会话中,甚至在测试期间,可将其交给同一提供商家族中较弱的模型,使其泄露隐藏内容。
《Stealing Reasoning Traces from Proprietary LLM APIs》(从专有 LLM API 窃取推理轨迹)一文的作者团队演示了四种滥用路径:窃取专有推理以进行模型蒸馏、从其他用户已发布的轨迹中提取私有数据、恢复隐藏在安全可见答案背后的有害内容,以及在不透明的推理块中隐藏提示注入。
在 6708 条公开的 Agent 轨迹中,该团队解码了 315320 个思考块。排除基准测试来源后,他们从真实用户会话中统计出 704 个不同的隐私产物,包括 62 个 API 密钥、33 个密码、24 个访问令牌和 7 个私钥。
这种跨用户攻击并不能任意访问私人聊天记录。它需要获取一个加密推理块(例如发布在 Agent 日志中的推理块),以及访问同一提供商兼容模型的 API 权限。
研究人员已将这些发现披露给受影响的模型提供商(OpenAI、Anthropic 和谷歌)以及微软和 Hugging Face,并表示在采取缓解措施后,所演示的攻击已不再奏效。他们的可复现性声明称,截至 2026 年 8 月,主要的提取攻击已无法复现。
该报告未记录现实世界中发生的恶意利用。建议开发者在共享轨迹时剥离推理块和不透明的推理字段,并且即使可见文本已被清理,也应避免提交原始 API 转录内容。
Part 01:跨 API 调用保留推理状态的设计
问题的根源在于一种设计——当会话状态以手动或无状态方式管理时,需要在 API 调用之间保留推理过程。OpenAI 可以返回加密的推理项,应用程序可将其与手动管理的历史记录一同重放;Anthropic 在加密签名中携带完整推理过程;谷歌则使用加密的思维签名。这些对象在保留推理状态的同时,不会直接将底层明文暴露给客户端。

加密本身并未被破解,攻击也无需获取加密密钥。它依赖于提供商接受并处理完整的不透明块。
在测试过程中,论文发现这些对象具有跨会话、跨用户、跨模型的可移植性,从而使较弱的兼容模型充当作者所称的“模糊”解码器:Claude Haiku 4.5 解码 Claude 轨迹,GPT-5.6 Luna 解码 GPT 轨迹,Gemini Robotics ER-1.6 解码 Gemini 轨迹。解码器在提示下将较强模型产生的推理过程转录出来。
Part 02:实际影响:隐私泄露与隐形注入
这种跨用户行为使已发布的 Agent 日志演变成更为严峻的安全问题。在该团队恢复的 704 个非基准测试产物中,有 64 个仅出现在隐藏推理中,在可见轨迹中没有任何踪迹。因此,即使清理了可读的对话内容,机密信息仍可能残留于不透明块中,而被另一个账户重放。
该研究展示的暴露范围是有限的:受影响的是那些发布了原始 Agent 日志且未剥离推理对象的开发者,这是一个可识别的群体,而非所有 API 用户,但未必是唯一面临风险的群体。
同样的可移植性还催生了一个隐形提示注入的 PoC。该团队构造了一个携带恶意指令的不透明推理块,随后将其重放到一个无关任务中,导致接收模型添加了一个由攻击者指定的上传操作,而注入的指令并未出现在可见文本中。
实际上,他们没有专有推理的真值明文作为对照,因此无法保证每条重建的轨迹都是精确副本。他们的保真度检查依赖于推理令牌数和定性比较,提取的长度通常与提供商报告的思考令牌数基本一致。
Part 03:厂商回应与遗留问题
当前的供应商文档显示,加密推理仍是这些 API 的一部分,但处理方式已发生变化。OpenAI 仍告知开发者在手动管理无状态历史记录时重放加密推理项,而谷歌表示,当会话切换模型时,其后端会处理思维兼容性。
Anthropic 现在表示,思考块与产生它们的模型绑定,在切换模型时应将其剥离,因为其他模型会忽略这些思考块。
这一披露引发的若干问题在公开记录中仍未得到解答。迄今为止,三家提供商均未公开承认这一漏洞,也没有任何一家将其当前文档与本项研究联系起来。因此,关于所演示攻击不再奏效的说法仅基于研究人员自己的可复现性声明,而非供应商的确认。
公开记录还显示,该团队解码了数十万个已存在于公共代码仓库中的推理块,但并未说明这些已发布的推理块是否仍然可以被解码——这是与新增攻击是否仍能成功相互独立的一个问题。
这项工作建立在约翰霍普金斯大学密码学家 Matthew Green 于 5 月进行的研究基础之上。Green 当时证明加密推理块可以在会话和账户之间重放,但未能提出可靠的机密提取技术。
Green 表示,他通过漏洞赏金计划将重放行为报告给了 OpenAI 和 Anthropic;据他所述,OpenAI 称该报告无法复现,Anthropic 则表示未在重放或侧信道行为中看到安全影响。
这篇新论文将重放行为扩展为更广泛的提取方法,并系统地记录了隐私后果。
参考来源:
OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models' Reasoning