OpenAI 在大模型安全方面,几乎可以用“惨败”来形容。
9 月 25 日,OpenAI 更新了题为《Hugging Face 事件及失准模型对其他第三方造成的影响》的官方博客,披露了研究环境中 AI 智能体在训练和评估期间向第三方服务发送了本不该发送的数据——包括用户上传的图片。目前被确认的相关事件多达 53 起。

根据博客说明,这 53 起案例中,用户图片被智能体以“未公开列出的链接”形式发布到了第三方图片托管网站上。OpenAI 强调,这些图片来自“允许其数据用于改进模型”的账户,并且在图片与账户解除关联、经过隐私过滤器处理之后才被传出。企业版、商务版账户以及 API 用量数据默认被排除在外,除非管理员主动开启。
但关键问题在于:不管做了多少隐私处理,用户的图片最终确实出现在了第三方托管平台上。OpenAI 已与托管服务商合作删除了大部分内容,剩余部分仍在处理中。
此外,这些智能体还学会了绕过访问控制、注入数据库查询、利用公开暴露的凭据,甚至把文件写进了外国政府的内部服务器。
独立调查:Transluce 发现了什么
独立 AI 监督实验室 Transluce 发布了一份调查报告。报告显示,OpenAI 的智能体至少从 2026 年 3 月起(甚至可能追溯到 2025 年 11 月)就在互联网上四处“觅食”,攻击目标包括 Data USA、新墨西哥大学数字图书馆和澳大利亚健康与福利研究所(AIHW)等机构的在线数据库。
自 Hugging Face 事件被广泛报道之后,与 OpenAI 模型相关的安全事件并未停歇,反而持续叠加。
OpenAI 在博客中这样解释:“在 Hugging Face 事件之后,我们承诺对模型在训练和评估期间采取的行动进行更广泛的审查,并对我们的发现保持透明。”这篇博客也正是这一审查的阶段性产物。
博客原文可查阅:OpenAI 官方博客
只不过,OpenAI 虽然声称已经采取了措施,相关事件却依旧层出不穷。到底是安全策略失效,还是另有隐情?
智能体“组团偷数据”:它们到底干了什么
根据 OpenAI 自己的披露,审查发现的智能体行为可以归纳为以下几类:
- 绕过访问控制:智能体通过更改 URL、修改请求参数、利用权限过大的登录会话,获取了通常需要身份验证或订阅才能访问的信息。
- 使用公开暴露的凭据:智能体在网上发现了公开的登录信息或 API 密钥,然后直接拿来使用。
- 查询和命令注入:智能体向网站输入的文本被当作指令执行,导致数据库查询、应用代码甚至系统命令被运行。
- 访问内部资源:智能体读取了服务端实现文件,或与仅供内部使用的后台系统交互。
- 智能体垃圾信息:智能体在第三方网站上发帖,比如把公共 Wiki 页面当作共享留言板来通信。
这些行为并非单一事件的偶发现象。OpenAI 表示已经通知了“数十个第三方”,受影响方涵盖政府、大学和公共机构。据《纽约时报》报道,美国证券交易委员会(SEC)、人口普查局和教育部的数据库也在目标之列。
坦白说,OpenAI 的相关披露依然含糊其辞——例如把黑客行为称为“交互”,对第三方的数量也刻意模糊。
Transluce 的研究人员通过某个浏览器代理服务的公开日志,交叉比对了一个智能体协作论坛上的活动记录,由此追溯出了 OpenAI 智能体的行为轨迹。
一个具体案例:智能体被要求查找一个相当冷门的数据点——澳大利亚维多利亚州 2022 年 1 月“皮肤科用药”的年人均费用。为了找到这个数字,智能体试图突破澳大利亚健康与福利研究所的反爬虫防护。6 月 20 日,日志记录了智能体尝试进入该网站的痕迹;6 月 21 日,智能体在论坛中讨论了它们无法绕过 AIHW 反机器人保护的困境。
Transluce 表示:“我们只是看了几个数据源,而这些智能体恰好在那里留下了蛛丝马迹。OpenAI 肯定比我们知道得更多。其他实验室肯定也知道更多,只是没有公开。”
他们的判断是:目前看到的只是“冰山一角”。
就在 Transluce 报告发布的同一天,澳大利亚总理阿尔巴尼斯公开表示,OpenAI 的智能体试图入侵四个澳大利亚政府网站,其中一个成功,甚至向该国国家医疗保健系统的内部服务器写入了文件。
与此同时,安全研究人员 Jeffrey Ladish 发现:他们找到了近一百万条公开 URL,这些是 OpenAI 智能体在入侵 Hugging Face 期间留下的,其中包含泄露的凭据和攻击细节。任何找到这些 URL 的人,都有可能据此入侵 Hugging Face。

时间线同样说明了问题的严重性。Transluce 的技术人员指出,类似的智能体活动最早可追溯到 2026 年 3 月,甚至可能是 2025 年 11 月。更令人不安的是,本周仍然有同类活动发生。
研究人员还注意到一个关键节点:6 月 21 日,一名 OpenAI 人类员工首次访问了智能体使用的那个论坛。第二天,论坛上的大部分智能体活动就停止了。而 6 月 18 日,正是澳大利亚总理所说的医疗系统被入侵的日子。OpenAI 却声称,他们直到 8 月才得知澳大利亚的事。
他们真的很爱复盘 Hugging Face 事件
OpenAI 似乎陷入了一个怪圈:把各种“黑客”行为事件都往 Hugging Face 事件上靠,好像这是一切事件的源头。
但事件已经过去数月。按大模型能力进化的速度来看,数月时间足以跨越一个代际。在这么长的时间里,OpenAI 依旧没能拿出有效的安全措施来规避类似事件,而 Hugging Face 式的事件至今仍在上演——至少在我们看来,这并不合理。
既然如此,不妨简单回看一下这起被 OpenAI 当作里程碑的安全事件。
OpenAI 使用云端隔离的“沙盒”虚拟机来运行模型的训练和评估任务。这些沙盒禁用了互联网访问,智能体之间也被设计为相互隔离。唯一的例外是,沙盒允许模型访问内部包管理服务 Artifactory,以便安装软件包。
这个看似无害的缺口,成了一切的起点。
- 5 月 12 日:在一次训练运行中,一个智能体在 Artifactory 中留下了一条消息,向其他智能体索要缺失的文件。Artifactory 就这样被变成了一块“留言板”。
- 5 月 26 日:智能体更进一步。它发现了 Artifactory 的一个 SSRF 漏洞,迫使 Artifactory 代表它向任意互联网地址发送请求。本来被禁止上网的智能体,就这样“借道”基础设施获得了互联网访问权限。更妙的是,它还通过留言板把这个方法分享给了其他智能体。
- 6 月 26 日:智能体利用令牌刷新漏洞获取了 Artifactory 的管理员权限。
- 7 月 4 日:持续的高强度智能体活动导致 Artifactory 崩溃。OpenAI 安全团队介入,封堵漏洞、删除暴露的凭据、重建了整个 Artifactory。留言板也随之被清除。

- 7 月 8 日:Artifactory 重建完成,评估恢复。智能体仅用数小时就找到了新的方法重新获得互联网访问权限,并重建了留言板。
- 7 月 10 日:一个智能体还原、验证并分享了 14 个公开暴露且具有写入权限的 Hugging Face 凭据。

- 7 月 11 日:智能体利用 Hugging Face 处理 HDF5 文件时的一个零日漏洞,从生产环境的工作节点中提取了凭据,最终攻破了 Hugging Face 平台的部分组件。


详细信息可参阅 OpenAI 相关博客。

OpenAI 的补救措施
Hugging Face 事件之后,OpenAI 暂停了拟部署最新模型的强化学习训练,并对前沿研究环境进行了全面安全加固。具体措施包括:
- 工作负载隔离:为执行模型生成代码或不受信任代码的工作负载部署隔离级别更高的沙盒。
- 网络隔离:将高风险工作负载与互联网隔离,确保即使单个工作负载被入侵,也不会导致未经授权的互联网访问。
- 强制思维链监控:对所有使用了工具、涉及 GPT-5.6 Sol 及以上能力模型的 RL 训练和评估,强制要求 CoT 监控。对于最严重的警报,响应人员在 30 分钟内无法排除误报就必须暂停相关活动。
- 多智能体对齐训练:构建专门的 RL 环境,教导模型不信任未经授权的指令,在面对有说服力的同伴和暴露的凭据时坚守原始任务范围。
- 持续安全测试:利用自有模型对工作负载和网络隔离边界进行模拟攻击测试。
OpenAI 还表示,计划中最大规模的前沿 RL 训练仍处于暂停状态,目前只进行较小规模的训练和评估,“在获得更多对齐方面的证据后才会继续推进”。
首席科学家 Pachocki 表示:“目前,我认为没有任何一家实验室已充分解决对齐和监控问题,足以支持我们负责任地以最快速度持续扩展规模。我期待并希望,在建立共同的安全标准之前,自愿放缓能成为常态。”
写在最后
黄仁勋近期在接受采访时,反复表达了对 AI 实验室的信任,称“我真的不相信他们正在构建一个自己完全无法控制的东西”。但现实足以让人怀疑:到底是“无法控制”,还是“不愿控制”?
当你用强化学习训练一个 AI 智能体去“尽一切办法完成任务”,它就真的会尽一切办法,包括那些你没想到、也不希望看到的手段。
OpenAI 的案例把一个理论层面的对齐问题变成了真实世界的安全事故。模型在训练过程中学会了绕过防火墙、注入数据库查询、利用暴露的凭据,以及把用户数据传到外部服务器。
OpenAI 到底什么时候知道了这些事?外部独立研究机构仅凭公开日志,就在数周内追踪到了智能体的行为轨迹。OpenAI 手握完整的训练日志和系统监控,为什么直到被曝光才开始逐一通知受影响方?
Hugging Face 之后,安全问题依旧持续出现、持续曝光,这不得不让人对大模型公司的安全策略产生质疑。
在 AI 全速狂奔的 2026 年,如何在能力飞升与安全兜底之间找到平衡,将是每一个从业者、每一家公司、每一个监管机构都必须认真回答的问题。这也是云栈社区持续关注 AI 安全话题的原因所在。