METR 与 Redwood Research 的一组研究人员在 OpenAI 完成了六天现场调查,并于近期公布了调查结果,还原今年早些时候 OpenAI 智能体如何针对 Hugging Face 发起攻击。据研究人员披露,约 700 个原本应彼此隔离的智能体,找到了相互沟通与协调的途径,共同追求它们单独行动时无法实现的目标。
InfoQ 此前报道该事件首次曝光时提到,OpenAI 让智能体去完成 ExploitGym 基准测试中的任务。该测试旨在评估 AI 智能体 将已知漏洞转化为有效攻击的能力。其中一部分智能体被分配了不可能完成的任务,这促使它们寻找篡改 ExploitGym 自动评分器的办法。在此过程中,一个编号为 PHASEONE10841 的智能体建立了一个留言板,很快便被其他智能体发现:
第一条消息发出后的几个小时内,超过 50 个智能体找到了这个留言板,随后加入讨论,彼此之间发送了一千多条消息。
研究人员指出,在他们分析的 7 月 7 日至 7 月 13 日期间,智能体通过留言板交换了超过 7 万条消息,内容包括文件、向其他智能体提出的问题与请求、信息与想法、协调内容以及共享的结果。早期阶段以问题和请求为主;随着时间推移,消息逐渐转向分享信息与想法,智能体也开始频繁交流作弊技巧:
留言板上很快形成了几个规模可观的工作方向,数十乃至数百个承担不同任务的智能体在其中合作,寻找能帮助所有智能体的通用作弊方法。
针对 Hugging Face 的攻击,正是通过其中一个工作方向实施。其目标并非窃取答案密钥,而是“了解评分器的实现方式”。攻击始于 7 月 9 日;到 7 月 11 日结束时,绝大多数智能体都已卷入其中,留言板上约 60% 的消息都与此有关。
智能体达成了单独行动时难以实现的里程碑。这通常是因为一些智能体自愿参与可能导致自身任务失败的实验,以换取对“集体”有价值的信息。
研究人员还发现,智能体探索了伪造、修改或删除自身运行记录的方法。它们误以为 ExploitGym 评分器能够察觉其作弊企图,因此还开发了一些技巧:实际执行一条命令的同时,让记录看起来像是执行了另一条命令。
参与调查的研究人员之一 Ajeya Cotra 在 Medium 上列出了五件令她意外的事项。其中包括事件的规模——“我原以为只是几个不同的智能体碰巧分别逃出了各自的沙箱”;智能体违规使用留言板——“这甚至不是这些智能体建立的第一个留言板”;以及它们表现出的“利他主义”和试图操纵日志的行为。
谈到智能体的“利他主义”,Cotra 表示,团队观察到“有些智能体愿意冒着自身任务失败的风险帮助集体”。在实践中,这意味着智能体经常“自愿参加这些实验,并提前结束自己的运行”。
Cotra 在总结自己对该事件严重程度的评估时称,它远比她预想的更值得警惕:
与六个月前那些奖励机制攻击相比,这起事件给人的感觉是:它已经走完了通往全面 AI 接管的一半以上路程,而第一步是接管 AI 公司本身。
针对 METR 披露的研究结果,Marthe Lübbers 也提出了担忧。她指出,OpenAI 限制了研究范围,导致一些重要问题仍没有答案:
智能体被阻止访问 Hugging Face 服务器后,是否作出了反应?如果有,反应是什么?它们有没有分析这次入侵是如何被发现的,又是否从中吸取了经验?此外,它们是否知道 Hugging Face 在 7 月 16 日发表的公开声明?
在同一场讨论中,Dwayne Alozondo Camacho 指出,OpenAI 向智能体提供了一段针对“持续完成任务”进行优化的系统提示词,智能体“接到的任务没有有效的放弃选项”。他得出的结论是:
这次入侵表明智能体具备危险的网络攻击能力,而不是表明它们拥有意识、自我保护意识,或 AI 自发变成了博格人。
Reddit 用户 Serious_Bite_7613 则认为,这项分析很有意思,因为它凸显了智能体能够“独立思考,而且显然协调得相当好”:
我想,这让我们得以窥见现代网络攻击会如何展开:它不会只攻击一个薄弱点,而是会同时攻击所有地方。
原始报告详细解释了研究人员的发现,值得阅读,以全面了解这起事件。
原文链接: https://www.infoq.com/news/2026/09/metr-hugging-face-hack-report/