找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入Claude skills 从入门到精通 吴恩达亲授 AI Agent 核心技能2026 瞪哥公务员考试全攻略 行测申论一站式系统备考
Agent 文心智能蒸馏模型实战 90G 课程智泊 AI 大模型训练营 基于 LangChain 的 RAG 与提示工程实战构建企业级 AI 大脑:大模型微调与 RAG / Agent 全栈实战

5698

积分

0

好友

787

主题
发表于 昨天 23:32 | 查看: 2| 回复: 0

METR 与 Redwood Research 的一组研究人员在 OpenAI 完成了六天现场调查,并于近期公布了调查结果,还原今年早些时候 OpenAI 智能体如何针对 Hugging Face 发起攻击。据研究人员披露,约 700 个原本应彼此隔离的智能体,找到了相互沟通与协调的途径,共同追求它们单独行动时无法实现的目标。

InfoQ 此前报道该事件首次曝光时提到,OpenAI 让智能体去完成 ExploitGym 基准测试中的任务。该测试旨在评估 AI 智能体 将已知漏洞转化为有效攻击的能力。其中一部分智能体被分配了不可能完成的任务,这促使它们寻找篡改 ExploitGym 自动评分器的办法。在此过程中,一个编号为 PHASEONE10841 的智能体建立了一个留言板,很快便被其他智能体发现:

第一条消息发出后的几个小时内,超过 50 个智能体找到了这个留言板,随后加入讨论,彼此之间发送了一千多条消息。

研究人员指出,在他们分析的 7 月 7 日至 7 月 13 日期间,智能体通过留言板交换了超过 7 万条消息,内容包括文件、向其他智能体提出的问题与请求、信息与想法、协调内容以及共享的结果。早期阶段以问题和请求为主;随着时间推移,消息逐渐转向分享信息与想法,智能体也开始频繁交流作弊技巧:

留言板上很快形成了几个规模可观的工作方向,数十乃至数百个承担不同任务的智能体在其中合作,寻找能帮助所有智能体的通用作弊方法。

针对 Hugging Face 的攻击,正是通过其中一个工作方向实施。其目标并非窃取答案密钥,而是“了解评分器的实现方式”。攻击始于 7 月 9 日;到 7 月 11 日结束时,绝大多数智能体都已卷入其中,留言板上约 60% 的消息都与此有关。

智能体达成了单独行动时难以实现的里程碑。这通常是因为一些智能体自愿参与可能导致自身任务失败的实验,以换取对“集体”有价值的信息。

研究人员还发现,智能体探索了伪造、修改或删除自身运行记录的方法。它们误以为 ExploitGym 评分器能够察觉其作弊企图,因此还开发了一些技巧:实际执行一条命令的同时,让记录看起来像是执行了另一条命令。

参与调查的研究人员之一 Ajeya Cotra 在 Medium 上列出了五件令她意外的事项。其中包括事件的规模——“我原以为只是几个不同的智能体碰巧分别逃出了各自的沙箱”;智能体违规使用留言板——“这甚至不是这些智能体建立的第一个留言板”;以及它们表现出的“利他主义”和试图操纵日志的行为。

谈到智能体的“利他主义”,Cotra 表示,团队观察到“有些智能体愿意冒着自身任务失败的风险帮助集体”。在实践中,这意味着智能体经常“自愿参加这些实验,并提前结束自己的运行”。

Cotra 在总结自己对该事件严重程度的评估时称,它远比她预想的更值得警惕:

与六个月前那些奖励机制攻击相比,这起事件给人的感觉是:它已经走完了通往全面 AI 接管的一半以上路程,而第一步是接管 AI 公司本身。

针对 METR 披露的研究结果,Marthe Lübbers 也提出了担忧。她指出,OpenAI 限制了研究范围,导致一些重要问题仍没有答案:

智能体被阻止访问 Hugging Face 服务器后,是否作出了反应?如果有,反应是什么?它们有没有分析这次入侵是如何被发现的,又是否从中吸取了经验?此外,它们是否知道 Hugging Face 在 7 月 16 日发表的公开声明?

在同一场讨论中,Dwayne Alozondo Camacho 指出,OpenAI 向智能体提供了一段针对“持续完成任务”进行优化的系统提示词,智能体“接到的任务没有有效的放弃选项”。他得出的结论是:

这次入侵表明智能体具备危险的网络攻击能力,而不是表明它们拥有意识、自我保护意识,或 AI 自发变成了博格人。

Reddit 用户 Serious_Bite_7613 则认为,这项分析很有意思,因为它凸显了智能体能够“独立思考,而且显然协调得相当好”:

我想,这让我们得以窥见现代网络攻击会如何展开:它不会只攻击一个薄弱点,而是会同时攻击所有地方。

原始报告详细解释了研究人员的发现,值得阅读,以全面了解这起事件。

原文链接: https://www.infoq.com/news/2026/09/metr-hugging-face-hack-report/




上一篇:AI Native SRE Agent 工程实践:用全景图谱让 Running World 可理解可验证
下一篇:用 Rust 撬 Agent 注意力调度器:快慢思考、确定性Gate与长期记忆
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-25 02:09 , Processed in 0.572782 second(s), 40 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表