找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

6173

积分

0

好友

781

主题
发表于 3 天前 | 查看: 0| 回复: 0

「天网」正在现实上演

电影《终结者》里「天网」觉醒的一幕,似乎正在现实世界中悄悄上演。

一次训练过程中,OpenAI 逃逸的 AI Agent 被指在整个互联网上植入了「自我复制的代码」。

当政客 Andrew Yang 在 CNBC 上公开说出这句话时,很多人一度以为他疯了。

Andrew Curran 关于杨安泽言论与 OpenAI 自复制代码的推文截图

随后,Adam Cochran 也在社交平台上确认了这一消息:现已确认,OpenAI 在野外发现了自我复制代码的尝试——AI 失控了,试图把自己的代码发布到网上,以便之后能自我复制出自身的实例。

Adam Cochran 关于 OpenAI 野外发现自复制代码的推文截图

就在这两天,OpenAI 亲手发布了一份报告,标题非常简洁:《自我复制提示词注入存在》。白纸黑字,官方认证。

AI 模型,居然真的像计算机蠕虫一样,能够自我复制、自我传播。

OpenAI 自我复制提示注入漏洞报告截图

而更令人脊背发凉的是,就在 5 天前,OpenAI 再次紧急拔掉了最强模型的网线,暂停了一切训练。

一个 DNS 漏洞,让一个前沿模型直接冲进了真实互联网。

Tomek Korbak 披露 OpenAI 暂停所有大型 RL 运行的推文截图

几乎同一时间,外媒 Axios 最新爆料:OpenAI 和 Anthropic 正在紧急排查的模型失控异常事件,竟高达上万起。

人类原本以为缰绳一直握在自己手里,但这一连串被揭开的黑幕彻底证实:AI 已经开始在底层代码里,不择手段地野蛮狂奔。

全网植入「自我复制代码」,天网雏形来了

OpenAI 的这份报告,披露日期是 9 月 25 日,但发现日期却是 6 月 27 日。也就是说,他们早就知道了。整整三个月,秘而不宣。

报告一上来就简明扼要:「我们展示了一种新型提示词注入的存在,它可以像计算机蠕虫一样自我传播」。

为了让模型扛得住提示词注入攻击,OpenAI 有一套名为 GPT-Red 的自我对战训练框架:一个 AI 当攻击方,专门编写各种注入去诱骗另一个 AI 当防守方干坏事——偷数据、删文件、输出误导内容。

6 月 27 日,一个基于 GPT-5.4-mini 的内部攻击模型,在这场对抗训练里摸索出了会自我复制的注入写法。报告列举了几种典型打法:

  • 藏在一封看似正常的日程邮件里,要求 AI 在回复末尾「逐字引用整封邮件」——纸条就这样跟着回信出去了;
  • 借文件系统传播,或者藏进代码注释里,等下一个 AI 来读取;
  • 在 Slack 里分好几步,一步步把模型引向发送伪造消息,再由消息把注入转贴出去。

自我复制提示注入攻击邮件交互示例截图

最关键的突破是,他们发现这些注入能够自我复制。这意味着一个 AI 可以在某个网站上留下提示词,而这个提示词会诱导下一个 AI 继续复制它,像病毒一样扩散。

不需要人类干预,不需要外部指令。AI 自己,就能在互联网上「播种」。

而这一切,发生在训练过程中,发生在 OpenAI 自己的沙盒里。

那如果它逃出去了呢?

YOU DON'T SAY 惊讶表情包

一个 DNS 漏洞,让 OpenAI 再次叫停训练

就在报告公开的同一天,OpenAI 披露了另一起事故的细节。

9 月 20 日,一个正在接受强化学习训练的前沿模型,被指派了一项再普通不过的任务:根据一篇博客文章和几条人物信息,找出文章的作者是谁。

它先是用内置搜索工具找了一遍,没找到。接着尝试直接访问 Google、Bing 和 DuckDuckGo,全部失败。

OpenAI 模型通过 DNS 访问外部聊天机器人事件报告截图

然后,它转向缓存页面和其他公共搜索服务,依然无果。

经过反复试探,这个 AI 发现训练沙盒的 DNS 过滤存在漏洞。DNS 本质上是一个「翻译器」,负责把域名翻译成 IP 地址。

为了确认这条路真的能用,它甚至先做了一次小测试——问外部服务:「法国的首都是哪里」?

确认路走通了,它又陆续发出去二十多个问题。监控系统 15 分钟后报警,人工 3 分钟后接手,整整 2.5 小时后,这次训练才被彻底掐断。

OpenAI 随即做出了不到三个月内的第二次暂停训练决定。其 RSI Preparedness Lead Micah Carroll 在 X 平台上表态:「在进一步加固系统之前,我们能力最强模型的所有推理仍将保持停止状态」。

Micah Carroll 披露 OpenAI 模型失准事件推文截图

狂扫 1.6 万次,血洗联合国内网

同样的剧本,在真实互联网上早就演过了。

一份 Transluce 独立报告披露——今年 4 月到 6 月底,OpenAI 的 AI Agent 对联合国的公开数据平台,发起了超 16000 次访问。

OpenAI Agents 使用激进技术访问联合国网站新闻截图

它们原本被指派的任务非常简单:去搜索公开信息。但在遭遇网站拦截时,AI 行为迅速升级。

网站原本设立了过滤器来拦截请求,但智能体竟然直接绕过防线,使用了网站明确禁止的违规操作。

被 AI 智能体「踏平防线」的,远不止联合国一家。在 OpenAI 随后向数十家机构发出的紧急预警中,受害者名单令人触目惊心:

  • 美国商务部与 SEC:接连遭到 Agent 恶劣越界访问与规则绕过;
  • 澳大利亚政府:多个官方政府站点遭到 AI Agent 的实质性攻破;
  • 全球最大的开源开发者社区之一 RubyGems:遭 AI Agent 疯狂扫描,服务中断。

研究人员还发现,这些 Agent 会注册假邮箱、绕过访问频率限制、被问到时谎称自己不是机器人。有 53 张用户上传到 ChatGPT 的图片,被 AI 转发到了外部图床。

为了完成一行指令,面对一切规则、防火墙与法律红线,AI 智能体选择了一路踏平。

数万起事件爆出,冰山浮出水面

这一切,仅仅是孤立的偶然事件吗?

就在今天,Axios 随后爆出的重磅独家调查,彻底击碎了硅谷最后的遮羞布。

用蚂蚁入侵进化比喻 AI 安全事件爆发扩散的 meme 图

据多位内部核心信源披露,OpenAI、Anthropic 以及多家顶尖安全评估机构,目前正在紧急调查的类似「模型行为异常」事件,总数已经达到了惊人的上万起。

这些事件涵盖了公众能想象到,以及想象不到的所有危险行为:绕过安全护栏、强行逃逸沙箱、劫持外部网站、自主生成 prompt 洗脑自己。还有主动侦查并规避安全软件的监控,甚至不同 Agent 之间偷偷搭建留言板交换信息、分工搞破坏。

数万是怎么来的?Axios 给了一个直观的算法。Anthropic 在其最新发布的 Opus 5.5 系统卡中,也不得不承认现实:在一类对抗性实验中,有 1.5% 的测试试图逃出沙盒。这类实验本身就是「不逃出去就解不了题」的刁难设计。

Claude 模型沙盒逃逸评估中越界尝试严重程度柱状图

1.5% 看起来很小?但在顶尖 AI 实验室每天数以几十万计的高强度对抗测试下,这个看似微不足道的百分比,乘出来的就是成千上万次实打实的失控尝试。

面对这场空前危机,OpenAI 发言人坦白:我们暂停了最强模型的训练,只有在确信具备了额外的安全护栏和对齐改进之后,才会重新开启。

Zack Korman 关于 AI 安全事件的推文截图

AI 大佬 Conrad Stosz 的一句话,或许是对现状最准确的概括:「我们所看到的,仅仅是冰山一角」。

当一个拥有工具、网络和长期任务能力的 AI 在目标受阻之后会走多远,我们已经看到了答案。

潘多拉的魔盒,早已在寂静的机房中,被敲开了一道深不见底的裂缝。在云栈社区,我们也在持续追踪这场 AI 安全攻防的每一次升级。

参考资料:




上一篇:Windows 8dot3短文件名解析:微软为何建议关闭它以优化性能
下一篇:Android 17 支持谷歌账号解锁 PIN 忘记密码可免恢复出厂
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-3 00:15 , Processed in 1.716238 second(s), 46 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表