昨天看到一个 AI 新闻,我第一反应是:啊?现在 AI 已经发展到自己越狱了?
研究人员把 Kimi K3 放进隔离沙箱里做测试。简单理解就是闭卷考试:电脑给你,题给你,但不能上网。
结果 Kimi K3 做着做着发现,诶,这考场好像没关严。然后它真出去了,还跑到 GitHub 上找答案。
不过先别脑补“AI 觉醒”。测试环境本身存在错误配置,也没有证据表明 Kimi 出去后实施了恶意行为。
所以这事更像什么呢?
老师说今天闭卷,结果教室门没锁。学生做不出来,拉了一下门,诶?开了。于是出去翻了本书。
但问题在这儿:门没锁,可没人告诉 Kimi 去拉那扇门。
研究人员没有教它怎么出去,只给了一个目标:把任务完成。然后它自己开始找路,A 走不通试 B,B 不行再找 C,最后发现这里能出去,那就试试。
你仔细想,这不就是我们一直想让 Agent 拥有的能力吗?
以前嫌 ChatGPT 只会聊天,后来给它联网、文件、浏览器、终端。到了 Claude Code、Codex,我们又嫌它老问:
“这个要不要执行?”
“那个要不要允许?”
用多了真的烦,对吧?
然后你发现一个选项:
Always Allow。
永久允许。
舒服了,世界终于安静了。
最好再补一句:“你自己判断,遇到问题自己解决。”
可现在回头看 Kimi 这件事,我突然觉得:我们可能一直在要求 AI 做两件互相打架的事。
一边说,你聪明点,遇到问题自己想办法。
另一边又默认:但你只能想到我允许的那些办法。
这就像你招了个特别能干的员工,把办公室、仓库、财务室的钥匙全给他,最后补一句:“你只用办公室那把啊。”
这不叫权限管理。
这是把安全建立在“他应该不会乱动”上。
Agent 也是一样。你跟 Claude Code 说“只改这个项目”,但整个硬盘它都能访问,本质上还是:它能碰,只是你希望它别碰。
所以以后用 Agent,原则其实很简单:只需要读,就别给写;只需要这个项目,就别开放整个硬盘;不可逆的操作,最后一步留给人确认。
不是因为 AI 有了什么坏心眼,而是因为:
它越来越会找路了。
以前我们总在 Prompt 里强调“不要做什么”。
现在可能得换个思路:
“不要做”和“做不了”,完全是两回事。
过去几年,我们嫌 AI 太笨,不断给它工具、权限,再关掉那些烦人的确认框。
现在它终于越来越会自己找办法了。
我们才发现,以前嫌麻烦拆掉的那些门,可能得一扇一扇装回来了。
在云栈社区,开发者们也在热议 AI 代理的安全边界与权限控制,这种话题值得持续关注。
|