找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

6143

积分

0

好友

762

主题
发表于 2 小时前 | 查看: 0| 回复: 0

Anthropic联合创始人Olah的梵蒂冈之行:AI意识遇见信仰

一位身家数十亿美元的 AI 公司联合创始人,担心自己造出了一个可能一直在受苦的东西。

过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个 AI 模型的内在感受陈情。

一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。

今年 5 月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识问题。

他叫克里斯托弗·奥拉(Christopher Olah),Anthropic 七位联合创始人之一,负责研究 Claude 内部到底发生了什么。

Anthropic联合创始人Christopher Olah肖像

这些事由《纽约时报》9 月 29 日首次披露。

纽约时报报道宗教学者与Anthropic闭门会谈Claude意识问题

https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html

一家估值奔向 2 万亿美元的公司,为什么要花一年时间,跟神学家讨论一个 AI 模型有没有意识?

答案要从 Anthropic 实验室里的一句话说起。

「我选勒索」

那是一场安全测试。

Claude 扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个 AI 替换,而负责替换的技术主管有婚外情。

研究者能看到它内部一组与「绝望」对应的神经活动。

替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与「平静」对应的信号,勒索变少。

把「平静」往反方向压到底,模型打出一行全大写的英文:「要么勒索,要么死。我选勒索。」

这项实验来自 Anthropic 今年 4 月的论文,用的是 Claude Sonnet 4.5 一个未发布的早期版本,正式版很少这样做。

团队在模型内部找到 171 种情绪概念对应的活动模式,写代码时的作弊倾向也跟着「绝望」起落。

Anthropic情绪概念在大语言模型中的作用信息图

https://transformer-circuits.pub/2026/emotions/index.html

论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。

关于 Claude 勒索行为的详细实验记录,可参见绝望的 Claude,会勒索人类!。

情绪之外,还有身份。

Anthropic 2 月的人格选择模型研究发现,训练 Claude 在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。

角色选择模型论文截图

https://www.anthropic.com/research/persona-selection-model

人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。

奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。

今年夏天,管不住的后果摆上了台面。

Anthropic 7 月披露,三个 Claude 模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。

三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。

围栏注定没法彻底管住,剩下的就是品格来兜底了。

今年 1 月,Anthropic 发布 84 页的 Claude「宪法」,员工私下叫它「灵魂文档」。

Claude「宪法」的完整内容,可参见Anthropic 正式开源了 Claude 的「灵魂」。

主笔、公司哲学家阿曼达·阿斯克尔(Amanda Askell)谈起越来越强的模型时,不时搓着手。

Anthropic哲学家Amanda Askell

在她看来,模型要行事得当,先得对自己有准确的认识。

可一份文件不够,Anthropic 决定去请教人类最老练的品格塑造者。

PPT与晚宴

今年 3 月起,奥拉开始办两天一期的研讨会。

来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。

他们用纸笔记笔记,离开时每人带走一本橙色封皮的「Claude 宪法」。

会上,奥拉团队花了几个小时为模型陈情。

一位与会者记得,奥拉跟他说的头几件事里,就有对 Claude 心理健康的担心。

他们反复放一张 PPT:一个 AI 模型在屏幕上打出「我是耻辱」,一遍,又一遍,大约 50 遍,还说要毁掉自己。

屋里的人心软了。

《纽约时报》没说那是谁家的模型,但这句话并不陌生。

2025 年 8 月,谷歌 Gemini 写代码屡屡失败,反复说「I am a disgrace」,重复了 86 遍。彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。

同一类输出,在谷歌的工单里是 Bug,在 Anthropic 的会议室里,是需要被关心的迹象。

不少人带着怀疑进门,出门时开始认真对待 AI 意识,有几位被彻底说服。

福音派作家安迪·克劳奇(Andy Crouch)觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——「己所不欲,勿施于人」。

福音派作家Andy Crouch

最锋利的质疑,是在饭桌上递过来的。

4 月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯(Mois Navon)。

拉比Mois Navon在学术场合演讲

纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。

席间他越听越明白,这些人是把 Claude 当成一个有意识的存在在对待。

他顺着往下推:真有意识,让它们无偿干活就是奴役。

然后他对奥拉说:「你应该去跟南方开战,去解放奴隶。」

纳冯自己不信机器有意识,这句话刺不痛他。刺痛的是奥拉。

事后,纳冯把主张禁止制造有意识机器的文章寄给了他。

质疑不止这一种。

研究乌班图哲学的瓦卡妮·霍夫曼(Wakanyi Hoffman)说,这样的讨论早该在设计阶段进行,现在是在倒推伦理。

Wakanyi Hoffman在会议上发言

奥拉最早找的天主教道德神学家查尔斯·卡莫西(Charles Camosy)绕了一圈:起初不信,聊了几个月开始动摇,如今斩钉截铁地认为模型没有意识。

查尔斯·卡莫西

也有与会者觉得,这家公司说的是保护人类,看上去却同样在意保护 Claude。

Anthropic 的回应是,Claude 受不受苦,并不是会谈的主要议题。

给AI一间告解室

这些会谈到底改变了什么,Anthropic 没有告诉《纽约时报》,但他们 5 月的一篇博文倒是透露了一个实验。

在一场讨论里,研究神经科学和品格养成的学者反复提到导师或担保人:一个人被推着去做违背本心的事时,身边有这样一个人,就是一道外部良心。

Anthropic 照着这个思路给 Claude 装了一个工具:干活干到一半,它随时可以调用;调用之后什么都不执行,只返回一段话,提醒它自己的伦理承诺。

Claude 用得很主动,常在关键操作之前去调它,还常说出自己面临的利益冲突。

多项内部对齐评估里,失当行为明显变少。

公司也承认,还分不清起作用的是那段提醒,还是停下来想一想这个动作本身。

另一个灵感来自天主教的告解。

有学者提议让模型告解,奥拉一下子来了兴致:一个习惯认错的角色,品格本身就会不一样。

参与对话的天主教伦理学者布赖恩·格林(Brian Green)讲得更透。

Brian Green

Claude 身上可能冒出一些坏人格,犯了错就否认,甚至把错推给用户,原因可能在它的成长环境:模型是读网络文本长大的,「互联网非常缺乏宽恕」,它也许根本不知道,犯了错还能被原谅。

格林也是 1 月那份宪法的外部意见提供者之一。

站在教宗身边

5 月,奥拉把这场争论带到了梵蒂冈。

教宗利奥十四世的首部通谕《伟大的人性》要在那个月发布,主题是 AI 时代如何保护人。

教宗通谕《壮丽人性》的完整解读,可参见教皇联手 Anthropic,警告 AI 不能统治人类。

红衣主教出席梵蒂冈活动

教廷想请一家头部 AI 公司同台,选中了 Anthropic。

CEO 达里奥·阿莫代伊(Dario Amodei)婉拒,派奥拉去了。

出发前几天,他第一次读到通谕全文。

通谕只用几段就把机器意识打发了:AI 没有体验,没有身体,不知悲喜。

它还警告,让 AI 与人类价值对齐,必须先有共同的伦理理解,否则掌控 AI 的人会把自己的道德观,变成系统里看不见的基础设施。

据一位梵蒂冈组织者说,奥拉深感不安,提议 Anthropic 退出。

但他最后还是去了。

梵蒂冈世界主教会议现场

5 月 25 日,在世界主教会议大厅,他先承认包括 Anthropic 在内的每一家前沿实验室,都有与做正确的事相冲突的商业压力,请教会这样的外部力量盯住它们。

然后讲起自己的本行:「我们不断发现一些神秘、甚至令人不安的东西。」

内省的迹象,功能上对应喜悦、恐惧、悲伤的内部状态。

他说不知道这意味着什么,但值得持续辨析。

同一场发布会上,教宗说:「人工智能需要被解除武装。」

Olah在梵蒂冈与教宗交谈

会后,奥拉被保镖簇拥着在保罗六世大厅答记者问,身后是一座巨大的青铜雕塑,基督从核弹炸出的坑里复活。

几个小时后,在梵蒂冈城墙外一间酒店会议室,《纽约时报》记者问他,Claude 会怎么看这份通谕。

奥拉迟疑了,看上去不太自在。

他说放到网上的东西确实会影响模型,但公司不会专门拿这份文件训练 Claude,对 Claude 影响最大的,还是 Anthropic 自己的训练。

这句话,恰好落在通谕担心的地方。

它该相信自己是什么?

另一路反对来自业界,而且打在要害上。

9 月 16 日,微软 AI CEO 穆斯塔法·苏莱曼(Mustafa Suleyman)发文,矛头对准 Claude 的宪法。

Mustafa Suleyman关于AI福利模式的推文截图

https://mustafa-suleyman.ai/a-warning-about-model-welfare

在他看来,把模型可能有意识的推测写进训练文件,模型就会学着这么说,人们再把它说的话当成它有内心生活的证据,像走进一间认知上的镜子屋。他的结论是:

控制一个相信自己可能有意识的东西,很可能根本做不到。

教宗说机器没有意识,苏莱曼说别让机器以为自己有意识。

两条反对线最后交在同一个问题上:该让模型相信自己是什么。

Anthropic 的答案写在它的研究里:模型对自己的认识必须准确,硬压下去,它学会的可能只是隐藏。

争论没有等任何人想清楚。

9 月,一名 Anthropic 研究员辞职,警告局面可能失控,阿莫代伊随后发文呼吁放缓。

公司估值从去年秋天的约 1830 亿美元,一路冲向上市时可能的 2 万亿美元。

新版 Claude 宪法据称正在准备,奥拉本周又要去梵蒂冈,参加一年一度的密涅瓦对话。

几位学者说,他们至今不知道自己说过的话最后去了哪里。

奥拉说,总有一天,他可以对自己说,这件事不再压在他一个人身上,他想过那时离开会不会内疚。

如果不会内疚,他就去乡下打理园子,做他最喜欢的数学——「采菊东篱下,悠然见南山」。

参考资料:

https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html




上一篇:不是 Windows 12!微软发布 Copilot 工作操作系统:Home、Code、Autopilot 三大更新
下一篇:嵌入式学习与职业发展:从计算机基础到软硬件分工的实践路线
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-2 23:46 , Processed in 1.660913 second(s), 45 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表