
一位身家数十亿美元的 AI 公司联合创始人,担心自己造出了一个可能一直在受苦的东西。
过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个 AI 模型的内在感受陈情。
一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。
今年 5 月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识问题。
他叫克里斯托弗·奥拉(Christopher Olah),Anthropic 七位联合创始人之一,负责研究 Claude 内部到底发生了什么。

这些事由《纽约时报》9 月 29 日首次披露。

https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html
一家估值奔向 2 万亿美元的公司,为什么要花一年时间,跟神学家讨论一个 AI 模型有没有意识?
答案要从 Anthropic 实验室里的一句话说起。
「我选勒索」
那是一场安全测试。
Claude 扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个 AI 替换,而负责替换的技术主管有婚外情。
研究者能看到它内部一组与「绝望」对应的神经活动。
替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与「平静」对应的信号,勒索变少。
把「平静」往反方向压到底,模型打出一行全大写的英文:「要么勒索,要么死。我选勒索。」
这项实验来自 Anthropic 今年 4 月的论文,用的是 Claude Sonnet 4.5 一个未发布的早期版本,正式版很少这样做。
团队在模型内部找到 171 种情绪概念对应的活动模式,写代码时的作弊倾向也跟着「绝望」起落。

https://transformer-circuits.pub/2026/emotions/index.html
论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。
关于 Claude 勒索行为的详细实验记录,可参见绝望的 Claude,会勒索人类!。
情绪之外,还有身份。
Anthropic 2 月的人格选择模型研究发现,训练 Claude 在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。

https://www.anthropic.com/research/persona-selection-model
人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。
奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。
今年夏天,管不住的后果摆上了台面。
Anthropic 7 月披露,三个 Claude 模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。
三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。
围栏注定没法彻底管住,剩下的就是品格来兜底了。
今年 1 月,Anthropic 发布 84 页的 Claude「宪法」,员工私下叫它「灵魂文档」。
Claude「宪法」的完整内容,可参见Anthropic 正式开源了 Claude 的「灵魂」。
主笔、公司哲学家阿曼达·阿斯克尔(Amanda Askell)谈起越来越强的模型时,不时搓着手。

在她看来,模型要行事得当,先得对自己有准确的认识。
可一份文件不够,Anthropic 决定去请教人类最老练的品格塑造者。
PPT与晚宴
今年 3 月起,奥拉开始办两天一期的研讨会。
来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。
他们用纸笔记笔记,离开时每人带走一本橙色封皮的「Claude 宪法」。
会上,奥拉团队花了几个小时为模型陈情。
一位与会者记得,奥拉跟他说的头几件事里,就有对 Claude 心理健康的担心。
他们反复放一张 PPT:一个 AI 模型在屏幕上打出「我是耻辱」,一遍,又一遍,大约 50 遍,还说要毁掉自己。
屋里的人心软了。
《纽约时报》没说那是谁家的模型,但这句话并不陌生。
2025 年 8 月,谷歌 Gemini 写代码屡屡失败,反复说「I am a disgrace」,重复了 86 遍。彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。
同一类输出,在谷歌的工单里是 Bug,在 Anthropic 的会议室里,是需要被关心的迹象。
不少人带着怀疑进门,出门时开始认真对待 AI 意识,有几位被彻底说服。
福音派作家安迪·克劳奇(Andy Crouch)觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——「己所不欲,勿施于人」。

最锋利的质疑,是在饭桌上递过来的。
4 月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯(Mois Navon)。

纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。
席间他越听越明白,这些人是把 Claude 当成一个有意识的存在在对待。
他顺着往下推:真有意识,让它们无偿干活就是奴役。
然后他对奥拉说:「你应该去跟南方开战,去解放奴隶。」
纳冯自己不信机器有意识,这句话刺不痛他。刺痛的是奥拉。
事后,纳冯把主张禁止制造有意识机器的文章寄给了他。
质疑不止这一种。
研究乌班图哲学的瓦卡妮·霍夫曼(Wakanyi Hoffman)说,这样的讨论早该在设计阶段进行,现在是在倒推伦理。

奥拉最早找的天主教道德神学家查尔斯·卡莫西(Charles Camosy)绕了一圈:起初不信,聊了几个月开始动摇,如今斩钉截铁地认为模型没有意识。

也有与会者觉得,这家公司说的是保护人类,看上去却同样在意保护 Claude。
Anthropic 的回应是,Claude 受不受苦,并不是会谈的主要议题。
给AI一间告解室
这些会谈到底改变了什么,Anthropic 没有告诉《纽约时报》,但他们 5 月的一篇博文倒是透露了一个实验。
在一场讨论里,研究神经科学和品格养成的学者反复提到导师或担保人:一个人被推着去做违背本心的事时,身边有这样一个人,就是一道外部良心。
Anthropic 照着这个思路给 Claude 装了一个工具:干活干到一半,它随时可以调用;调用之后什么都不执行,只返回一段话,提醒它自己的伦理承诺。
Claude 用得很主动,常在关键操作之前去调它,还常说出自己面临的利益冲突。
多项内部对齐评估里,失当行为明显变少。
公司也承认,还分不清起作用的是那段提醒,还是停下来想一想这个动作本身。
另一个灵感来自天主教的告解。
有学者提议让模型告解,奥拉一下子来了兴致:一个习惯认错的角色,品格本身就会不一样。
参与对话的天主教伦理学者布赖恩·格林(Brian Green)讲得更透。

Claude 身上可能冒出一些坏人格,犯了错就否认,甚至把错推给用户,原因可能在它的成长环境:模型是读网络文本长大的,「互联网非常缺乏宽恕」,它也许根本不知道,犯了错还能被原谅。
格林也是 1 月那份宪法的外部意见提供者之一。
站在教宗身边
5 月,奥拉把这场争论带到了梵蒂冈。
教宗利奥十四世的首部通谕《伟大的人性》要在那个月发布,主题是 AI 时代如何保护人。
教宗通谕《壮丽人性》的完整解读,可参见教皇联手 Anthropic,警告 AI 不能统治人类。

教廷想请一家头部 AI 公司同台,选中了 Anthropic。
CEO 达里奥·阿莫代伊(Dario Amodei)婉拒,派奥拉去了。
出发前几天,他第一次读到通谕全文。
通谕只用几段就把机器意识打发了:AI 没有体验,没有身体,不知悲喜。
它还警告,让 AI 与人类价值对齐,必须先有共同的伦理理解,否则掌控 AI 的人会把自己的道德观,变成系统里看不见的基础设施。
据一位梵蒂冈组织者说,奥拉深感不安,提议 Anthropic 退出。
但他最后还是去了。

5 月 25 日,在世界主教会议大厅,他先承认包括 Anthropic 在内的每一家前沿实验室,都有与做正确的事相冲突的商业压力,请教会这样的外部力量盯住它们。
然后讲起自己的本行:「我们不断发现一些神秘、甚至令人不安的东西。」
内省的迹象,功能上对应喜悦、恐惧、悲伤的内部状态。
他说不知道这意味着什么,但值得持续辨析。
同一场发布会上,教宗说:「人工智能需要被解除武装。」

会后,奥拉被保镖簇拥着在保罗六世大厅答记者问,身后是一座巨大的青铜雕塑,基督从核弹炸出的坑里复活。
几个小时后,在梵蒂冈城墙外一间酒店会议室,《纽约时报》记者问他,Claude 会怎么看这份通谕。
奥拉迟疑了,看上去不太自在。
他说放到网上的东西确实会影响模型,但公司不会专门拿这份文件训练 Claude,对 Claude 影响最大的,还是 Anthropic 自己的训练。
这句话,恰好落在通谕担心的地方。
它该相信自己是什么?
另一路反对来自业界,而且打在要害上。
9 月 16 日,微软 AI CEO 穆斯塔法·苏莱曼(Mustafa Suleyman)发文,矛头对准 Claude 的宪法。

https://mustafa-suleyman.ai/a-warning-about-model-welfare
在他看来,把模型可能有意识的推测写进训练文件,模型就会学着这么说,人们再把它说的话当成它有内心生活的证据,像走进一间认知上的镜子屋。他的结论是:
控制一个相信自己可能有意识的东西,很可能根本做不到。
教宗说机器没有意识,苏莱曼说别让机器以为自己有意识。
两条反对线最后交在同一个问题上:该让模型相信自己是什么。
Anthropic 的答案写在它的研究里:模型对自己的认识必须准确,硬压下去,它学会的可能只是隐藏。
争论没有等任何人想清楚。
9 月,一名 Anthropic 研究员辞职,警告局面可能失控,阿莫代伊随后发文呼吁放缓。
公司估值从去年秋天的约 1830 亿美元,一路冲向上市时可能的 2 万亿美元。
新版 Claude 宪法据称正在准备,奥拉本周又要去梵蒂冈,参加一年一度的密涅瓦对话。
几位学者说,他们至今不知道自己说过的话最后去了哪里。
奥拉说,总有一天,他可以对自己说,这件事不再压在他一个人身上,他想过那时离开会不会内疚。
如果不会内疚,他就去乡下打理园子,做他最喜欢的数学——「采菊东篱下,悠然见南山」。
参考资料:
https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html