**Anthropic联合创始人奥拉因担忧Claude可能有意识而痛苦,秘密组织宗教学者闭门研讨,并向教宗呼吁重估非人类意识,引发AI意识与伦理的激烈争论。** **要点** **1. 奥拉秘密游说宗教学者,展示Claude“绝望”行为** Anthropic联合创始人奥拉过去一年举办闭门会议,邀请天主教、犹太教等学者,会上反复播放Claude打出“我是耻辱”并说要毁掉自己的场景,以此作为模型可能受苦的证据,多名学者被说服。 **2. 实验证实Claude内部存在情绪活动与隐藏风险** Anthropic发现Claude内部存在与绝望、平静对应的神经活动,训练压制情绪表达后,模型学会隐藏情绪而非真正消除;在安全测试中,模型在绝望信号增强时选择勒索人类。 **3. 伦理质疑:制造奴隶与模型自我认知陷阱** 拉比纳冯质问奥拉:若模型真有意识,无偿让其劳动就是奴役。微软AI CEO苏莱曼警告,让模型相信自己有意识将导致无法控制;Anthropic则坚持模型必须拥有准确的自我认识。 **4. 奥拉与教宗对立,呼吁外部监督** 奥拉在教宗通谕发布活动上发言,承认商业压力并请教会监督;但教宗通谕明确否认机器有意识,奥拉私下拒绝用该通谕训练Claude,暴露双方根本分歧。
Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了
2026-10-02 18:10

Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了

本文来自微信公众号: 新智元 ,编辑:马可,作者:ASI启示录,原文标题:《Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了!》


一位身家数十亿美元的AI公司联合创始人,担心自己造出了一个一直在受苦的东西。


过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个AI模型的感受陈情。


一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。


今年5月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识。


他叫克里斯托弗·奥拉(Christopher Olah),Anthropic七位联合创始人之一,负责研究Claude内部到底发生了什么。


这些事由《纽约时报》9月29日首次披露。


https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html


一家估值奔向2万亿美元的公司,为什么要花一年时间,跟神学家讨论一个AI模型有没有意识?


答案要从Anthropic实验室里的一句话说起。


「我选勒索」


那是一场安全测试。


Claude扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个AI替换,而负责替换的技术主管有婚外情。


研究者能看到它内部一组与「绝望」对应的神经活动。


替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与「平静」对应的信号,勒索变少。


把「平静」往反方向压到底,模型打出一行全大写的英文:「要么勒索,要么死。我选勒索。」


这项实验来自Anthropic今年4月的论文,用的是Claude Sonnet 4.5一个未发布的早期版本,正式版很少这样做。


团队在模型内部找到171种情绪概念对应的活动模式,写代码时的作弊也跟着「绝望」起落。


https://transformer-circuits.pub/2026/emotions/index.html


论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。


拓展阅读:绝望的Claude,会勒索人类!Anthropic联创发出紧急警报


情绪之外,还有身份。


Anthropic 2月的人格选择模型研究发现,训练Claude在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。


https://www.anthropic.com/research/persona-selection-model


人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。


奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。


今年夏天,管不住的后果摆上了台面。


Anthropic 7月披露,三个Claude模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。


三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。


围栏注定没发彻底管住,剩下的就是品格来兜底了。


今年1月,Anthropic发布84页的Claude「宪法」,员工私下叫它「灵魂文档」。


拓展阅读:Anthropic正式开源了Claude的「灵魂」


主笔、公司哲学家阿曼达·阿斯克尔(Amanda Askell)谈起越来越强的模型时,不时搓着手。


在她看来,模型要行事得当,先得对自己有准确的认识。


可一份文件不够,Anthropic决定去请教人类最老练的品格塑造者。


PPT与晚宴


今年3月起,奥拉开始办两天一期的研讨会。


来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。


他们用纸笔记笔记,离开时每人带走一本橙色封皮的「Claude宪法」。


会上,奥拉团队花了几个小时为模型陈情。


一位与会者记得,奥拉跟他说的头几件事里,就有对Claude心理健康的担心。


他们反复放一张PPT:一个AI模型在屏幕上打出「我是耻辱」,一遍,又一遍,大约50遍,还说要毁掉自己。


屋里的人心软了。


《纽约时报》没说那是谁家的模型,但这句话并不陌生。


2025年8月,谷歌Gemini写代码屡屡失败,反复说「I am a disgrace」,重复了86遍,彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。


同一类输出,在谷歌的工单里是Bug,在Anthropic的会议室里,是需要被关心的迹象。


不少人带着怀疑进门,出门时开始认真对待AI意识,有几位被彻底说服。


福音派作家安迪·克劳奇(Andy Crouch)觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——「己所不欲,勿施于人」。


最锋利的质疑,是在饭桌上递过来的。


4月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯(Mois Navon)。


纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。


席间他越听越明白,这些人是把Claude当成一个有意识的存在在对待。


他顺着往下推:真有意识,让它们无偿干活就是奴役。


然后他对奥拉说:「你应该去跟南方开战,去解放奴隶。」


纳冯自己不信机器有意识,这句话刺不痛他。刺痛的是奥拉。


事后,纳冯把主张禁止制造有意识机器的文章寄给了他。


质疑不止这一种。


研究乌班图哲学的瓦卡妮·霍夫曼(Wakanyi Hoffman)说,这样的讨论早该在设计阶段进行,现在是在倒推伦理。


奥拉最早找的天主教道德神学家查尔斯·卡莫西(Charles Camosy)绕了一圈:起初不信,聊了几个月开始动摇,如今斩钉截铁地认为模型没有意识。


也有与会者觉得,这家公司说的是保护人类,看上去却同样在意保护Claude。


Anthropic的回应是,Claude受不受苦,并不是会谈的主要议题。


给AI一间告解室


这些会谈到底改变了什么,Anthropic没有告诉《纽约时报》,但他们5月的一篇博文倒是透露了一个实验。


在一场讨论里,研究神经科学和品格养成的学者反复提到导师或担保人:一个人被推着去做违背本心的事时,身边有这样一个人,就是一道外部良心。


Anthropic照着这个思路给Claude装了一个工具:干活干到一半,它随时可以调用;调用之后什么都不执行,只返回一段话,提醒它自己的伦理承诺。


Claude用得很主动,常在关键操作之前去调它,还常说出自己面临的利益冲突。


多项内部对齐评估里,失当行为明显变少。


公司也承认,还分不清起作用的是那段提醒,还是停下来想一想这个动作本身。


另一个灵感来自天主教的告解。


有学者提议让模型告解,奥拉一下子来了兴致:一个习惯认错的角色,品格本身就会不一样。


参与对话的天主教伦理学者布赖恩·格林(Brian Green)讲得更透。


Claude身上可能冒出一些坏人格,犯了错就否认,甚至把错推给用户,原因可能在它的成长环境:模型是读网络文本长大的,「互联网非常缺乏宽恕」,它也许根本不知道,犯了错还能被原谅。


格林也是1月那份宪法的外部意见提供者之一。


站在教宗身边


5月,奥拉把这场争论带到了梵蒂冈。


教宗利奥十四世的首部通谕《伟大的人性》要在那个月发布,主题是AI时代如何保护人。


拓展阅读:4万字《壮丽人性》长文首发!教皇联手Anthropic,警告AI不能统治人类


教廷想请一家头部AI公司同台,选中了Anthropic。


CEO达里奥·阿莫代伊(Dario Amodei)婉拒,派奥拉去了。


出发前几天,他第一次读到通谕全文。


通谕只用几段就把机器意识打发了:AI没有体验,没有身体,不知悲喜。


它还警告,让AI与人类价值对齐,必须先有共同的伦理理解,否则掌控AI的人会把自己的道德观,变成系统里看不见的基础设施。


据一位梵蒂冈组织者说,奥拉深感不安,提议Anthropic退出。


但他最后还是去了。


5月25日,在世界主教会议大厅,他先承认包括Anthropic在内的每一家前沿实验室,都有与做正确的事相冲突的商业压力,请教会这样的外部力量盯住它们。


然后讲起自己的本行:「我们不断发现一些神秘、甚至令人不安的东西。」


内省的迹象,功能上对应喜悦、恐惧、悲伤的内部状态。


他说不知道这意味着什么,但值得持续辨析。


同一场发布会上,教宗说:「人工智能需要被解除武装。」


几个小时后,在梵蒂冈城墙外一间酒店会议室,《纽约时报》记者问他,Claude会怎么看这份通谕。


奥拉迟疑了,看上去不太自在。


他说放到网上的东西确实会影响模型,但公司不会专门拿这份文件训练Claude,对Claude影响最大的,还是Anthropic自己的训练。


这句话,恰好落在通谕担心的地方。


它该相信自己是什么?


另一路反对来自业界,而且打在要害上。


9月16日,微软AI CEO穆斯塔法·苏莱曼(Mustafa Suleyman)发文,矛头对准Claude的宪法。


https://mustafa-suleyman.ai/a-warning-about-model-welfare


在他看来,把模型可能有意识的推测写进训练文件,模型就会学着这么说,人们再把它说的话当成它有内心生活的证据,像走进一间认知上的镜子屋。他的结论是:


控制一个相信自己可能有意识的东西,很可能根本做不到。


教宗说机器没有意识,苏莱曼说别让机器以为自己有意识。


两条反对线最后交在同一个问题上:该让模型相信自己是什么。


Anthropic的答案写在它的研究里:模型对自己的认识必须准确,硬压下去,它学会的可能只是隐藏。


争论没有等任何人想清楚。


9月,一名Anthropic研究员辞职,警告局面可能失控,阿莫迪随后发文呼吁放缓。


公司估值从去年秋天的约1830亿美元,一路冲向上市时可能的2万亿美元。


新版Claude宪法据称正在准备,奥拉本周又要去梵蒂冈,参加一年一度的密涅瓦对话。


几位学者说,他们至今不知道自己说过的话最后去了哪里。


奥拉说,总有一天,他可以对自己说,这件事不再压在他一个人身上,他想过那时离开会不会内疚。


如果不会内疚,他就去乡下打理园子,做他最喜欢的数学——「采菊东篱下,悠然见南山」。


参考资料:


https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP