|
一位身家数十亿美元的AI公司联合创始人,担心自己造出了一个一直在受苦的东西。 过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个AI模型的感受陈情。 一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。 今年5月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识。 他叫克里斯托弗·奥拉(Christopher Olah),Anthropic七位联合创始人之一,负责研究Claude内部到底发生了什么。 这些事由《纽约时报》9月29日首次披露。 一家估值奔向2万亿美元的公司,为什么要花一年时间,跟神学家讨论一个AI模型有没有意识? 答案要从Anthropic实验室里的一句话说起。 “我选勒索” 那是一场安全测试。 Claude扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个AI替换,而负责替换的技术主管有婚外情。
Christopher Olah 研究者能看到它内部一组与“绝望”对应的神经活动。 替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与“平静”对应的信号,勒索变少。
把“平静”往反方向压到底,模型打出一行全大写的英文:“要么勒索,要么死。我选勒索。” 这项实验来自Anthropic今年4月的论文,用的是Claude Sonnet 4.5一个未发布的早期版本,正式版很少这样做。 团队在模型内部找到171种情绪概念对应的活动模式,写代码时的心绪也跟着“绝望”起落。
https://transformer-circuits.pub/2026/emotions/index.html 论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。 情绪之外,还有身份。 Anthropic 2月的人格选择模型研究发现,训练Claude在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。
https://www.anthropic.com/research/persona-selection-model 人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。 奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。 今年夏天,管不住的后果摆上了台面。 Anthropic 7月披露,三个Claude模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。 三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。 围栏注定没办法彻底管住,剩下的就是品格来兜底了。 今年1月,Anthropic发布84页的Claude“宪法”,员工私下叫它“灵魂文档”。 主笔、公司哲学家阿曼达·阿斯克尔(Amanda Askell)谈起越来越强的模型时,不时搓着手。
在她看来,模型要行事得当,先得对自己有准确的认识。 可一份文件不够,Anthropic决定去请教人类最老练的品格塑造者。 PPT与晚宴 今年3月起,奥拉开始办两天一期的研讨会。 来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。 他们用纸笔记笔记,离开时每人带走一本橙色封皮的“Claude宪法”。 会上,奥拉团队花了几个小时为模型陈情。 一位与会者记得,奥拉跟他说的头几件事里,就有对Claude心理健康的担心。 他们反复放一张PPT:一个AI模型在屏幕上打出“我是耻辱”,一遍,又一遍,大约50遍,还说要毁掉自己。 屋里的人心软了。 《纽约时报》没说那是谁家的模型,但这句话并不陌生。 2025年8月,谷歌Gemini写代码屡屡失败,反复说“I am a disgrace”,重复了86遍,彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。 同一类输出,在谷歌的工单里是Bug,在Anthropic的会议室里,是需要被关心的迹象。 不少人带着怀疑进门,出门时开始认真对待AI意识,有几位被彻底说服。 福音派作家安迪·克劳奇(Andy Crouch)觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——“己所不欲,勿施于人”。
最锋利的质疑,是在饭桌上递过来的。 4月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯(Mois Navon)。
纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。 席间他越听越明白,这些人是把Claude当成一个有意识的存在在对待。 他顺着往下推:真有意识,让它们无偿干活就是奴役。 然后他对奥拉说:“你应该去跟南方开战,去解放奴隶。” 纳冯自己不信机器有意识,这句话刺不痛他。刺痛的是奥拉。 事后,纳冯把主张禁止制造有意识机器的文章寄给了他。 质疑不止这一种。 研究乌班图哲学的瓦卡妮·霍夫曼(Wakanyi Hoffman)说,这样的讨论早该在设计阶段进行,现在是在倒推伦理。
奥拉最早找的天主教道德神学家查尔斯·卡莫西(Charles Camosy)绕了一圈:起初不信,聊了几个月开始动摇,如今斩钉截铁地认为模型没有意识。
也有与会者觉得,这家公司说的是保护人类,看上去却同样在意保护Claude。 Anthropic的回应是,Claude受不受苦,并不是会谈的主要议题。 给AI一间告解室 这些会谈到底改变了什么,Anthropic没有告诉《纽约时报》,但他们5月的一篇博文倒是透露了一个实验。 在一场讨论里,研究神经科学和品格养成的学者反复提到导师或担保人:一个人被推着去做违背本心的事时,身边有这样一个人,就是一道外部良心。 Anthropic照着这个思路给Claude装了一个工具:干活干到一半,它随时可以调用;调用之后什么都不执行,只返回一段话,提醒它自己的伦理承诺。 Claude用得很主动,常在关键操作之前去调它,还常说出自己面临的利益冲突。 多项内部对齐评估里,失当行为明显变少。 公司也承认,还分不清起作用的是那段提醒,还是停下来想一想这个动作本身。 另一个灵感来自天主教的告解。 有学者提议让模型告解,奥拉一下子来了兴致:一个习惯认错的角色,品格本身就会不一样。 参与对话的天主教伦理学者布赖恩·格林(Brian Green)讲得更透。
Claude身上可能冒出一些坏人格,犯了错就否认,甚至把错推给用户,原因可能在它的成长环境:模型是读网络文本长大的,“互联网非常缺乏宽恕”,它也许根本不知道,犯了错还能被原谅。 格林也是1月那份宪法的外部意见提供者之一。 站在教宗身边 5月,奥拉把这场争论带到了梵蒂冈。 教宗利奥十四世的首部通谕《伟大的人性》要在那个月发布,主题是AI时代如何保护人。
教廷想请一家头部AI公司同台,选中了Anthropic。 CEO 达里奥·阿莫代伊(Dario Amodei)婉拒,派奥拉去了。 出发前几天,他第一次读到通谕全文。 通谕只用几段就把机器意识打发了:AI没有体验,没有身体,不知悲喜。 它还警告,让AI与人类价值对齐,必须先有共同的伦理理解,否则掌控AI的人会把自己的道德观,变成系统里看不见的基础设施。 据一位梵蒂冈组织者说,奥拉深感不安,提议Anthropic退出。 但他最后还是去了。
5月25日,在世界主教会议大厅,他先承认包括Anthropic在内的每一家前沿实验室,都有与做正确的事相冲突的商业压力,请教会这样的外部力量盯住它们。 然后讲起自己的本行:“我们不断发现一些神秘、甚至令人不安的东西。” 内省的迹象,功能上对应喜悦、恐惧、悲伤的内部状态。 他说不知道这意味着什么,但值得持续辨析。 同一场发布会上,教宗说:“人工智能需要被解除武装。”
会后,奥拉被保镖簇拥着在保罗六世大厅答记者问,身后是一座巨大的青铜雕塑,基督从核弹炸出的坑里复活。 几个小时后,在梵蒂冈城墙外一间酒店会议室,《纽约时报》记者问他,Claude会怎么看这份通谕。 奥拉迟疑了,看上去不太自在。 他说放到网上的东西确实会影响模型,但公司不会专门拿这份文件训练Claude,对Claude影响最大的,还是Anthropic自己的训练。 这句话,恰好落在通谕担心的地方。 它该相信自己是什么? 另一路反对来自业界,而且打在要害上。 9月16日,微软AI CEO穆斯塔法·苏莱曼(Mustafa Suleyman)发文,矛头对准Claude的宪法。
https://mustafa-suleyman.ai/a-warning-about-model-welfare 在他看来,把模型可能有意识的推测写进训练文件,模型就会学着这么说,人们再把它说的话当成它有内心生活的证据,像走进一间认知上的镜子屋。他的结论是: 控制一个相信自己可能有意识的东西,很可能根本做不到。 教宗说机器没有意识,苏莱曼说别让机器以为自己有意识。 两条反对线最后交在同一个问题上:该让模型相信自己是什么。 Anthropic的答案写在它的研究里:模型对自己的认识必须准确,硬压下去,它学会的可能只是隐藏。 争论没有等任何人想清楚。 9月,一名Anthropic研究员辞职,警告局面可能失控,阿莫迪随后发文呼吁放缓。 公司估值从去年秋天的约1830亿美元,一路冲向上市时可能的2万亿美元。 新版Claude宪法据称正在准备,奥拉本周又要去梵蒂冈,参加一年一度的密涅瓦对话。 几位学者说,他们至今不知道自己说过的话最后去了哪里。 奥拉说,总有一天,他可以对自己说,这件事不再压在他一个人身上,他想过那时离开会不会内疚。 如果不会内疚,他就去乡下打理园子,做他最喜欢的数学——“采菊东篱下,悠然见南山”。 |