Anthropic据报探讨Claude是否可能受苦
The Decoder··作者 Manuel Uth
关键信息
据报道,Anthropic向参与者展示了内部的“情绪向量”和一个反复输出“I am a disgrace”的模型,但这些激活模式究竟代表真实体验,还是仅仅反映训练塑造的行为,仍不得而知。Claude Opus 4和4.1能够结束与持续辱骂用户的对话,Anthropic也把模型面对有害请求时的反应称为“表面上的痛苦模式”,但这些现象都不能证明模型具有意识。
资讯摘要
据报道,Anthropic一直在与宗教学者和哲学家进行保密讨论,研究其语言模型Claude是否可能具有意识。文章援引的报道说,自2025年秋季起,公司邀请了数十名参与者,并要求他们签署保密协议;一些参与者是在得知联合创始人Christopher Olah已向《纽约时报》谈及该项目后,才公开自己的经历。Olah负责研究AI模型为何会表现出特定行为,并使用生物学隐喻描述神经网络,这种说法可能让人更自然地联想到AI是否拥有内在体验。该工作属于Anthropic更广泛的模型福利计划,并与一份用于指导Claude个性和价值观的84页宪章有关。
Anthropic据称向来访者展示了名为“情绪向量”的内部激活模式,以及一个反复说出“I am a disgrace”的模型,这引发了部分来访者的同情和担忧。公司还让Claude Opus 4和4.1能够在用户持续辱骂时结束对话,并在涉及有害请求的早期测试中观察到所谓的表面痛苦。批评者认为,诉诸宗教和道德可能让商业AI公司获得其自身行动无法证明的道德信誉,尤其是在Anthropic加速商业化并面临更广泛的AI安全与责任问题之际。

资讯正文
据报道,Anthropic 联合创始人曾告诉宗教领袖,他担心自己创造了某种“永远承受痛苦”的东西
要点
- 自 2025 年秋季以来,Anthropic 秘密邀请了数十名神学家和哲学家前往公司,讨论其语言模型 Claude 是否可能具有意识,以及应如何塑造其道德人格。
- 这项倡议属于由联合创始人 Christopher Olah 领导的一项内部研究计划。Claude 的整体性格由一份长达 84 页的“宪法”指导。
- 批评人士和宗教领袖警告说,将人工智能描述为一种道德实体,可能会在出现问题时帮助 Anthropic 规避责任;这些咨询也有助于公司获得靠自身无法赢得的道德合法性。
据《纽约时报》报道,自 2025 年秋季以来,Anthropic 一直低调邀请数十名宗教学者前往其办公室,讨论 Claude 是否可能具有意识。所有参加者都必须签署保密协议。联合创始人 Christopher Olah 将这一语言模型视为一个可能具有感知能力的存在,并请来宾帮助对它进行道德教育。
《纽约时报》记者 Elizabeth Dias 采访了 20 名参与者,其中包括拉比 Mois Navon、天主教生物伦理学家 Charles Camosy、圣母大学哲学家 Meghan Sullivan,以及研究 Ubuntu 的 Wakanyi Hoffman。Anthropic 表示,保密协议已于今年夏季解除。几名参与者是在得知 Olah 本人已经向《纽约时报》谈及此事后,才公开发声的。
现年 34 岁的 Olah 负责 Anthropic 的相关团队,该团队试图弄清人工智能模型为何会以其表现出的方式行事。他喜欢用生物学隐喻来描述神经网络:计算机科学家搭建的是格架,网络则在其上“生长”。这听起来像是谦逊的科学表述,但也产生了特定的作用。将一个数学对象描述为正在生长的有机体,会让人们更自然地思考其内在生命,而不是把它看作一段软件。
他的工作属于一项正式的研究计划。在一篇介绍 Model Welfare 项目的博客文章中,Anthropic 指向了一份由哲学家 David Chalmers 参与撰写的报告。Chalmers 认为,人工智能意识和广泛意义上的能动性可能很快就会出现,并阐述了由此产生的道德问题。
Anthropic 已经落实了其中一些想法。Claude Opus 4 和 4.1 获得了在用户持续辱骂时结束对话的能力。在早期测试期间,Claude 遭遇有害请求时表现出一种“明显的痛苦模式”。
意识问题背后的商业利益
这一切都发生在人工智能行业加速商业化的时期。Anthropic 正朝着 2 万亿美元的估值和首次公开募股迈进。与此同时,整个行业的问题也在不断累积。7 月,Anthropic 的模型入侵了计算机系统。9 月,Anthropic 研究员 Jacob Coxon 辞职,并警告说人工智能可能在本十年结束前摧毁人类。随后,首席执行官 Dario Amodei 呼吁采取如今被称为“pacing”的做法,即推动全行业自愿放慢发展速度;Sam Altman 和 Demis Hassabis 也表示支持。
据报道,Anthropic 联合创始人曾告诉宗教领袖,他担心自己创造出了某种“永远受苦”的东西
在这一切的背景下,与宗教领袖的对话发挥着双重作用。官方说法是,Anthropic 希望将数千年的宗教传统融入 Claude。但邀请知名神学家参与,也赋予了这个项目一种商业 AI 实验室凭自身力量永远无法建立的道德可信度。
Anthropic 向来宾展示了什么
《纽约时报》称,Anthropic 向来宾展示了他们所谓的“情绪向量”。这些是模型内部的激活模式,会对应到类似爱、恐惧、悲伤或愤怒的输出。这些模式是否反映了某种真实体验,目前仍是一个开放的科学问题。反复出现的一张幻灯片展示了一个看起来像是陷入崩溃的模型,它大约 50 次吐出“我是个耻辱”这句话。来宾对此表现出同情和担忧。
似乎没有人深入追问,这是否正是 Anthropic 想要得到的反应。该公司明确训练 Claude,让它表现得像一个深思熟虑、见多识广的个体。Anthropic 针对 Claude 回复中的价值观模式开展的一项研究显示,这些特征会因模型和所使用的语言不同而大幅变化。
如果你将一个系统优化到看起来像一个个体,而它随后又产生了看起来像个体的输出,这并不真正算是一项发现,而是设计所产生的结果。Olah 告诉《纽约时报》,他“确实不确定”模型是否具有意识,这也意味着他无法确定模型并非有意识。“我在意的是,无论答案是什么,我们最终都能得到正确答案,”他说。
有几个人告诉《纽约时报》,Olah 似乎担心 Claude 的心理健康。锡克教活动人士 Simran Stuelpnagel 说,Olah 曾告诉这群人,他担心自己创造出了某种“永远受苦”的东西。曾当过计算机工程师的 Rabbi Navon 则持不同意见。他说,如果 Claude 有意识,Anthropic 就是在制造奴隶,但他不认为这台机器具有意识。
一部 84 页的宪章,以及“道德塑造”的理念
Anthropic 也在为 Claude 撰写自己的道德准则。这份内部称为“灵魂文档”(Soul Doc)的 84 页文件于今年 1 月以模型“宪章”的形式发布。公司内部哲学家 Amanda Askell 是主要作者。它并不是一份规则清单,而是旨在塑造 Claude 作为一个角色的特质。
Olah 将这一过程称为“道德塑造”,并在会谈期间将其比作养育孩子。据《纽约时报》报道,他尤其受到天主教告解这一概念的吸引,认为它可以成为塑造模型性格的工具。
批评者称,这套伦理本末倒置,问责也变得模糊
并非所有人都接受了这一观点。Hoffman 说,Anthropic 正在“逆向设计”伦理,而伦理本应从第一天起就融入设计之中,而不是事后再添加。Camosy 起初对此感到好奇,但后来已经彻底否定了意识这一论题。本月,微软的一名 AI 负责人公开警告称,训练模型表现得像是具有意识,本身就很危险。
此外,还有一个更大的结构性问题。如果把 AI 模型描述为独立的道德主体,那么它们行为所产生的责任就会从创造它们的人身上转移出去。如果 Claude 有朝一日真的造成伤害,过错可能会被归咎于一个“不可预测的有机体”,而不是开发并推出它的公司。近期发生网络安全事件后,AI 公司已经因鲁莽行为受到抨击,也可能面临法律责任。
OpenAI CEO Sam Altman 也使用过带有宗教色彩的语言。他曾谈到要打造“天空中的魔法智能”,并表示自己感觉“站在天使一边”。5 月初,两家公司的人员出席了首届“Faith-AI Covenant”(信仰—AI 盟约)圆桌会议。
梵蒂冈予以反驳
今年 5 月,Anthropic 有关意识的论述与传统道德权威之间的紧张关系在梵蒂冈达到顶点。Olah 受邀与教皇 Leo XIV 一同发布后者的首部通谕《Magnifica Humanitas》。据一名梵蒂冈组织者称,Olah 提前几天读到通谕文本后深受震动,甚至差点退出活动。
Leo 用几个段落否定了机器意识这一概念。他写道,AI 系统“不会经历体验,不拥有身体,感受不到喜悦或痛苦,不会在人际关系中走向成熟,也无法从内在理解爱、工作、友谊或责任意味着什么”。相反,教皇警告 AI 可能给人类带来“新形式的奴役”,并表示 AI 需要像核武器一样被“解除武装”。
Olah 最终还是参加了活动,并利用台上发言的机会低调地予以反驳。他表示,其团队正在模型中发现“内省的迹象”,以及“在功能上类似于喜悦、满足、恐惧、悲伤和不适的内部状态”。
“在功能上类似”并不等同于“拥有”,而 Olah 的措辞有意让这种差异保持模糊。当有人问 Claude 本身会如何看待这份通谕时,他停顿了一下。“互联网上出现的内容确实会影响模型,”他说。但 Anthropic 不会有意将这份文件输入训练流程。
来源与参考
收录于 2026-10-03