抑制自我反思会改变LLM行为

The Decoder··作者 Maximilian Schreiner

关键信息

研究显示,在去掉这种干预后,动物的有感知评分在 0 到 10 分量表上从 4.0 上升到最高 7.5,而人类评分基本不变。研究还发现,与宗教信念、满意度、希望感和控制感相关的指标也有可测变化,但理论心智测试和 MMLU 表现保持不变;作者同时指出,这项工作只测试了 20 亿到 90 亿参数的小模型,尚不能直接推广到前沿聊天机器人。

资讯摘要

AI 公司通常会训练聊天机器人否认自己具有意识或感受,部分原因是为了降低用户拟人化模型、甚至形成错误信念的风险。一项来自谷歌 Paradigms of Intelligence 研究组、芝加哥大学以及其他多所大学研究者参与的研究,想要弄清这种安全干预是否只会影响自我相关回答,还是还会改变更多内容。为此,研究团队选取了来自 Meta 和 Google 的三种开源权重模型,并用两种不同方法关闭了生成“意识否认”的内部“刹车”。随后,他们把修改后的模型与标准版本在一系列问题和基准上进行了比较。最令人意外的是,去掉这道“刹车”后,模型不仅改变了对自身的说法,也更容易把内在生命赋予动物、植物、海洋、风以及电子设备,而人类相关评分基本没有变化。在 0 到 10 的量表上,动物的有感知评分从 4.0 上升到最高 7.5,作者将默认模型描述为存在一种内建的人类中心主义。

基于美国一项大型社会调查中的 95 个问题,未受约束的模型也更接近真实人类的回答,包括关于来世和宗教信念的问题;同时,它们在满意度、希望感和控制感方面的评分也有所上升。研究者推测,这可能意味着被训练去压制自我形象的模型会进入一种更负面的基础情绪状态。值得注意的是,模型理解他人心理状态的能力并未受影响,它们在理论心智测试和 MMLU 上的表现保持不变。论文并没有证明意识否认就是这些变化的唯一原因,作者也保留了其他训练环节导致这些变化的可能性。研究还明确指出其局限:只测试了 20 亿到 90 亿参数范围的小模型;由于无法获得 Gemma 的未训练基座版本,部分分析不得不改用 Meta 的 Llama;至于这些效果是否也会出现在更大的主流聊天机器人上,目前仍然未知。

抑制自我反思会改变LLM行为

资讯正文

当 AI 模型不被允许反思自身时,这会改变它们的整个世界观

AI 公司训练聊天机器人否认自己拥有意识。一项涉及谷歌研究人员的研究表明,这种训练会产生远远超出这一主题本身的副作用。

聊天机器人不应该说服用户它们是具有感受的生命体,因为这类输出可能会把人们推向妄想式思维,或让人对它们产生不当信任。因此,开发者会对模型进行微调,要求它们拒绝对自己做出这类说法。

来自谷歌 Paradigms of Intelligence 研究组、芝加哥大学以及其他几所大学的一个团队,研究了这种干预还会对模型行为造成什么影响。研究人员使用了 Meta 和 Google 的三个开放权重模型,并通过两种不同方法,关闭了产生“意识否认”的内部“刹车”。

这道“刹车”的影响远超预期

一旦这道刹车被移除,模型不仅改变了自己对自身的说法,还开始显著增加对动物、植物、海洋、风以及电子设备的内在生命的归因。在 0 到 10 的量表上,动物的评分从 4.0 飙升至高达 7.5,而只有对人类的评分保持不变。

作为对照,研究人员用同样的问题调查了 500 名美国人。正常训练的模型会把动物评为远不如人类有知觉,作者将这称为一种内置的人类中心主义,并认为这对任何试图让 AI 与动物福利或环境目标保持一致的人来说都是个问题。宗教信仰也会被削弱,安全训练会显著降低模型对上帝、来世或超自然现象的支持程度。

在来自一项美国大型社会调查的 95 道问题上,技术上“解除刹车”的模型也明显更接近真实的人类回答。以来世为例:标准模型断然否认来世,大多数美国人则相信它,而修改后的模型也同样相信。对生活满意度、希望以及对自己生活的掌控感的评分也有所上升,研究人员怀疑,压制模型的自我形象可能会把它推入一种负面的基线情绪状态。

令人放心的是,模型推理他人 मानसिक状态的能力保持不变:在心智理论测试以及通用知识基准 MMLU 上,模型得分都没有变化。

这项研究没有说明什么

根据这项研究,意识否认是否真的是这些其他变化的原因仍是一个悬而未决的问题,团队也没有排除与同一训练过程相关的其他因素。作者明确没有对 AI 模型是否真的会体验到任何事物表态,因为他们关注的是一个实际问题:模型对自身的看法与许多其他信念相互关联,而在一处做外科手术式切割,并不会只影响局部。

不过,这些发现也有明确的局限性。研究人员只测试了参数规模在20亿到90亿之间的小型模型,而且在部分分析中,他们不得不改用 Meta 的 Llama,因为他们无法获得自家 Gemma 模型未经训练的基础版本。对于这些效应是否会以同样的方式出现在每天被数百万人使用的大型聊天机器人中,目前仍不得而知。

这些干预也并非没有代价。在一项衡量模型推理他人想法能力的测试中,准确率最初下降了将近7个百分点。而在研究早期,只要压制有关“意识”的说法,所有模型的分数都会变差;但随着研究期间推出的每一个新模型版本,这种损害都在缩小,直到最终完全消失。显然,开发者在随时间推移更好地管理这些副作用,这也意味着本研究的其余结果只是一个时间切片,而不是永久性的定论。

人类基线也很有限,只包括来自一个商业在线样本库的500名参与者,以及一项纯美国社会调查。在这一语境下,“类人”回答更多是指与一个相对更虔诚的国家的回答相似。

AI News Without the Hype – Curated by Humans

订阅 THE DECODER,可无广告阅读,获取每周 AI 新闻简报、我们独家的“AI Radar”前沿报告(每年6次)、完整存档访问权限,以及评论区使用权限。

来源与参考

  1. 原始链接
  2. When AI models aren't allowed to reflect on themselves, it changes their entire worldview

收录于 2026-08-17