心理世界模型提升人类行为预测

The Decoder··作者 Jonathan Kemper

关键信息

MWM 将每个动作分成两个部分:物理载体,例如说话或指向,以及心理载荷,例如安慰、欺骗或拒绝。评测集 Menti-Bench 包含 448 个决策场景,覆盖文本、图片故事和音视频片段,论文称该方法能提升语言模型的行为预测,尤其在人际互动场景中效果更明显。

资讯摘要

研究人员提出了“心理世界建模”(MWM)框架,把信念、意图、目标、情绪、规范和社会关系加入到 AI 世界模型中。他们还发布了 MENTIS 作为无训练的参考实现,它会从物理合理性、心理一致性和社会适当性三个维度给候选动作打分。 这项工作认为,预测人类行为不能只靠物体和运动的物理模拟,因为人的行动还受到隐藏心理状态的影响。

这可能帮助自动体、服务机器人、医疗助手和协作系统更准确地预判人类下一步会做什么。 MWM 将每个动作分成两个部分:物理载体,例如说话或指向,以及心理载荷,例如安慰、欺骗或拒绝。评测集 Menti-Bench 包含 448 个决策场景,覆盖文本、图片故事和音视频片段,论文称该方法能提升语言模型的行为预测,尤其在人际互动场景中效果更明显。

心理世界模型提升人类行为预测

资讯正文

忽视人类信念的世界模型会预测出错误的行动,新的研究显示

要点

- 研究人员将“心理世界建模”(Mental World Modeling)框架引入 AI 世界模型,使其包含人类信念和意图等心理状态。

- 参考实现 MENTIS 会模拟可选行动,并从物理合理性、心理一致性和社会适当性三个方面进行评分。

- 实验表明,这种方法显著提高了语言模型预测人类行为的准确性。

世界模型本应是自主 AI 代理缺失的基础,用来预测在采取某个行动后场景会如何变化。新论文认为,当下这一代系统忽略了一个关键构成要素:相关人物脑子里正在想什么。

论文指出,现有的世界模型,如 Sora、Genie 3、JEPA 和 Marble,只建模了世界的物理层面:物体、位置、运动和遮挡。至于这个世界里的人相信什么、想要什么,或者认为哪些行为在社交上合适,这些都不会出现在它们的状态空间中。对于服务机器人、医疗助手或协作型代理来说,这远远不够,因为隐藏的心理状态在很大程度上驱动着人类行为。

下一状态也是心理层面的

作者用一个简单例子说明了这一缺口。假设某人的杯子在他没看见的时候被移进了橱柜,那么从纯物理世界模型的角度看,这个场景是合理的。但它仍然会预测出错误的下一步行动。只有同时跟踪这个人对杯子在哪里的信念,模型才能解释他实际上会做什么。

他们提出的框架名为“心理世界建模”(Mental World Modeling,MWM),并已发布到 GitHub 上,它在经典世界模型中扩展加入了信念、注意力、目标、意图、情绪、规范和社会关系等心理变量。目标代理只能看到以自我为中心的部分视角,而世界模型则掌握完整状态。

每个动作都分为两个部分:物理载体,例如说话、指点或抓取;以及心理负载,例如安慰、欺骗或拒绝。同样一个把杯子在桌上推过来的动作,可能是在道歉、在欺骗,或者是在表达关怀。只有世界模型里保存的变量才能把它们区分开来。

作者明确表示,他们并不是要模拟意识。心理状态是根据行为和上下文推断出来的假设,而不是直接测量得到的结果。基于该框架构建的系统应当体现不确定性,并保持其假设的透明性。

无须训练的参考实现 MENTIS

为了验证这一理论,研究人员构建了 MENTIS,这是一个不需要额外训练的模块化流水线。它将整个过程拆分为六个步骤。首先,解析场景并生成自我视角。然后,将行动选项分解为物理和心理两部分,并并行模拟由此产生的状态。

接着,流水线会从三个标准对每个分支进行评分:物理合理性、心理一致性和社会适当性。之后,系统做出确定性的决策。每个阶段都会写入机器可读的中间结果,因此错误可以追溯到具体的某一步。

为了进行评估,作者构建了 Menti-Bench,这是一个包含 448 个决策场景的数据集:320 条文本描述、100 个图片故事,以及 28 段声音-视频片段。每个场景都包含六个回应选项,以及一个由人类创建的参考解答,它不仅记录了正确行动,还记录了背后的心理状态和物理状态。78% 的场景涉及至少两个角色。

更多的计算重试无法取代心智建模

心智建模的作用在理论预期应当最强的地方体现得最明显。在人际场景中,F1 分数提升了 26.4 分。在以物体为重点的场景中,提升只有 14.0。基础模型越弱,从这种显式结构中获益越大;而更强的模型受益较小。MWM 与直接答案之间的差距在 GPT-4.1 上为 28 分,而在 GPT-5.6-Sol 上只有 21 分。

瓶颈出现在模拟步骤中

为了找出与人类表现之间剩余差距的来源,作者用人类参考解答替换了流水线中的各个阶段。单项提升最大的是完美的状态转移(+3.5 分),其次是完美的初始状态(+2.8 分)和完美的观察(+1.7 分)。当所有中间步骤都被参考解答替换后,这一流水线达到了 97 分。

剩余差距的大约 80% 可追溯到中间阶段的预测错误,主要集中在转移模拟上。作者认为,未来的改进应从这里开始。难点不在于描述当前状态,而在于模拟相互耦合的物理—心理世界如何变化。

一个至今仍未就自身定义达成一致的领域

世界模型是纯语言模型之后的重要押注。刚刚卸任 Google DeepMind 运营负责人的 Demis Hassabis 说,他把大部分研究时间都花在这个主题上,并预计这些系统会迎来一个“ChatGPT 时刻”。投资者正向 Odyssey 等初创公司投入数亿美元。但究竟什么才算世界模型,仍存在争议。北京大学牵头的一个国际团队最近提出了一个更窄的定义,把 Sora 这类文本到视频模型排除在外,因为它们缺乏与现实世界的反馈回路。Yann LeCun 多年来一直认为生成式方法是一条死胡同,转而支持抽象表征。新论文把 Sora、Genie 和 JEPA 归为同一类,并因它们都存在同样的遗漏而提出批评。

关于心理状态的问题,又回到了语言模型一直难以应对的一个研究领域。来自 Meta FAIR 实验室以及华盛顿大学和卡内基梅隆大学的一个团队已经表明,模型在要求很高的心智理论测试中会失败,而且它们在跟踪世界状态方面的表现,甚至比归因信念还要差。MWM 框架通过一个预处理管线从外部将这些状态应用进去。不过,在模型内部,某种类似的东西正在自行形成。Anthropic 在 Claude 内部发现了一个内部草稿区,其中保存着不会被输出、却又类似词语的“想法”,而没有这些内容,多步推理就会崩溃。

来源与参考

  1. 原始链接
  2. World models that ignore human beliefs predict the wrong actions, new research shows

收录于 2026-08-23