为什么流畅的LLM不等于真正推理

MIT Technology Review AI··作者 Thore Graepel

关键信息

AlphaGo将负责提供合理候选着法的策略网络,与构建并评估棋局树的搜索机制结合起来;其策略网络认为人类高手下出第37手的概率极低,大约只有一万分之一。相比之下,思维链只是让大型语言模型增加更多生成中间词元的步骤,而文章认为这些步骤仍来自同一下一个词预测过程,并非独立的搜索机制。

资讯摘要

2016年3月,AlphaGo在首尔与李世石对弈,在第二局的第37手把一枚棋子下在了第五线,这步棋看起来非常反常,以至于一些评论员怀疑程序出了故障。最终,AlphaGo以4比1赢下五番棋比赛,李世石表示,这一步改变了他对该系统的看法,让他觉得AlphaGo具有创造力,而不只是进行概率计算。文章将这一成就与1997年深蓝战胜国际象棋世界冠军的事件进行对比:深蓝依靠人类预先写入的规则,每位棋手向前计算六到八步,并且每秒评估约两亿个棋局。围棋更难直接搜索,因为一枚棋子的价值取决于棋群和领地在许多后续回合中的发展,因此AlphaGo必须快速判断局面,并探索具有战略意义的未来。

AlphaGo的策略网络负责快速提供具有直觉性的候选着法,而搜索系统则明确构建包含数千分支的棋局树,评估可能的后续变化和应对手段。这种结构类似于行为科学中快速联想的系统一和缓慢审慎的系统二,且两个部分缺一不可。文章认为,当前大型语言模型主要是逐个生成词元;虽然思维链在数学和编程等领域确实带来了改进,但它仍是同一预测过程的延长,而不是真正独立的推理机制。

为什么流畅的LLM不等于真正推理

资讯正文

别被误导——大型语言模型并不会推理

2016年3月,在首尔的一个下午,我看着一个由我参与开发的程序把一枚棋子落在围棋棋盘的第五线上,看起来像是送给人类对手的一份礼物。五局比赛第二局中的第37手看起来荒谬至极,以至于一些评论员认为这是编程故障。事实并非如此。AlphaGo最终赢下了这盘棋,并以4比1击败了李世石——他是有史以来最伟大的职业围棋棋手之一。“我原以为AlphaGo是基于概率计算的,它不过是一台机器,”李世石事后说,“但当我看到这一手时,我改变了想法。AlphaGo肯定是有创造力的。”

1997年,Deep Blue击败当时在位的世界国际象棋冠军加里·卡斯帕罗夫时,它通过提前预判每位棋手未来六到八步,并利用人类预先硬编码的规则,每秒评估2亿个国际象棋局面。围棋的复杂程度要高得多。一枚棋子的价值取决于相距甚远的棋群和地盘如何在几十手棋中逐步展开。即便只计算所有可能结果中的一小部分,也需要超级计算机运行数十亿年。为了获胜,AlphaGo必须一眼判断谁占据优势,甚至创造出此前没有人想到过的下法。

这正是许多关于AlphaGo与李世石对弈的报道将第37手描述为纯粹机器直觉的闪现的原因。但这种理解是错误的。实际上,是AlphaGo的推理能力促成了这一创造性选择——而今天的AI并不具备这种能力。如果我们希望未来的AI系统能够在科学、医学等领域产生值得信赖的结果和真正新颖的洞见,就需要赋予它们这类真正的推理能力。

AlphaGo由两个系统组成。第一个是策略网络,训练目标是猜测一名强 human 棋手会下哪一步。这个“直觉”部分并不认为第37手有什么特别之处——它判断一名顶尖人类棋手下出这一手的概率大约只有万分之一。真正让AlphaGo选择这一手的,是程序的搜索机制:它不局限于眼前的合理性,而是权衡候选着法可能带来的未来后果。它明确构建并搜索了一棵拥有数千个分支的博弈树,每个分支都代表一种不同的可能未来。

行为科学中有一个广为人知的理论,经丹尼尔·卡尼曼推广后广受关注。该理论将人类思维区分为两种模式:系统1快速、凭直觉、无需费力;系统2缓慢、循序渐进并经过审慎思考。AlphaGo提供了一个引人注目的机器版本。它的神经网络提供直觉——这一手看起来有希望,这个局面看起来能赢;它的搜索机制则负责审慎思考,依据接下来可能出现的着法与应对着法检验这些直觉。正如人类认知一样,任何一半都无法单独发挥作用。仅凭直觉,系统绝不会选择第37手;而单纯依靠蛮力搜索,也很难从数量众多的可能着法中筛选出结果。

这与今天的AI模型工作方式截然不同。大型语言模型一次又一次地选择下一个词元。这相当于系统1在运作——快速、凭联想,并且能够在几乎所有人类书写过的主题上,以惊人的效果完成模式匹配。

别被蒙骗了——LLM 并不会推理

ChatGPT 问世后不久,这一领域就意识到,仅有语言流畅性远远不足以带来真正的实用性。显而易见的解决方案,是让模型进行审慎思考:它们不再立即作答,而是可以生成中间步骤,将问题拆解开来,逐步推进部分结果,并影响后续推理——这一过程被称为思维链(chain of thought)。事实证明,这确实带来了提升,尤其是在数学和编程领域。但与 AlphaGo 的搜索不同,这并没有引入一种真正独立的推理机制:中间推理仍然是由同一套“下一个词元预测”过程生成的,只是在模型最终给出答案前进行了更长时间的迭代。

有三个缺陷,使聊天机器人所做的事情无法被称为推理(至少不是科学家所理解的那种推理)。第一,这些模型通常不会维护明确、持久且可检查的认知状态。它们没有一份公开的记录,列出模型正在考虑的假设、对各种解释的信心程度、正在权衡的证据,以及尚未解决、仍在保留的问题——而所有这些内容都应当随着新信息的到来而得到系统性修正。第二,它们缺乏对系统所掌握的知识与系统如何操纵这些知识之间的清晰区分。知识和推理不可分割地交织在神经网络的权重之中,并不存在一套独立且明确表示的信念。第三,尽管聊天机器人生成的思维链看起来像是在进行审慎思考,但研究已经证明,机器人往往是在事后编造这些思维链:它们通过一条路径得出答案,却报告了另一条路径。

这之所以成为问题,是因为在医学、工程和科学研究等我们都十分关心的高风险应用中,系统得出了什么结论固然重要,但它是如何得出结论的同样重要。当错误发生时——例如在医疗诊断和治疗中——我们需要能够准确找出问题所在:是系统的推理出了错,还是它采用了无效证据,抑或是它作出了错误的假设?

这就是我最近离开 Google DeepMind 职位的原因。我认为,我们需要一种全新的机器推理方法——一种借鉴 AlphaGo 架构的方法。AlphaGo 会记录有关某一局面的一切已知信息:也就是博弈树。这种数据结构包含 AlphaGo 考虑过的所有变化和可能的未来,其中每一步棋和每个局面都标注了神经网络作出的判断。随着推理推进,AlphaGo 会更新博弈树,最终综合其中的信息,决定下一步该走什么棋。

同样,对于一般性的推理,一个系统应当维护一种认知状态,表示系统认定哪些事情已经确定、对哪些事情存有疑问、排除了哪些可能,以及哪些问题仍然悬而未决。这样一来,推理就可以被理解为一系列改变认知状态的步骤,目的是推进知识并减少不确定性:推导后果、将问题拆解成各个部分,以及——至关重要的是——决定下一步该提出什么问题、进行什么计算,或开展什么实验。

当然,开放世界中的推理比下围棋或国际象棋之类的棋盘游戏更困难。在现实世界中,我们只能部分了解当前事态,可采取的行动集合庞大且不断变化,而行动的后果则具有随机性,或根本无从得知。

但近年来,LLM 和其他神经网络模型取得的进展,如今已使我们有能力应对这类通用推理问题。例如,LLM 可以根据已知信息和可用资源,提出解决问题的方法。它们可以通过 API 或代码与工具交互,并帮助评估某项主张是否得到现有证据的支持。

最重要的是,为了确保系统诚实可靠,系统中必须有一个独立部分,根据每一步在多大程度上真正消除了不确定性来评估该步骤,并且只有在变化有证据支持时才更新信念。一旦严格执行这些规则,模型就能积累经过验证的知识,并通过学习以往的推理经验来改进其推理策略。你可以把这样的系统理解为“加强版的科学方法”,其目的是产出经得起审视的知识。

我不认为,仅仅把系统 1 做得更大,就能实现值得信赖的机器智能。规模扩大可以让直觉更加敏锐,却不会使直觉更具审慎思考的能力。第 37 手之所以意义重大,是因为一台机器分析了当前局面,权衡了各种可能的未来,并选择了一步很可能会被其人工直觉否决的棋。社会需要在药物发现、材料、气候和诊断等领域出现这样的创造性举措——在这些领域,棋盘看起来与围棋棋盘截然不同,也没有人会把规则直接交给我们。只有依靠真正进行推理的系统,我们才能获得这样的洞见:其结论来自一系列可审计的证据、推断和信念修正,而不是事后编造出的一个听起来令人信服的故事。

来源与参考

  1. 原始链接
  2. Don’t be fooled—LLMs don’t reason