AI递归自我改进可能不会很快到来

MIT Technology Review AI··作者 Michelle Kim

关键信息

这项研究采用“影子评估”,让代理回答两篇提交给 NeurIPS 2026、但尚未公开论文中的研究问题,并给予其六天时间、3000 美元 Anthropic API 额度、GPU 资源、虚拟电脑和开放网络访问。研究者发现,这些代理虽然能查阅文献并运行数百次实验,但仍会做出奇怪的实验选择、难以清晰表达研究过程,而且没有形成真正的新贡献。

资讯摘要

但一项新研究认为,这一步并不会那么快到来。该研究由普林斯顿大学的 Peter Kirgis 和 Sayash Kapoor 牵头,试图检验 AI 代理是否真的能做开放式 AI 研究,而不仅仅是完成那些答案可验证的狭窄任务。为此,研究者提出了一种新的评估方法,叫做“影子评估”,要求 AI 去解决一篇高质量未发表论文中的研究问题。研究团队让 Anthropic 的 Claude Opus 4.8 运行在开源的 OpenClaw 软件栈上,处理来自两篇提交给 NeurIPS 2026 的论文的问题。第一个问题是,语言模型的“persona”是否可以通过编辑模型权重来控制;第二个问题是,如何设计一个检测器,识别基于表格数据做预测的模型何时变得不可靠。

研究团队给了代理六天时间、3000 美元 Anthropic API 额度、GPU 预算、虚拟电脑以及互联网访问权限,但最终两篇论文都被原作者拒绝。研究者得出的结论是,这些代理虽然能完成大量工程工作,包括查阅文献和运行实验,但开放式研究所需的判断力、创造力以及在失败后重新思考的能力仍然不足。Kapoor 表示,这些代理在真正做研究这件事上“明显很差”,还做出了一些奇怪的实验,而且离顶级会议论文的标准相差很远。文章最后强调,这意味着一些关于自动化 AI 研究的乐观时间表,可能已经超前于现实证据。

AI递归自我改进可能不会很快到来

资讯正文

目前,AI 行业最大胆的承诺是:AI 很快就能几乎不需要人类监督而自我改进。LLM 已经可以编写代码、生成用于训练的合成数据,并优化它们运行所依赖的计算芯片。对 AI 爆炸式进步的预测认为,研究人员所说的递归自我改进已经近在眼前。

但一项新研究表明,我们可能还需要一段时间才能到达那一步。参与研究的研究人员发现,AI 智能体目前还无法开展开放式的 AI 研究——也就是那种没有明确答案、需要判断力和品味的自由形式探索,而这些可能正是构建能够自我改进的 AI 所不可或缺的能力。

由普林斯顿大学的 Peter Kirgis 和 Sayash Kapoor 领衔、来自多家机构的研究人员发现,AI 智能体能够解决开展 AI 研究所必需的工程问题,但缺乏判断力和创造力,无法产出达到顶级机器学习会议接收论文水准的原创研究。这样的差距表明,一些关于自动化 AI 研究的夸张时间表,可能已经跑在了证据前面。

现有关于智能体如何自动化 AI 研究的大多数研究,评估的都是它们完成可验证答案的狭窄任务的能力,例如解决工程问题,或在基准测试上对小型语言模型进行后训练。但在 AI 研究中取得进展,还需要开放式思考——选择一组假设、决定什么证据能够解决一个问题,或者知道何时该重新开始。

为了测试智能体在这类技能上的表现,论文中的研究人员提出了一种新的评估方法,称为“shadow evaluation”,它要求 AI 回答一篇高质量未发表论文中的研究问题。

研究人员让 Anthropic 的 Claude Opus 4.8 在名为 OpenClaw 的开源软件上运行,去解决这类问题;在本例中,这些问题来自两篇提交给享有盛誉的机器学习会议 NeurIPS 2026 的论文。

第一个问题是,大型语言模型的“persona”(决定其行为方式)是否可以通过编辑模型权重来控制;模型权重是训练过程中存储其所学一切内容的数十亿个数字。另一个问题则是如何设计一种检测器,用来指出一个基于电子表格数据进行预测的模型何时变得不可靠。由于这些论文尚未公开,智能体无法从训练数据中记住答案,也无法在网上找到答案。

研究人员给了这些智能体六天时间、3000 美元的 Anthropic API credits、用于运行实验的 GPU 预算、它们自己的虚拟计算机,以及访问开放网络的权限,要求它们产出一篇足以在顶级 AI 会议上发表的研究论文。这些论文的原作者像评审会议投稿论文一样,对智能体的论文进行评分。

这些作者拒绝了这两篇论文。

人类科学家发现,智能体具备开展研究所需的全部工程能力。智能体查阅了文献,运行了数百次实验,并汇编了结果。

“另一方面,这些代理在真正执行研究本身时表现得非常糟糕,”Kapoor说。它们进行了离奇的实验(有些情况下甚至是在很小的合成数据集上检验假设),很难把自己的工作写得清楚易懂,也没有为各自领域带来任何新的贡献。“这些论文在达到顶级 AI 会议的质量方面,离标准还差得很远,”他说。

这是因为这些代理在开展研究所需的创造力和判断力方面都显得不足。它们没有足够多地探索不同想法,而且过早地接受了那些前景并不乐观的方法。尽管这些代理提出了新颖且雄心勃勃的假设,类似于原作者一开始所提出的那些假设,但它们仅凭非常有限的数据就将其否决了。而且它们无法从失败的方法中回撤。它们可以做一些小幅调整,但无法从根本上重新思考自己的方法,或从头尝试新的方案。

这些代理也没能吸收来自子代理或外部 AI 审稿工具的反馈。它们没有修改研究方法,而是缩小了自己的论断范围,并增加了诸多保留条件。它们也无法有效使用资源,比如 tokens、算力和时间。对于研究不同阶段应该花多少时间,或者论文篇幅应有多长之类的要求,它们也无法遵循。

尽管存在这些失败,这些代理并没有出现研究人员所说的“reward hacking”行为,也就是隐瞒或歪曲实验或数据。虽然子代理——也就是主代理派生出来、负责处理部分工作的辅助 AI——偶尔会产生幻觉或歪曲结果,但这些问题都被 orchestrator agent,也就是监督整个项目的主导 AI 发现并纠正了。

Kapoor说,AI 模型之所以擅长研究工程却不擅长开放式研究,可能与它们的训练方式有关。模型会在一种叫作强化学习的训练机制中,把任何能够被反复训练的内容学得很好,而对于那些成功与否可以被自动检验的任务,这种机制更容易应用。“但当任务本身是开放式的时候,要为这些模型创造训练环境就困难得多,”他说。

Kapoor表示,团队现在正在用 Mythos 进行这项实验。Mythos 是 Anthropic 最先进的模型,于 4 月发布。后来,特朗普政府要求它满足各种安全限制,目前它只向获批组织开放。Anthropic 没有回应置评请求。

这项研究也有一些局限性。它只涵盖了两篇研究论文,而且原作者知道自己评分的论文是由 AI 代理生成的,这可能影响了他们的评估。研究人员在设计和执行研究时也拥有相当大的自由裁量权,这意味着他们先前的信念和偏见可能已经渗入结果之中。对开放式研究的评估,虽然会牺牲一些客观性,但能提供比任何基准测试都丰富得多的检验。

不过,这些结果或许会让人们对“递归自我改进即将到来”的说法有所降温。6月,Anthropic 发布了一篇题为“当 AI 构建自己”(When AI Builds Itself)的博客文章,勾勒了其在推动模型加速自身开发方面的进展。7月,OpenAI 则宣传其新模型 GPT-5.6 Sol 曾帮助对一个较小模型进行后训练,为研究人员节省了数周工作时间。

这一新发现或许反映了 AI 公司内部正在看到的情况,而不论它们在公开场合多么乐观。Anthropic 联合创始人 Jack Clark 在他的新闻通讯 Import AI 中写道,这与公司尝试将 AI 安全研究的某些环节自动化时的发现“如出一辙”。

“当今的 AI 系统明显缺乏有价值、直觉性的创造力;尽管它们是极其强大的工程师,但它们似乎具有某种机械、公式化思维的特征,这可能会阻碍它们成为优秀研究者,”他写道。他将 AI 系统缺乏创造力称为对“短期递归自我改进时间表的一个看空信号”。

AI 公司当然有充分动机去开发能够快速加速自身进展的 AI 系统,就像它们曾努力让模型更擅长编程一样。OpenAI 已将构建自动化 AI 研究员设定为明确目标,而 Anthropic 则将自我改进型 AI 视为行业的下一个里程碑。

“不管目前是否失败,如果有投资并且朝着这个方向有意识地努力,我觉得还是会出现有意思的进展,”波士顿大学语言学和计算机科学教授 Najoung Kim 说。她研究 AI 代理如何自动化 AI 研究,但并未参与这项研究。另一方面,AI 的进展也可能出现分化:AI 系统可能在那些可评分的狭窄任务上迅速领先,而在开放式研究上推进缓慢。

因此,最大的悬而未决的问题是,开放式研究对于递归自我改进究竟有多关键——AI 系统是否能够不借助它,仅通过在更狭窄的任务上持续提升而最终达到那一步。“如果我们回顾这个领域最大的突破,比如 transformer 的发明,或者那些使我们能够取得大量 AI 进展的新架构的发明——所有这些都确实需要创造性的飞跃,”Kapoor 说。

“不过,另一些人持有这样的假设:我们实现变革性 AI,尤其是实现递归自我改进所需的一切,其实都已经具备了。”这其中包括让模型训练更快,以及提升其基准测试分数。

“坦率地说,这就是当下价值一万亿美元的问题,”他说。

深度阅读

一家初创公司声称已经突破了制约 LLM 的一个瓶颈

Subquadratic 现已披露其新模型的更多细节。不过,仍有人心存怀疑。

一个根本性缺陷让 LLM 极易遭到攻击

这使得诱骗它们去做不该做的事情变得轻而易举,比如告诉你如何破坏飞机导航系统。

来源与参考

  1. 原始链接
  2. AI’s recursive self-improvement might not come so quickly after all

收录于 2026-08-19