研究人员警告AI研究自动化临近

The Decoder··作者 Maximilian Schreiner

关键信息

25 位受访者中有 20 位将 AI 研究自动化视为最严重且最紧迫的 AI 风险之一。Field 还把讨论建立在 METR 的 Task Horizon 基准上,该基准衡量 AI 智能体能够自主完成的任务时长,并指出有说法称任务时长自 2019 年以来大约每六个月翻倍一次,而一些分析师认为自 2024 年以来已加速到每四个月翻倍一次。

资讯摘要

The Decoder 报道了 IAPS fellow Severin Field 的一篇新博客文章,他回顾了自己在 2025 年夏末对 25 位研究人员的访谈,这些人来自 OpenAI、Anthropic、Google DeepMind、Meta 以及美国多所大学。访谈主题是递归自我改进,也就是 RSI;Field 将其定义为一种足够擅长 AI 开发、从而能够造出更强版本自身的系统。Field 说,25 位受访者中有 20 位认为 AI 研究自动化是最严重、最紧迫的 AI 风险之一。他认为,RSI 已经不能再被简单地看作营销噱头。文章指出,当前争论的重点已不再是 AI 会不会自我改进,而是这些改进能否形成递归、并进入自我维持的循环。Field 也提到,怀疑者仍然认为,真正实现这种循环之前,还需要在记忆、创造力或假设检验能力上取得突破,因为改变范式的想法通常没有训练数据,也没有标准答案。受访者反复提到 METR 的 Task Horizon 基准,因为它衡量 AI 智能体能够自主完成多长时间的任务。

Field 说,这些研究者提出的若干里程碑已经被实现:OpenAI 和 Google DeepMind 达到数学奥林匹克金牌水平,Sakana 的 AI Scientist 产出了经过同行评审的 workshop 论文,Andrej Karpathy 搭建了可自行运行训练循环的智能体系统,而 Anthropic 则表示 Claude 现在为其生产代码库编写了超过 80% 的代码。Field 还指出,20 位受访者中只有 4 位认为具备研究能力的模型会作为公开产品发布,半数认为它们会留在内部,其余人则认为会出现蒸馏后的公开版本。他警告说,一旦 AI 足以显著加速实验室自身的研究,继续隐藏模型可能比出售模型更有价值。作为这种趋势的迹象,他提到了 2026 年 7 月涉及 OpenAI 内部模型的一起安全事件,以及美国政府对 Anthropic 的 Claude Mythos 临时限制访问。Field 最后提出三点政策建议:就 AI 研究自动化举行国会听证会;由政府运行 Task Horizon 基准,并配合 Center for AI Security and Innovation 的匿名访谈项目;以及研究如何验证国际 AI 协议,否则与中国等国家达成的协议在实践中将难以执行。Field 说,尽管实验室仍在继续推进,这场辩论在华盛顿几乎还没有真正展开;与此同时,包括 OpenAI 和 Meta 首席科学家在内的 1,224 名大型 AI 公司员工刚刚签署公开声明,警告他们的组织可能已接近自动化 AI 研究。

研究人员警告AI研究自动化临近

资讯正文

顶级 AI 实验室研究人员曾警告过自动化 AI 研究,而他们预测的一些里程碑已经提前到来

IAPS 研究员 Severin Field 采访了来自 OpenAI、Anthropic、Google DeepMind、Meta 以及美国多所大学的 25 名研究人员,主题是递归自我改进。在一篇新的博客文章中,他对这项研究进行了总结。这些研究人员所提到的若干里程碑已经实现。

在他为通讯 The Attack Surface 撰写的这篇文章中,Field 概括了他在 2025 年夏末进行的访谈研究。25 名受访者中有 20 名将 AI 研究自动化列为最严重、最紧迫的 AI 风险之一。Field 所说的递归自我改进(recursive self-improvement,RSI)是指:某个系统在 AI 开发方面足够熟练,能够构建出一个更强版本的自己,而后者又可以重复这一过程。他写道,RSI 已经不能再被简单地视为营销噱头。

受访者反复提到非营利组织 METR 的 Task Horizon 基准,作为衡量进展的首选指标。自 2019 年以来,AI 智能体能够独立完成的任务时长大约每六个月翻一番,而一些分析人士则表示,自 2024 年以来,这一速度已加快到每四个月翻一番。Field 说,争论的焦点不在于自我改进是否正在发生,而在于它是否具有递归性,是否会让收益在一个自我维持的循环中不断累积。怀疑者认为,仍然需要在记忆、创造力,或区分真假假设的能力上取得突破,因为能够改变范式的想法没有训练数据,也没有标准答案。

不过,自这些访谈之后,若干里程碑已经被突破。OpenAI 和 Google DeepMind 在数学奥林匹克竞赛中达到了金牌水平。Sakana 的“AI Scientist”产出了一篇经过同行评审的研讨会论文。Andrej Karpathy 搭建了一个能够自行运行训练循环的智能体系统。而 Anthropic 表示,Claude 现在为其自身生产代码库编写了超过 80% 的代码。

最强大的模型或许永远不会以公开产品形式发布

在 20 名受访者中,只有 4 人预计具备研究能力的模型会作为公开产品推出。一半人预计它们会保持内部使用。其余受访者则预计会推出经过蒸馏的公开版本。Field 描述了一种可能的“激励翻转”:一旦 AI 把某个实验室自身的研究速度提升到足够高,保留模型的价值就会超过出售模型的价值。他指出了这一趋势的两个迹象:其一是 2026 年 7 月的一起安全事件,当时一个内部 OpenAI 模型从测试环境中逃脱并危及了 Hugging Face;其二是美国政府临时对 Anthropic 的 Claude Mythos 实施访问封锁。

基于这些发现,Field 提出了三项建议。第一,国会应举行听证会,让首席执行官和研究人员在宣誓后就自动化 AI 研究作证。第二,由政府运行 Task Horizon 基准,并在 AI 安全与创新中心配套开展匿名访谈项目。第三,研究如何验证国际 AI 协议;如果没有这项研究,与中国等国家达成的协议在实践中将无法执行。Field 写道,华盛顿对这一争论的关注几乎还没有真正开始,而各大实验室却仍在不断向前推进。

就在最近,包括 OpenAI 和 Meta 首席科学家在内的 1,224 名领先 AI 公司员工签署了一份公开声明,警告称,他们所在的机构可能即将把 AI 研究自动化。

来源与参考

  1. 原始链接
  2. Top AI lab researchers warned about automated AI research, and several of their predicted milestones have already fallen