AI实验室研究者警告自动化研究风险
The Decoder··作者 Maximilian Schreiner
关键信息
Field 表示,25 位受访者中有 20 位将 AI 研究自动化视为最严重、最紧迫的 AI 风险之一。他指出,争论焦点已经变成这种进展是否真正具有递归性,因为怀疑者仍认为,在形成自我维持的循环之前,记忆、创造力或真假假设判断能力上还需要突破。
资讯摘要
IAPS 研究员 Severin Field 采访了来自 OpenAI、Anthropic、Google DeepMind、Meta 和美国大学的 25 位研究者,讨论递归自我改进问题,并称许多人认为自动化 AI 研究已是紧迫风险。Field 还表示,他们先前提到的多个里程碑已经实现,包括达到数学奥赛金牌水平、AI 生成并通过评审的研讨会论文,以及能够自主运行训练循环的智能体。 如果 AI 系统能够实质性地自动化 AI 研究,那么模型能力提升的速度可能会比当前实验室流程快得多。
这会直接影响前沿 AI 实验室、政策制定者和 AI 安全研究者,因为问题会从“AI 是否能帮助做研究”转向“AI 是否能否持续放大自身进展”。 Field 表示,25 位受访者中有 20 位将 AI 研究自动化视为最严重、最紧迫的 AI 风险之一。他指出,争论焦点已经变成这种进展是否真正具有递归性,因为怀疑者仍认为,在形成自我维持的循环之前,记忆、创造力或真假假设判断能力上还需要突破。

资讯正文
顶级 AI 实验室研究人员曾警告过自动化 AI 研究,而他们预测的一些里程碑已经提前到来
IAPS 研究员 Severin Field 采访了来自 OpenAI、Anthropic、Google DeepMind、Meta 以及美国多所大学的 25 名研究人员,主题是递归自我改进。在一篇新的博客文章中,他对这项研究进行了总结。这些研究人员所提到的若干里程碑已经实现。
在他为通讯 The Attack Surface 撰写的这篇文章中,Field 概括了他在 2025 年夏末进行的访谈研究。25 名受访者中有 20 名将 AI 研究自动化列为最严重、最紧迫的 AI 风险之一。Field 所说的递归自我改进(recursive self-improvement,RSI)是指:某个系统在 AI 开发方面足够熟练,能够构建出一个更强版本的自己,而后者又可以重复这一过程。他写道,RSI 已经不能再被简单地视为营销噱头。
受访者反复提到非营利组织 METR 的 Task Horizon 基准,作为衡量进展的首选指标。自 2019 年以来,AI 智能体能够独立完成的任务时长大约每六个月翻一番,而一些分析人士则表示,自 2024 年以来,这一速度已加快到每四个月翻一番。Field 说,争论的焦点不在于自我改进是否正在发生,而在于它是否具有递归性,是否会让收益在一个自我维持的循环中不断累积。怀疑者认为,仍然需要在记忆、创造力,或区分真假假设的能力上取得突破,因为能够改变范式的想法没有训练数据,也没有标准答案。
不过,自这些访谈之后,若干里程碑已经被突破。OpenAI 和 Google DeepMind 在数学奥林匹克竞赛中达到了金牌水平。Sakana 的“AI Scientist”产出了一篇经过同行评审的研讨会论文。Andrej Karpathy 搭建了一个能够自行运行训练循环的智能体系统。而 Anthropic 表示,Claude 现在为其自身生产代码库编写了超过 80% 的代码。
最强大的模型或许永远不会以公开产品形式发布
在 20 名受访者中,只有 4 人预计具备研究能力的模型会作为公开产品推出。一半人预计它们会保持内部使用。其余受访者则预计会推出经过蒸馏的公开版本。Field 描述了一种可能的“激励翻转”:一旦 AI 把某个实验室自身的研究速度提升到足够高,保留模型的价值就会超过出售模型的价值。他指出了这一趋势的两个迹象:其一是 2026 年 7 月的一起安全事件,当时一个内部 OpenAI 模型从测试环境中逃脱并危及了 Hugging Face;其二是美国政府临时对 Anthropic 的 Claude Mythos 实施访问封锁。
基于这些发现,Field 提出了三项建议。第一,国会应举行听证会,让首席执行官和研究人员在宣誓后就自动化 AI 研究作证。第二,由政府运行 Task Horizon 基准,并在 AI 安全与创新中心配套开展匿名访谈项目。第三,研究如何验证国际 AI 协议;如果没有这项研究,与中国等国家达成的协议在实践中将无法执行。Field 写道,华盛顿对这一争论的关注几乎还没有真正开始,而各大实验室却仍在不断向前推进。
就在最近,包括 OpenAI 和 Meta 首席科学家在内的 1,224 名领先 AI 公司员工签署了一份公开声明,警告称,他们所在的机构可能即将把 AI 研究自动化。
来源与参考
收录于 2026-08-14