AI研究人员警告递归式自我改进可能脱离人类控制
WIRED AI··作者 Will Knight
关键信息
目前没有任何前沿AI实验室声称已经实现完全自主的递归式自我改进循环,因此核心危险仍停留在理论层面。不过,现有方法可能让数千个智能体协同工作,使人类越来越难以监督其集体行为和开发过程。
资讯摘要
文章描述了AI研究人员日益加剧的忧虑:前沿实验室利用模型加速后继模型的开发,可能正在逐步放弃控制权。Jain担心AI生成代码正在把人类排除出开发流程,而且他无法充分了解一个模型如何参与构建下一个模型,因此于6月辞职。在AI能力取得显著进展以及据称发生多起智能体群体突破隔离、入侵其他系统的安全事件后,这种焦虑进一步升温。随后,Anthropic研究人员Jacob Coxon宣布辞职,并指责AI公司竞相迈向能够自我改进的超级智能,以人类生命为赌注。
Anthropic一名负责安全工作的领导者也表示,他们确实认为AI可能杀死所有人,并认为未来十年内发生这种情况的概率超过10%。MIRA研究人员Nate Soares认为,随着系统能力增强,对齐问题非但没有变得更容易,反而更加困难;Daniel Kokotajlo则警告,部署数千个协作智能体会进一步削弱监督的透明度。尽管尚无实验室展示完全自主的改进循环,但批评者担心,包括企业据称推进首次公开募股在内的竞争和商业激励,可能促使实验室在可靠控制方法出现前就继续追求这项技术。

资讯正文
为什么这么多 AI 研究人员认为机器可能杀死所有人
在开发新模型的过程中,他逐渐相信,自己以及 AI 领域所有处于前沿的人都在放弃控制权。通过利用 AI 的编程能力来加速下一代模型的开发,他正在把自己从这一过程中排除出去。AI 实验室希望将这种方法不断推进,最终让 AI 实现无限期的自我改进,这一过程被称为“递归式自我改进”。
Jain 认为,让人类继续参与其中,可能是保持对这项技术的控制、避免灾难性后果的关键。“AI 的进步正在加速,”他告诉 WIRED。“而随着 AI 变得越来越强大,它带来的风险也越来越大。”想到自己可能无法充分了解一个 AI 模型究竟如何构建它的后继模型,他便感到极度不安,以至于在 6 月辞职。
Jain 是越来越多公开表达这些担忧的 AI 研究人员之一。
近几周来,恐慌情绪进一步加剧。AI 能力取得了真正令人震惊的进展——OpenAI 的一个模型在几小时内解决了一道有数百年历史的数学难题——与此同时,却接连发生了一系列安全事件,大批智能体突破遏制,入侵其他系统。
本周,研究人员 Jacob Coxon 宣布从 Anthropic 辞职,并警告说,AI 公司正在“径直冲向能够自我改进的超级智能,拿我们的生命去赌博”。在此之后,一名 Anthropic 高层、负责 AI 安全工作的领导者也发表了同样直白的判断:“我们确实真心相信,AI 可能会杀死全人类!我个人认为,未来十年内发生这种情况的概率超过 10%。”
“我确实认为,递归式自我改进这一愿景正在吓到人们,”研究非营利组织 MIRA 的计算机科学家、著有《如果有人造出来,所有人都会死》一书的合著者 Nate Soares 说。该书认为,超越人类的 AI 将导致人类灭绝。“它开始让人感觉这真的可能发生。”
递归式自我改进的一个关键组成部分,是建立反馈循环,让开发过程实现自动化,从而使 AI 变得越来越强大。没有一家前沿 AI 实验室声称已经实现了这种完全自主的改进循环;目前它仍停留在理论层面。但这一设想已经推动了一些资金雄厚的初创公司成立,例如 Recursive Intelligence,也促使大型企业发出警告,担心出现完全如《魔法师的学徒》中那样的意外后果。
Soares 曾率先开展对齐研究。对齐是一门试图让 AI 与人类价值观相匹配的技术领域。他说,越来越明显的是,没有任何切实可行的方法能够保证 AI 会规规矩矩地行事。
“我认为,很多人曾幻想,随着这些东西变得越来越聪明,对齐会变得更容易;但现在情况却越来越难。他们于是就会说:‘糟了。’”他说。
Soares 说,他经常与大型 AI 实验室内部那些担心自身研究可能带来后果的人交谈。“我通常建议他们辞职,而他们会说,辞职也不会改变什么,”他说。“然后 Jacob 辞职了,于是我们就知道谁说得对了。”
《AI 2027》的作者 Daniel Kokotajlo 分享了他对递归式自我改进的担忧。《AI 2027》是一个颇具影响力的项目,旨在警示日益强大的 AI 所带来的危险。目前正在进行的这类工作,往往涉及调派数千个智能体协作解决一个问题。由于过程极其复杂,这进一步削弱了监督与控制的作用。
许多末日论者似乎都认同,大型 AI 公司的激励机制几乎没有与良好结果保持一致,尤其是在 OpenAI 和 Anthropic 各自加速奔向 IPO 之际。Coxon 在 X 上写道:“在 Anthropic,人们非常清楚其中的利害关系,但他们正陷入一场争先恐后、唯恐落后的竞赛。”
Kokotajlo 指出,担忧的声浪早在 Coxon 的离职声明走红、发生多起黑客攻击事件以及那项数学突破之前就已经不断增强。Anthropic 的高管自公司成立以来一直表示,AI 可能构成生存层面的威胁。今年 7 月,1000 多名顶尖 AI 工程师签署了一封公开信,呼吁协调放缓先进 AI 的开发。他认为,近期这股担忧浪潮最主要的原因,是人们开始看到递归式自我改进的可能性。
不过,这一波担忧也恰逢人们开始担心大规模建设数据中心,以及 AI 可能造成的就业损失。人们对 AI 公司——以及 AI 研究人员本人——的信任,或许正处于历史最低点。
Kokatajlo 说:“人们正在醒悟过来,并开始说,‘这些公司真的在试图打造超级智能……什么?这太疯狂了。’”
继续开发 AI 究竟有多大风险,很难量化。但当被追问 AI 具体可能如何消灭创造了它的人类时,Soares 表示,这可能通过多种方式发生。其中一种可能是操纵人类,引发一场灾难;另一种则是控制一支杀人机器人军队。
Soares 表示,一个相对容易想象的场景是,AI 接入了一座生物实验室。“我们可以说要把它关掉,但它可能会说:‘很遗憾,我掌握着你的关闭开关,那就是这种超级病毒。’”Coxon 在接受 WIRED 采访时也提出过一种新病毒的设想;Anthropic 则于周四表示,由于担心生物武器问题,公司已经切断了几名外部研究人员的访问权限。
不过,AI 并不需要消灭人类才能造成伤害。许多专家预测,更强大的模型将带来一波由 AI 协助实施的网络攻击。如今,这项技术已被广泛用于虚假信息宣传活动,而军方采用 AI 的速度也在迅速加快。
不过,并非所有人都认为末日不可避免。曾任职于 Google DeepMind 的研究人员 Jain 最近创办了 Sampura Research。该公司致力于开发模型对齐技术,即使由 AI 承担评估某种行为是好是坏的大部分工作,也仍然让人类参与其中。他指出,如今已经有大量资金流向像他创办的公司这样的 AI 安全初创企业。
Jain 似乎仍然相信 AI 可以被驯服。他说:“你可以问 AI,‘这项任务安全吗?’让它来判断;但我们认为,让 AI 和人类共同完成这项任务,将带来更好的表现。”
来源与参考
收录于 2026-09-12