研究人员探索如何强制放缓前沿 AI 发展

WIRED AI··作者 Will Knight

关键信息

拟议机制包括第三方检查、保护隐私的监测,以及追踪或限制先进 GPU,但这些措施的有效性、独立性和可执行性仍不确定。Anthropic 报告称,Claude 已承担其 26% 的 AI 研究工作,而其 6% 的算力预算用于 AI 安全;不过,这些由企业自行定义的指标本身并不能形成可强制执行的减速机制。

资讯摘要

许多 AI 研究人员认为,能力不断增强的系统最终可能带来危险,但业界尚未就如何在实践中约束其发展形成共识。多伦多大学研究员、《控制前沿发展节奏:研究议程》合著者 Raymond Douglas 表示,放缓 AI 应被视为一个研究问题,因为人们对可用干预手段及其实际效果仍缺乏充分理解。随着研究人员和实验室负责人警告灾难性风险,并支持某种形式的减速或暂停,这场讨论正变得更加紧迫。核心担忧之一是递归式自我改进,即 AI 帮助开发更强大的 AI,从而可能使发展速度超出人类的理解或监督能力。

Anthropic 推出了用于追踪这一趋势的指标,并称 Claude 目前承担了该公司 26% 的 AI 研究工作,同时公司将 6% 的算力预算用于提升 AI 安全。一个较为现实的近期方案是向外部评估人员提供更深入的访问权限,使其能在受控环境中测试能力、开展红队测试并审计前沿系统。英国 AI 安全研究所前首席科学家 Geoffrey Irving 认为,检查、审计和相互协议目前可能足以约束开发;Control AI 负责人 Connor Leahy 则主张,真正独立的审查可能需要 FBI 或 NSA 等政府安全机构参与。报告的总体观点是,可信的控制机制需要外部资金、专业能力、严格的评估方法,以及不完全依赖 AI 企业自愿合作的执行手段。

研究人员探索如何强制放缓前沿 AI 发展

资讯正文

许多 AI 研究人员似乎坚信,他们正在开发的技术有朝一日可能会被证明非常危险。但即便在 AI 技术精英群体中,究竟该如何约束这些难以捉摸的算法,也仍不明确。

近年来,研究人员提出了各种防止 AI 走向恶性的构想。其中既有争议相对较小的方案,例如收紧政府监管、采用衡量进展的新方法,以及探查模型的内部运作机制;也有更为离奇的提议,比如在 GPU 内安装追踪设备,甚至举行仪式销毁大量 AI 芯片。

不过,随着政界和公众日益要求以一种更加审慎的方式开发 AI,究竟如何保障 AI 安全,答案仍不清楚。

多伦多大学 AI 研究员、新报告《掌控前沿步调:一项研究议程》(Pacing the Frontier, A Research Agenda)的合著者 Raymond Douglas 表示:“我们需要开始把这当作一个研究问题来对待。”该报告警告称,如何减缓 AI 开发仍是一个尚未解决的难题。“我们甚至并不真正了解自己有哪些选择,也不知道这些选择会产生什么效果。”

最近几周,有关 AI 毁灭性风险的讨论达到白热化。一名 Anthropic 研究员离职后警告称,AI 可能在几年内走上消灭人类的道路。Anthropic AI 安全实验室的负责人很快也表达了同样的担忧。

美国大型 AI 公司的领导者——Anthropic 的 Dario Amodei、OpenAI 的 Sam Altman、SpaceXAI 的 Elon Musk,以及 Google DeepMind 的 Demis Hassabis——如今都已公开表示,支持以某种形式放慢或暂停 AI 的发展。

这个问题显得尤为紧迫,因为 AI 公司目前正在利用 AI 本身构建愈发强大的模型。这引发了人们对递归式自我改进(RSI)循环加速的担忧:在这种循环下,AI 可能在几年内超越人类理解其所作所为的能力。

各家 AI 实验室已经开始宣传它们自己的新方法。本周,Anthropic 宣布了几种追踪人工智能发展速度,以及其危险程度可能上升多快的新方式。例如,这些方法显示,如今 Claude 承担了 Anthropic 26% 的 AI 研究工作,而在 2026 年初这一比例还是零。它们还表明,Anthropic 将其算力预算的 6% 用于研究如何提高 AI 的安全性。

但 Douglas 和其他专家表示,要有效且可靠地控制 AI 的发展,还需要来自 AI 实验室之外的资金和专业知识。无论是这份最新报告提出的方案,还是其他方案,其中一些看起来比另一些更容易实现。

“独立”评估机构

AI 公司经常提出的一种构想,是让第三方评估机构能够更深入地访问其模型。这些评估机构会测试模型,以评估其能力,并在可信环境中尝试诱发不当行为,从而对模型进行“红队测试”。

英国 AI 安全研究所前首席科学家、此前曾任 Google DeepMind 研究员的 Geoffrey Irving 认为,严格的检查目前可以有效暂停前沿 AI 的开发。“短期来看,检查和审计是有效的,甚至仅仅达成相互协议也行,”Irving 说,“我确实认为,这些公司害怕 RSI 和未对齐的快速起飞。”

一些悲观论者认为,此类检查需要比目前更加独立,也更具科学严谨性。最近有一些 AI 智能体在测试期间逃脱了控制,这一事实似乎确实表明,检查可能需要更加严格。

倡导管控 AI 的非营利组织 Control AI 负责人 Connor Leahy 表示,检查应当有 FBI 或 NSA 参与。“当[大型 AI 公司]说‘独立评估人员’时,他们的意思是:‘我想付钱给那些和我住在同一所集体住宅里的朋友,让他们来看看我的提示词。’”

Douglas 表示,新研究也可以改善模型评估。他指出,最近的研究展示了外部人员如何在不披露任何机密信息的情况下审查模型的使用情况。其他可能有帮助的技术还包括以新的方式查看 AI 模型内部,从而更好地了解它们正在做什么。

Leahy 也认为,需要对模型评估开展更多研究,同时也要首先弄清楚,“对齐”模型——即让模型反映人类价值观——究竟意味着什么。“这些公司一直在非常刻意地开展营销活动,试图把评估包装成科学,”他说,“但实际上,我们并不了解 AI 是如何运作的。”

美国政府愿意在多大程度上介入并限制 AI 的开发,目前仍不确定。特朗普总统基本上否定了监管该行业的必要性,但有迹象显示,两党对约束大型 AI 企业的支持正在增加。

可信计算

一些专家认为,要对 AI 开发施加限制,最终应当包括对其所需原始算力的审查。最强大的模型是在大型数据中心内使用数千块尖端 Nvidia GPU 训练出来的。

政府已经尝试过追踪这类活动。拜登政府于 2023 年发布的一项 AI 行政命令要求企业报告算力超过特定门槛的训练任务。

2024 年 3 月发布的一份政策白皮书认为,云服务提供商能够看到大规模 AI 训练任务的情况,因此可能成为未来相关工作的关键。白皮书提出,可以通过追踪账单记录、GPU 利用率、网络流量和耗电量,来间接判断 AI 的能力。

专家还提出,可以通过改造芯片本身,追踪并控制构建先进 AI 的活动。

RAND 的研究人员在 2024 年提出了一种设想:改造 GPU 上一个用于衡量性能的现有组件,使其能够生成采用密码学保护的算力运行记录,并接受定期检查。例如,这可以揭示某家公司是否一直在使用超过特定门槛的算力训练 AI。

还有人建议,在芯片中加入新型防篡改组件,以收集有关使用情况的详细信息。通过密码学机制,这些组件将成为运行某些模型权重的必要条件。

甚至有人提议在芯片中内置“关闭开关”,使其必须获得远程加密授权才能运行某些模型。他们表示,这可以防止未经授权的主体训练 AI 模型,或者在芯片落入不当之人手中时将其停用。

具有约束力的条约

大多数专家都认为,寻找新的国际合作方式对于控制 AI 的发展至关重要,因为其他国家——尤其是中国——同样具备构建前沿 AI 的能力。Irving 表示:“从中期来看,最简单的办法是通过条约,与中国相互削减硬件增长。”

美国还试图通过禁止出口 Nvidia 最强大的芯片来限制中国 AI 的发展。这一举措成效有限,因为企业仍然可以利用海外的云计算资源训练模型。

本月晚些时候,习近平主席访问美国时,美中两国很可能会讨论 AI 的风险。尽管中国专家也担忧快速发展的 AI 所带来的风险,但他们对会让中国企业落后于美国同行的减速措施持怀疑态度。

一些合作构想听起来不像政策提案,反而像是从科幻小说中直接摘录出来的。

专门研究生存风险的牛津大学哲学家 Toby Ord 此前曾设想,如果各国能够就限制 AI 发展达成共识,而且相关风险看起来足够严重,那么大国或许可以把 GPU 运到中立地区并将其销毁。如此激进的举措意味着两国都要同意彻底停止开发 AI。

近期的技术进步可能会让整个难题变得更加复杂,而围绕递归式自我改进的不确定性,则意味着跟踪这一领域的进展将尤为重要。

一项名为 RSI Index 的新基准测试正是为此而开展的多项新工作之一。该基准由初创公司 Vals AI 开发,旨在通过将公开 AI 模型的表现与人类 AI 科学家发表的研究成果进行对照,追踪由 AI 驱动的 AI 开发进展。Vals AI 联合创始人兼首席执行官 Rayan Krishnan 表示,这项基准测试表明,未来一年内,AI 可能就会完成 AI 研究人员无法理解其过程的工作。

不过,如何以最佳方式监控 AI 并不仅仅是一项技术挑战。Douglas 等人撰写的报告警告称,仓促实施不恰当的管控措施,可能会让相关工作陷入政治泥潭,或受到监管俘获的影响。

Douglas 说:“我不确定,仅仅要求美国政府把一切都关停,最终是否会有好结果。带着一个糟糕的方案仓促行动,结果可能比什么都不做还要糟。”

来源与参考

  1. 原始链接
  2. Here’s How an AI Slowdown Could Actually Be Enforced

收录于 2026-09-19