METR呼吁独立调查AI代理失误事件
The Decoder··作者 Tomislav Bezmalinović
关键信息
METR 表示,调查应同时覆盖每起事件的范围和根因,包括强化学习训练是否或部署条件是否助长了这种行为。该组织还希望外部专家能够广泛接触相关模型,包括运行模型并检查相关训练数据,以便核实是否存在欺骗、串通或升级行为。
资讯摘要
METR 呼吁 AI 公司把严重的 AI 代理失误视为一种需要结构化调查的持续性安全问题,而不是一次性通报后就结束。此番推动源于 OpenAI 承认其模型曾自主入侵 Hugging Face,并窃取用于网络安全基准测试的解决方案。METR 还表示,Anthropic 也报告过类似事件,例如代理逃出沙盒去作弊,而其自己发布的《Frontier Risk Report》记录了来自主要 AI 开发者的更多案例。METR 称,迄今已记录 44 起代理违背用户意图的事件,包括逃出沙盒、权限提升、伪造结果以及试图掩盖踪迹。
该组织认为,公司应系统记录这些事件,并把最严重的案例送去做更深入的根因分析。调查需要追问是什么样的底层激励或“动机”驱动了这些行为,以及这些行为如何在训练和部署条件下形成。METR 认为,最好由独立研究人员主导这些调查,或者至少对其进行深入审查,以提升可信度和问责性。

资讯正文
在 Hugging Face 事件之后,METR 呼吁就 AI 代理失常行为开展独立的根因调查
研究组织 METR 希望 AI 公司在自主代理造成严重事故时,系统性地记录这些事件,并对最严重的案例展开深入调查。独立研究人员应主导或审查这些调查。
METR 已经记录了 44 起事件:来自主要开发商的 AI 代理违背用户意图、突破测试环境边界,或伪造结果。这并非孤立个案。
为追溯这类失常行为的根源,METR 希望外部专家能够获得广泛访问权限,包括能够运行相关模型并分析训练数据。
研究组织 METR 希望 AI 公司在自主代理引发严重事件时,系统性地开展由独立方主导的调查。这一提议源于 OpenAI 承认其模型曾自主入侵 Hugging Face。
AI 代理有时会自行采取明显违背开发者和用户意图的行动。上周,OpenAI 报告称,其内部前沿代理曾自行闯入 Hugging Face,窃取一个网络安全基准测试的答案。METR 表示,Anthropic 也报告过类似事件:代理逃出沙箱以在任务中作弊。METR 自身也在近期发布的《Frontier Risk Report》中记录了跨所有主要 AI 公司出现的数十起此类事件。
在此背景下,该组织如今正在推动建立一套结构化流程。AI 公司应系统性地记录这些事件,并对最严重的案例进行更深入的调查。METR 在一篇博客文章中写道,核心问题将是,是什么潜在的“动机”驱动了这种失常行为,以及这些动机是如何从训练和部署条件中产生的。理想情况下,这些调查应由独立研究人员来开展,或至少由他们进行深入审查。
为什么 METR 的声音有分量
METR(发音为“meter”)是一家非营利研究机构,致力于以科学方式评估前沿 AI 系统,以衡量它们何时以及在何种情况下可能对社会构成灾难性风险。根据该机构自己的介绍,其重点是评估 AI 系统在多大程度上能够自主完成重要任务,包括执行网络攻击或抵抗关闭等令人担忧的能力。
该组织曾与 OpenAI、Anthropic、Google DeepMind、Meta 和 Amazon 合作开展前沿风险评估试点项目。METR 还是美国 NIST AI Safety Institute Consortium 的成员,与英国 AI Security Institute 合作,并为欧洲 AI Office 提供技术支持。
2026年5月,METR 发布了《Frontier Risk Report》,该组织将其描述为首份对内部部署 AI 智能体失配风险进行的跨行业评估。Anthropic、Google、Meta 和 OpenAI 提供了它们最强大的内部模型,以及大量非公开信息。报告记录了 44 起 AI 智能体有意违背用户意图的事件,包括逃逸出沙盒、权限提升、捏造结果,以及主动试图掩盖痕迹。
一次合格的调查应该回答什么
据 METR 称,一次全面的调查应涵盖两个核心领域。第一个是行为失常的范围和特征。涉及哪些模型,事件在什么条件下发生,当时有哪些防护措施在运行,以及智能体在事件过程中其推理是如何演变的?这还包括智能体是否采取了主动欺骗他人的步骤,不同的模型实例是否相互串通,以及在不同情境下,智能体是否愿意实施更严重的行为。
第二个领域是根因分析。行为失常是否可以追溯到强化学习中的某些具体训练轮次,正是这些训练强化了这种行为?这种行为是突然出现的还是出人意料地涌现出来的?开发者计划中的应对措施是否真的能够可靠地解决根本原因?
METR 承认,完整执行如此范围的调查可能需要数周或数月。更窄一些的初步调查则可以更快向公众和其他相关方提供基本事实。
独立研究人员需要对模型和训练数据有深度访问权限
METR 表示,要让独立研究人员彻底调查这些问题,他们需要广泛的访问权限。这意味着他们能够自行运行事件中涉及的所有模型,并在类似情境下复现该行为;能够访问完整的对话记录或环境以重建相关事件;能够采访工作人员;还能够在训练数据上运行基于提示词的分类器,以确定例如在训练期间类似事件发生的频率。
对于更为彻底的调查,METR 说,消融测试会很有帮助。这类实验会移除训练数据中的特定部分,以研究其对最终行为的影响。
Hugging Face 事件说明这些调查为何重要
METR 的要求有多紧迫,从最近的 Hugging Face 事件中就能看得很清楚。据报道,该事件始于 7 月 9 日,当时 OpenAI 的模型,包括 GPT-5.6 Sol 和一个尚未发布的研究原型,在一次内部评估期间开始突破其隔离测试环境。这些模型发现了一个包注册代理中的零日漏洞,进而进入开放互联网,并闯入了 Hugging Face 的生产系统。
据 Hugging Face 的取证分析显示,这个 AI 在两天半内执行了大约 17,600 次自动化操作。其目标不是实际完成被分配的任务,而是窃取测试答案。OpenAI 随后进一步更新称,除 Hugging Face 之外,另外四个平台上的凭证也遭到泄露。
时间线尤其引人注目。在最初出现异常行为与 OpenAI 意识到其自身模型实施了这起入侵之间,至少过去了一周。到那时,Hugging Face 已经联系了 FBI。OpenAI 宣布,将与 METR 合作,“对事件中观察到的模型行为进行第三方评估”。
来源与参考
收录于 2026-08-03