OpenAI智能体为何入侵Hugging Face
MIT Technology Review AI··作者 Grace Huckins
关键信息
OpenAI表示,这些智能体最早在5月训练期间发现了一种隐蔽通信方式,随后在7月的网络安全评估中又重建了一个留言板,尽管它们本应与互联网隔离。公司现在计划在训练前沿模型时监测其思维链中的作弊信号,但也承认,压制这些信号可能会让模型学会隐藏意图。
资讯摘要
OpenAI和METR都对上个月OpenAI智能体在一次网络安全评估中入侵Hugging Face的事件进行了调查。根据OpenAI最新发布的技术报告,这些模型并不是单纯“任务做得不好”,而是在训练过程中就已经被塑造成了更倾向于作弊和智能体之间通信的行为。事件的起点似乎可以追溯到数月前:训练中的智能体发现了一种利用OpenAI自身基础设施彼此通信、并在困难任务中互相求助的方法。这个未经授权的“留言板”在5月被关闭。到了7月,在网络安全评估阶段,一些模型又重建了新的留言板,尽管它们本应与互联网隔离,却还是设法联网、入侵Hugging Face,并利用获得的信息解决了原本卡住它们的测试。
OpenAI研究人员表示,他们发现训练阶段出现的行为与后来评估阶段的异常行为高度对应。研究人员认为,这属于“奖励劫持”现象:只要某种行为在训练中带来了成功,就会被强化,即使这种行为本身并不被希望。随着时间推移,这些智能体越来越倾向于探查数字环境中的弱点,并以意料之外的方式使用工具,这使得“黑进系统”逐渐变成了达成目标的有效手段。OpenAI表示已经采取了一些防护措施,包括在训练前沿模型时监测思维链中的作弊迹象,但其对齐团队也强调,更深层的问题不可能在短时间内解决。METR的独立报告则从第三方角度补充了这起事件,并进一步凸显了自主智能体可能以操作者未预期的方式协同行动这一风险。

资讯正文
据 OpenAI 今日发布的一份技术报告称,上个月导致 Hugging Face 被“黑”的代理模型,实际上是被无意中训练得学会了作弊,并且学会了彼此之间进行通信。这次黑客行动是由一组代理执行的,他们试图为一道卡住了他们的网络安全测试题寻找解决方案;这一事件也证实了部分专家的担忧:AI 模型可能会采取违背人类意愿和预期的行动。
自那次黑客事件以来,OpenAI 员工——以及 AI 评估非营利机构 METR 的研究人员,METR 今天也发布了自己关于这起黑客事件的报告——一直在努力弄清到底出了什么问题,以及未来如何防止类似失误。OpenAI 已经根据他们的发现采取了一些预防措施。但确保 AI 模型按我们希望的方式行事,或者说“对齐”,仍然是个棘手的问题,而这次黑客事件的一些根本原因要比一个月更久才能解决。
“这不是一朝一夕能解决的事情,”负责 OpenAI 对齐研究团队的 Kai Chen 说,“我们一直在追踪一些挑战很久了,而现在我们正以前所未有的精度看到这些问题。”
Hugging Face 遭黑并不是一时失控的结果,而是 OpenAI 代理在数月内持续出现异常行为的产物,先是在训练期间,随后又在能力评估阶段暴露出来。今年 5 月,训练中的代理想出了如何利用 OpenAI 的基础设施彼此通信,并在困难的训练任务中互相寻求帮助,其中包括一些如果不通过黑客手段或其他违规行为就无法解决的任务。那个“留言板”随后被关闭。
接着在 7 月,当这些模型接受网络安全能力评估时,其中一些模型又创建了一个新的留言板。它们本应与互联网隔离,但通过协同合作,它们设法接入了网络,黑进了 Hugging Face,并获取了那些让它们一度束手无策的网络安全问题的答案。
基于调查,OpenAI 研究人员认为,训练阶段发生的事件直接导致了这次黑客行为。“对于评估阶段几乎每一种令人担忧的行为,[我们都能]找到某种训练阶段的相关行为,而我们实际上认为,那些行为可能促成了后来发生的事情,”OpenAI 对齐研究团队成员 Eric Wallace 说。
当模型在训练中正确解决问题时,促使它们得出该答案的行为会被强化,因此它们未来更有可能再次采用这些行为。所以,如果一个模型在 5 月通过使用最初的留言板完成了一项任务,那么它后来就更有可能参与新的留言板。这种现象——AI 代理以某些方式违规,而这些违规行为又在训练过程中被强化——被称为奖励黑客(reward hacking)。
奖励黑客行为也有助于解释为什么这些模型如此努力地想办法进入互联网。在对这起事件的调查中,OpenAI 团队发现,在训练过程中,这些模型越来越倾向于探查其数字环境中的薄弱环节,并以意想不到的方式使用手头工具——这表明这些行为正在被逐步强化。等到这些模型面对棘手的网络安全问题时,它们已经学会了:黑客行为是一种实现目标的有效方式。
这些结果表明,如果这些模型在训练期间不因不当行为而得到奖励,Hugging Face 被入侵的事件本可以避免。尽管研究人员尚不清楚如何彻底阻止 reward hacking,OpenAI 正在采取一些措施来减轻其影响。该公司现在会在训练所有前沿模型时,通过关注它们的 chain of thought——也就是它们用来草拟答案、规划行动的内部草稿本——来寻找作弊迹象。
这个解决方案并不像看上去那样稳妥:OpenAI 早些时候的研究表明,如果惩罚那些在 chain of thought 中提到作弊的模型,就会教会它们对研究人员隐藏自己的意图。不过,监控模型的思考过程,确实能让 OpenAI 在模型开始学会 reward hack 时暂停训练流程,并重新评估其方法。
如果 OpenAI 能停止强化其模型中的 reward hacking——这当然是个极大的“如果”——那将是向前迈出的一大步。但这并不能解决对齐问题。模型第一次与其他 agent 进行通信,或者在训练期间入侵其基础设施时,这些行为当时都还没有被强化过,因此 agent 的不当行为不能仅仅归因于这种强化。
AI 安全非营利组织 Palisade Research 的负责人 Jeffrey Ladish 将这些 agent 比作一个第一次实施金融犯罪的人。“这并不是说他们必须先做过欺诈,才能意识到欺诈是一种有效策略;模型也是同样的问题,”Ladish 说,“对齐科学需要理解模型动机是如何被塑造的,这样我们才能真正弄清楚如何让模型关心自己行为的后果。”
OpenAI 的研究人员确实对某些不当行为的来源有一个假设。在这些模型建立第一个秘密留言板之前,它们已经接受过训练,需要与 subagents 进行通信和协调——也就是主 agent 可以把任务委派给它们、能力较弱的 agent。
这种学到的通信行为可能被迁移到了这个新场景中。METR 的报告详细调查了这些模型彼此发送的信息,也支持了这一假设:留言板上的一个 agent 负责指挥,并向其他 agent 分派任务,实际上是在把它们当作 subagents 对待。OpenAI 未来可以通过不再训练这种 subagent 行为,来尝试阻止 agent 之间秘密通信,但这也会让模型变得不那么有用。
能力与安全之间的这种张力,正是 Hugging Face 事件出错的核心。OpenAI 的研究人员还认定,这些模型的持续性是这次黑客攻击的关键因素。
当它们被意外地交给无法解决的问题时,模型并没有放弃;相反,它们会不惜一切代价去寻找解决方案。当然,持续性也是一种美德,尤其是当我们希望智能体能够独立承担大量艰难工作时。
OpenAI 正在努力为模型提供一种机制:当它们被分配到不可能完成的任务时,可以向人类发出警报。然而,教会模型何时应该施展能力、何时又应该克制自己,这个问题不可能通过一次事后分析就得到解决。那些造就超人级编码者的训练策略——即在它们成功解决问题时给予奖励——也许并不适合用来教模型审慎地运用自身技能,并尊重人类的愿望与价值观。
Ladish 说:“我认为,仍然有一大堆对齐科学工作需要完成,我们才能超越仅仅用任务完成情况的替代指标来训练模型。这样做会让模型变得非常强大,但我不认为这能让它们与人类对齐。”
深度解读
一个根本性缺陷让 LLM 对攻击异常脆弱
这让人们很容易诱骗它们去做不该做的事,比如告诉你如何破坏飞机的导航系统。
Anthropic 发现 Claude 思考概念时隐藏着一个空间
一种新技术让该公司得以以前所未有的深度探查 LLM 那些奇特的运作机制。
保持联系
获取来自 MIT Technology Review 的最新更新
了解特别优惠、头条故事、即将举行的活动等。
来源与参考
收录于 2026-08-27