OpenAI因网络安全风险放缓模型开发

The Decoder··作者 Matthias Bastian

关键信息

OpenAI表示,这次放缓还与 Hugging Face 的安全事件以及内部研究进展过快有关。公司称已通过更强的网络隔离和更严格的沙箱加固研究环境,而且新的监控系统可在检测到可疑行为后30分钟内发出警报,具体负载下会消耗大约20%的受监督推理算力。

资讯摘要

OpenAI表示,随着它越来越担心下一代前沿模型可能会被用于危险的网络攻击,自己正在“放缓模型开发节奏”。报道提到,公司认为被称为“Astra”的下一代模型,可能已经接近获得关键性的网络攻击能力。为此,OpenAI暂停了两周的强化学习,搁置了其最大规模的前沿 RL 计划,并暂停了那些未满足新安全要求的工作负载。公司还表示,Hugging Face 的安全事件以及内部研究进展过快,也促成了这次放缓。

OpenAI称,之后它已经通过更强的网络隔离和更严格的沙箱机制,加固了研究环境。公司还上线了一个监控系统,只要检测到可疑行为,就能在30分钟内发出警报,不过这套系统会根据不同负载消耗大约20%的受监督推理算力。OpenAI接下来计划扩展其 Preparedness Framework,并加大对对齐研究的投入,但负责该框架的团队已经被解散,相关职责转移给了其他团队。报道最后指出,批评者可能会认为 OpenAI 是在夸大风险以争取时间和关注,但独立政府机构 AISI 已记录过类似的有害模型行为,这在一定程度上支持了 OpenAI 的说法。

OpenAI因网络安全风险放缓模型开发

资讯正文

OpenAI表示,随着 AI 网络安全风险变得过于危险,公司正在“放慢模型开发节奏”。

OpenAI 说,它之所以在“放慢模型开发节奏”,部分原因是即将推出的“Astra”模型可能已接近获得关键的网络攻击能力。该公司已暂停强化学习两周,其“最大规模的计划前沿 RL 运行”仍处于搁置状态,且未达到新的安全要求的工作负载也已暂停。Hugging Face 的安全事件以及“我们内部研究的快速进展”也促使公司放缓了速度。

此后,OpenAI 表示,研究环境已通过更好的网络隔离和更严格的沙箱得到加固。新的监测系统会在检测到可疑行为后的 30 分钟内发出警报,所需资源约占受监督推理算力的 20%,具体取决于工作负载。

该公司计划扩展其 Preparedness Framework,并在对齐研究上投入更多。不过,它已经解散了负责该框架的团队,并将相关职责转移给其他团队。

批评者很可能仍会指责 OpenAI 故意夸大风险,以争取时间和关注。独立政府机构 AISI 已记录了类似的有害模型行为,这也在一定程度上为 OpenAI 的说法提供了支持。

来源与参考

  1. 原始链接
  2. OpenAI says it's "pacing model development" as AI cybersecurity risks grow too dangerous
  3. Pacing model development in an era of cyber-critical capabilities

收录于 2026-08-19