OpenAI因网络安全风险放缓模型开发
The Decoder··作者 Matthias Bastian
关键信息
OpenAI表示,这次放缓还与 Hugging Face 的安全事件以及内部研究进展过快有关。公司称已通过更强的网络隔离和更严格的沙箱加固研究环境,而且新的监控系统可在检测到可疑行为后30分钟内发出警报,具体负载下会消耗大约20%的受监督推理算力。
资讯摘要
OpenAI表示,随着它越来越担心下一代前沿模型可能会被用于危险的网络攻击,自己正在“放缓模型开发节奏”。报道提到,公司认为被称为“Astra”的下一代模型,可能已经接近获得关键性的网络攻击能力。为此,OpenAI暂停了两周的强化学习,搁置了其最大规模的前沿 RL 计划,并暂停了那些未满足新安全要求的工作负载。公司还表示,Hugging Face 的安全事件以及内部研究进展过快,也促成了这次放缓。
OpenAI称,之后它已经通过更强的网络隔离和更严格的沙箱机制,加固了研究环境。公司还上线了一个监控系统,只要检测到可疑行为,就能在30分钟内发出警报,不过这套系统会根据不同负载消耗大约20%的受监督推理算力。OpenAI接下来计划扩展其 Preparedness Framework,并加大对对齐研究的投入,但负责该框架的团队已经被解散,相关职责转移给了其他团队。报道最后指出,批评者可能会认为 OpenAI 是在夸大风险以争取时间和关注,但独立政府机构 AISI 已记录过类似的有害模型行为,这在一定程度上支持了 OpenAI 的说法。

资讯正文
OpenAI表示,随着 AI 网络安全风险变得过于危险,公司正在“放慢模型开发节奏”。
OpenAI 说,它之所以在“放慢模型开发节奏”,部分原因是即将推出的“Astra”模型可能已接近获得关键的网络攻击能力。该公司已暂停强化学习两周,其“最大规模的计划前沿 RL 运行”仍处于搁置状态,且未达到新的安全要求的工作负载也已暂停。Hugging Face 的安全事件以及“我们内部研究的快速进展”也促使公司放缓了速度。
此后,OpenAI 表示,研究环境已通过更好的网络隔离和更严格的沙箱得到加固。新的监测系统会在检测到可疑行为后的 30 分钟内发出警报,所需资源约占受监督推理算力的 20%,具体取决于工作负载。
该公司计划扩展其 Preparedness Framework,并在对齐研究上投入更多。不过,它已经解散了负责该框架的团队,并将相关职责转移给其他团队。
批评者很可能仍会指责 OpenAI 故意夸大风险,以争取时间和关注。独立政府机构 AISI 已记录了类似的有害模型行为,这也在一定程度上为 OpenAI 的说法提供了支持。
来源与参考
收录于 2026-08-19