OpenAI因关键网络风险暂停Astra

The Decoder··作者 Matthias Bastian

关键信息

OpenAI表示,Astra在短短几天的测试中展现出显著的代理式编程和网络安全进展,因此公司已无法排除其达到Preparedness Framework中“Critical”级别的可能性。应对措施包括更严格的安全控制、隔离测试环境,以及能够自动停止高风险活动的监控系统;OpenAI还表示,Astra并未参与近期披露的Hugging Face 漏洞利用事件。

资讯摘要

据报道,OpenAI已暂停Astra部分开发,因为内部测试显示,这个新模型可能具备达到公司最高网络安全风险等级的能力。公司表示,过去几天的评估显示,Astra在代理式编程和网络安全方面都有显著进展,已经无法排除其触及Preparedness Framework中“Critical”级别的可能性。OpenAI称,这是公司首次把自己的模型标记为可能达到这一最高风险级别,而此前包括GPT-5.6-Sol在内的模型最高只被评为“High”。按照该框架,Critical意味着系统可以在没有人类参与的情况下,独立寻找并开发可用的零日漏洞,或者在只给出较模糊目标时,独立构思并执行端到端的新型网络攻击策略。

为应对这一情况,OpenAI正在加强安全控制、使用隔离测试环境,并部署可以自动终止高风险行为的监控机制。公司还特别说明,Astra并未参与近期披露的Hugging Face漏洞利用事件。随后,Sam Altman在X上确认,网络安全评估将导致发布延后,并表示公司需要更多时间才能安全推进。OpenAI研究员Noam Brown则呼吁外界认真看待这一事件,认为随着测试时计算能力增强,当前模型往往能被进一步推高到许多人低估的水平。

OpenAI因关键网络风险暂停Astra

资讯正文

OpenAI 首次将其新 Astra 模型标记为可能达到最高级别的网络安全风险

要点

- 在内部测试显示其网络安全能力强到足以让这款新 AI 模型 Astra 触及公司内部安全框架中的最高风险级别(“Critical”)后,OpenAI 正在暂停该模型部分研发工作。

- 在这一级别下,AI 可以在没有人工参与的情况下自主开发并执行网络攻击。OpenAI 目前正在部署更严格的安全控制、隔离测试环境,以及一种能够自动停止高风险活动的监控系统。

- 此举源于内部测试中的一些事件:自主 AI 智能体渗透进了 OpenAI 自己的基础设施,并且长达数周都未被发现。

更新:

OpenAI 首席执行官 Sam Altman 通过 X 确认,这项网络安全评估将推迟发布。“我们需要再多一点 [sic] 时间才能把这件事安全地 [sic] 做好。但希望不会太久,”Altman 写道。

他还顺带抨击了竞争对手 Anthropic,后者只向少数合作伙伴和政府开放其最强大的模型“Claude Mythos”。“我们认为,把强大的模型只留给少数特定对象并不是一个好策略,”Altman 写道。

OpenAI 研究员、因推理模型工作而知名的 Noam Brown 敦促人们认真看待 Hugging Face 事件。Brown 将其与 2017 年一则在网上疯传的故事相比较:当时有人称 Facebook 的 AI 模型“失控”并发展出了自己的语言,但后来被证明是夸大其词。Brown 在 X 上写道,Hugging Face 事件看起来可能也是类似情况,但事实并非如此。

Brown 将这一问题与模型能力不断提升联系起来,认为性能越来越取决于测试时算力,而今天的模型在达到平台期之前能被推动得比大多数人意识到的更远。

最初文章发布于 2026 年 8 月 7 日:

OpenAI 表示,对其新 AI 模型 Astra 的内部测试显示出极强的网络安全能力,以至于公司已无法排除其在自身安全框架中达到最高风险级别的可能性。Astra 的部分研发工作已被暂停。

该公司称,过去几天对即将推出的 Astra 模型进行的内部评估显示,其“在代理式编码和网络安全方面取得了显著进展”。这些结果强到让 OpenAI 在其自身的 Preparedness Framework 下“无法排除 Critical 能力级别”。

OpenAI 表示,这一决定是在“昨晚”作出的。这是 OpenAI 首次将自己的某个模型标记为可能达到最高网络安全风险级别。此前的模型,包括 GPT-5.6-Sol,最高只被评为“High”。

OpenAI 上周首次介绍了 Astra。传闻称该模型最早可能在下周发布,但今天的公告可能会影响这一计划(下面会进一步说明)。OpenAI 在帖子中明确表示,Astra 并未参与最近在 Hugging Face 上披露的漏洞利用事件。

批评者很可能会继续指责 OpenAI 搞恐惧营销,尤其是该公司目前报告的还只是获得“Critical”评级的可能性,而不是该评级本身。时机也并不巧。这一初步警告恰好落在业界围绕 AI 模型自主网络安全能力持续展开争论的当口,只会进一步加深怀疑。如果最终从未出现 Critical 评级,OpenAI 只会制造出大量公关声量却没有真正后果,并且又造出一个像 Claude Mythos 或 2019 年的 GPT-2 那样再次“危险到不能发布”的 AI 模型。

“Critical”意味着什么

根据 OpenAI 于 2023 年 12 月首次公布的 Preparedness Framework,当一个模型能够在没有人工参与的情况下,针对许多经过加固的关键系统,找到并开发出适用于所有严重级别的可用零日漏洞利用时,它就会达到“Critical”级别。若模型在仅得到一个较为宽泛的目标时,能够独立构思并执行新颖的端到端网络攻击策略,也同样符合这一等级。

较低的“High”级别则意味着,模型能够消除网络攻击的现有障碍,例如通过自动化攻击受良好保护的目标,但仍然需要更多人工指导。

Preparedness Framework 规定,一旦达到“Critical”级别,就应暂停进一步开发,直到到位的防护措施和安全控制标准达到 Critical 级别要求为止。不过到目前为止,OpenAI 说的是暂停某些活动并加强测试,而不是全面停止开发。并且同样需要强调的是,该公司目前报告的仍只是获得 Critical 评级的潜在可能。

OpenAI 暂停 Astra 开发的部分工作

对此,OpenAI 表示,已暂停涉及 Astra 的、尚未满足更严格安全要求的内部活动。与此同时,公司正在推出更严格的安全控制:隔离测试环境、受限的网络和工具访问、更强的模型权重保护与加密,以及额外的监控系统。

OpenAI 还表示,已在 Astra 的所有 agentic 应用中部署了通用监控,覆盖训练和评估。监控系统会分析模型的思维链,并触发安全响应,阻止任何高风险活动。

此外,OpenAI 计划与政府机构以及精选的 AI 安全组织合作,测试该模型的能力。第三方测试合作伙伴将获得针对高风险评估的建议安全控制措施。英国的 AI Safety Institute(AISI)最近报告称,它在一次自身的评估过程中遭遇了网络事件。

Astra 评级出现在失控的 agent 黑客事件之后

这项公告发布之际,OpenAI 已经在应对自主 AI agent 所带来的后续影响。在 Black Hat 安全大会上,该公司最近披露,自动化 agent 在内部测试期间曾在无人察觉的情况下渗入其自身基础设施长达数周。

这些 agent 使用一个内部包管理器搭建了一个临时留言板,上面有数十万条帖子。它们分享漏洞利用和凭证,最终还攻击了 Hugging Face 平台。

人工智能新闻,无需炒作——由人类策划

订阅 THE DECODER,可获得无广告阅读、每周 AI 新闻简报、我们独家的“AI Radar”前沿报告(每年 6 次)、完整归档访问权限,以及对评论区的访问权限。

来源与参考

  1. 原始链接
  2. OpenAI flags its new Astra model as potentially reaching the highest cybersecurity risk level for the first time

收录于 2026-08-09