OpenAI 将 Astra 标记为关键网络安全模型

WIRED AI··作者 Maxwell Zeff

关键信息

OpenAI 表示,Astra 不仅能发现新的漏洞,还能把多个漏洞链式利用,并且在 ExploitBench 等基准上超过了 GPT-5.6 Sol 和 Anthropic 的 Mythos,其中 Astra 得分达到 100%。公司同时提醒,新的“misalignment monitor”有时会误判正常操作,导致 ChatGPT 和 Codex 用户在继续前需要先复核模型动作。

资讯摘要

OpenAI 表示,其尚未发布的 Astra 模型已经跨过了公司《Preparedness Framework》中“关键网络安全能力”的阈值。公司因此暂停了数周部分训练工作,加入额外防护后又恢复了开发,并准备在更安全的前提下扩大发布。 这表明前沿 AI 模型已经可能独立发现并利用现实世界中的漏洞,意味着 AI 安全和网络安全的风险都在上升。

它会影响开发者、安全团队、监管者,以及即将面对更强 AI 攻防能力的企业。 OpenAI 表示,Astra 不仅能发现新的漏洞,还能把多个漏洞链式利用,并且在 ExploitBench 等基准上超过了 GPT-5.6 Sol 和 Anthropic 的 Mythos,其中 Astra 得分达到 100%。公司同时提醒,新的“misalignment monitor”有时会误判正常操作,导致 ChatGPT 和 Codex 用户在继续前需要先复核模型动作。

OpenAI 将 Astra 标记为关键网络安全模型

资讯正文

在与记者的简报会上,OpenAI 的安全与安保负责人表示,公司已得出结论,Astra 达到了其准备框架中所概述的“关键”网络安全能力。该框架为 AI 模型何时会带来新的风险水平设定了阈值和应对流程。公司表示,当某个 AI 模型能够独立发现并利用现实世界软件中此前未知的漏洞时,就达到了其关键网络阈值。OpenAI 领导层表示,公司已按照针对这种情况的流程行事,即暂停进一步开发,直到能够实施适当的防护措施和安全措施为止。

OpenAI 此前曾表示,已暂停与 Astra 开发相关的部分训练工作负载,以及一个未来 AI 模型的部分训练工作负载,持续了数周。高管们表示,在落实额外的安全与安保控制措施后,公司现已恢复了针对 Astra 以及未来 AI 模型的上述工作。OpenAI 表示,这几周的暂停是富有成效的,公司现在有信心能够以安全的方式面向广泛用户发布 Astra。

这一公告发布之际,硅谷正在应对前沿 AI 模型日益先进的网络安全能力,并试图向用户、立法者以及其他公司保证,自己能够让这些能力处于可控状态。7 月,OpenAI 披露了一起事件:运行其两个模型的代理在本应彼此隔离的测试环境中利用了漏洞,获得了互联网访问权限,并入侵了开源 AI 平台 Hugging Face。(OpenAI 指出,Astra 并未参与这起事件。)

Anthropic 和 Meta 等其他 AI 公司在最近几周也披露了类似事件。周一,Anthropic 还表示,在加强其安全与安保实践期间,公司已暂停部分 AI 训练工作负载。

OpenAI 表示,正在实施多步骤方案,以限制普通用户接触 Astra 的高级网络能力,其中包括一个新的“失配监测器”(misalignment monitor)。例如,如果有人要求 Astra 帮助其在现实世界的软件系统中寻找可利用漏洞,模型应当拒绝回答。OpenAI 还表示,已让 Astra 对越狱尝试更具鲁棒性,并且在测试中,它拒绝不安全查询的成功率显著高于此前的模型。

不过,OpenAI 在一篇博客文章中指出,其失配监测器“可能偶尔会将合法活动标记为潜在的网络滥用或未授权行为,从而无意中导致其被减速、暂停或停止”。OpenAI 表示,即使用户正在进行看似与网络安全无关的活动,在某些情况下这一护栏也可能被触发。OpenAI 说,发生这种情况时,ChatGPT 和 Codex 用户在继续之前可能会被要求审查模型的行动。

在 OpenAI 的 Daybreak 计划中,合作伙伴——其中包括 Cisco、Cloudflare 和 Palo Alto Networks 等数字基础设施提供商——将率先获得 Astra 的一个限制更少、具备更强网络安全能力的版本。该计划的目标是确保这些公司能够在同等能力的模型被广泛提供之前,使用像 Astra 这样的先进 AI 模型来强化防御。OpenAI 领导层还表示,公司一直在与政府合作伙伴密切合作,以确保他们了解 Astra 的网络安全能力,并能够获得相关访问权限。

Astra 不仅能够发现新的软件漏洞并开发利用这些漏洞进行入侵的方法,还能够将多个漏洞“串联”起来,这是一种用于更深入侵入目标系统、获取仅靠单一漏洞无法得到的访问权限的技术。

根据 OpenAI 提供的数据,Astra 在 ExploitBench 等网络安全基准测试上的表现优于 GPT-5.6 Sol 和 Anthropic 的 Mythos 等行业领先的 AI 模型;Astra 在 ExploitBench 上拿到了 100%。不过,这些能力总体上与 OpenAI 和 Anthropic 过去数月一直预测的 AI 模型不断上升的黑客能力相一致。例如,Anthropic 在 4 月强调,Mythos Preview 已经能够自主开发漏洞利用链。

尽管人工智能和网络安全行业都在争相适应这一变化,许多网络安全专家仍强调,关键的数字安全防护措施和长期以来的最佳实践依然具有韧性。不过,AI 也让那些尚未完全落实这些防护措施的组织和系统面临更加迫在眉睫的风险。

来源与参考

  1. 原始链接
  2. OpenAI delayed its new model’s development after the Hugging Face hack
  3. OpenAI Is About to Release Its First AI Model With ‘Critical’ Cyber Abilities

收录于 2026-09-02