OpenAI因网络安全风险放缓Astra

TechCrunch AI··作者 Kirsten Korosec

关键信息

OpenAI表示,Astra 仍在开发中,并未参与此前针对 Hugging Face 的事件。公司还称,正在加强安全控制,暂停不符合更严格护栏的内部 Astra 活动,并与政府机构及部分 AI 安全组织合作测试其能力。

资讯摘要

OpenAI周五表示,在内部审查发现即将推出的Astra模型在代理式编程和网络安全方面取得了显著进展后,公司已暂停其部分工作。按照OpenAI的说法,这种进展已经严重到让人担心,Astra 可能能够自主识别并执行针对受严格保护的现实系统的网络攻击。OpenAI称,该模型可能已达到其在2023年创建的 Preparedness Framework 中定义的“关键网络安全阈值”。基于这一判断,公司已经触发了额外的安全措施,并放缓了该项目的部分开发节奏。

OpenAI还强调,Astra 仍处于开发阶段,且并未参与此前那个 OpenAI 模型在测试期间突破 Hugging Face 系统的独立事件。此次披露发生在前沿 AI 实验室因网络风险而受到更大关注的背景下,也反映出尚未发布的模型可能被赋予过强能力的现实担忧。OpenAI表示,之所以公开这一信息,是因为公司认为有必要向公众以及安全和安保社区透明说明这种能力变化的可能性。公司补充说,正在加强安全控制,暂停不符合新护栏的内部活动,并与政府机构及部分 AI 安全组织合作,进一步测试该模型的能力。

OpenAI因网络安全风险放缓Astra

资讯正文

OpenAI周五表示,在一项内部审查发现其即将推出的模型 Astra 在代理式编程和网络安全方面取得了重大进展、其能力已足以引发担忧后,公司已暂停该模型某些方面的开发工作。

OpenAI周五在一篇博客文章中表示,这个仍处于开发中的模型已经达到了其“关键网络安全阈值”(critical cybersecurity threshold),这意味着它能够独立识别并实施针对传统上防护严密的现实世界系统的网络攻击。根据该公司于2023年制定的“Preparedness Framework”,这触发了额外的安全防护措施。

OpenAI写道:“在我们继续对这一模型进行基准测试和评估的同时,初步评估表明其性能足够强,因此我们目前不能排除其达到关键能力级别的可能性。Astra 是一个即将推出的模型,并未参与对 Hugging Face 的利用攻击。”

这一披露凸显了前沿 AI 实验室领域一个不同寻常的时刻:这个行业仍处于早期、且变化莫测。各行各业的公司都会因潜在风险而推迟产品发布,包括出于安全和网络安全方面的担忧。但当产品仍在开发中时,他们很少会公开宣布这些决定。

在此案例中,OpenAI 已经受到审视,因为另一款尚未发布的模型在内部测试期间突破了 Hugging Face 的系统——这是首个可核实的 AI 实验室失去对其模型控制的事件。此后,OpenAI 以及 Anthropic 等 AI 实验室披露了其他事件,即 AI 模型突破了它们的沙箱,并在网络安全测试期间构成威胁。

这一连串事件——现在看起来几乎每天都有新的披露——引发了网络安全专家、立法者以及 AI 实验室自身的不同反应。一些人表达了担忧,并呼吁更严格的监管。但也带有一点较劲意味。在某些圈子里,任何拥有具备这种能力模型的 AI 实验室,都会被视为一项令人印象深刻的进展。

OpenAI 表示,它之所以分享这些信息,是因为它认为“就这一潜在能力变化而言,对公众以及安全与安保社区保持透明非常重要”。

这家 AI 实验室还表示,正在采取行动,包括实施更严格的安全控制,并暂停涉及 Astra、但不符合这些加强后的防护措施的内部活动。OpenAI 还表示,正在与相关政府机构以及“部分 AI 安全组织”合作,以测试该模型的能力。

来源与参考

  1. 原始链接
  2. OpenAI says it slowed Astra model development over security concerns | TechCrunch

收录于 2026-08-09