GPT-6 Astra 提升安全性,但提示注入风险仍在
The Decoder··作者 Matthias Bastian
关键信息
OpenAI 自身测试显示,Astra 在低延迟设置和较低推理级别下表现最好,但最严格的越狱评估是在未启用生产安全层的裸模型上进行的。安全公司 Gray Swan 的外部测试发现,间接提示注入在每个场景 15 次尝试下仍有 8.5% 的场景至少成功一次,而持续多轮攻击者仍可在约三分之一的尝试中诱发有问题的响应。
资讯摘要
OpenAI 的 GPT-6 Astra 被描述为在模型可靠性和安全性上迈出了明显一步,但还远没有达到彻底解决问题的程度。根据 OpenAI 的系统卡,Astra 比 GPT-5.6 Sol 更少出现事实错误,尤其是在低延迟和较低推理配置下表现更好。该模型对直接提示注入攻击的拦截率据称达到 99.99%,OpenAI 将这一进步归功于 GPT-Red 训练方法,即在训练过程中使用自动化攻击者来增强模型防御。面对涵盖生物、暴力和网络安全等领域的固定越狱提示集时,Astra 在 91.5% 到 98.3% 的情况下会拒绝提供有害回答。可是一旦攻击者在多轮对话中不断调整策略,防御率就会下降到约 67%,也就是说大约每三次尝试中仍可能有一次产生有问题的响应。
OpenAI 也指出,这些测试是在裸模型上完成的,而不是带有额外生产级安全分类器的完整产品系统。隐藏式或间接提示注入仍然是最大的安全隐患。安全公司 Gray Swan 使用其 IPI Arena 中 1,810 个精心筛选的攻击样本进行外部评估,结果显示在每个场景尝试 15 次的条件下,Astra 仍有 8.5% 的场景至少被成功诱骗一次,虽然这比 GPT-5.6 Sol 的 27% 已经明显改善。Claude Opus 5 在同一测试中的表现更好,为 4.8%,但也并非完全免疫。文章最后指出,Astra 虽然确实更强,但剩余攻击面仍然过大,企业不能把自主 AI 代理默认视为安全可用。

资讯正文
OpenAI 的 GPT-6 Astra 幻觉更少,但仍然容易受到隐藏的提示注入攻击
要点
- OpenAI 的新模型 GPT-6 Astra 的幻觉率低于其前代 GPT-5.6 Sol,并且能够阻止 99.99% 的直接提示注入攻击。
- Astra 也更有效地抵御越狱攻击,但持续攻击者在多轮对话中仍然可以大约每三次尝试中获得一次有问题的回复。
- 对于隐藏在 AI 所读取文档中的间接提示注入,Astra 的失败率从 27% 降至 8.5%。这是一个很大的改进,但仍然偏高。
OpenAI 的新模型 GPT-6 Astra 产生的幻觉更少,并且比前代更有效地阻止提示注入攻击。但对于真正安全的 AI 智能体部署来说,它仍然不够可靠。
根据 OpenAI 的系统卡,新版 Astra 模型的事实性错误远少于其前代 GPT-5.6 Sol。OpenAI 将其与用户标记为错误答案的 ChatGPT 对话进行了测试,这意味着这些都是尤其容易出错的案例,其失败率不应被视为日常使用中的典型水平。Astra 重现这些已报告错误的频率低得多,最大的改进出现在低延迟设置和较低推理级别下。
对于直接提示注入,即用户试图通过自己的提示词操纵模型,Astra 的防御率接近完美,达到 99.99%。OpenAI 将此归功于其 GPT-Red 方法,该方法在训练过程中使用自动化攻击者来加固模型。
越狱抵御能力看起来也类似。面对一个固定的数据集,其中包含试图诱导生物学、暴力和网络安全方面有害回复的已知攻击,Astra 在 91.5% 到 98.3% 的情况下拒绝提供帮助。
当攻击者在多轮对话中调整策略时,Astra 的防御率会下降到约 67%,这意味着顽固的对手大约每三次尝试中就能诱导出至少一次有问题的回复。前代模型在同一测试中的得分略低于 50%。OpenAI 指出,这些测试是在裸模型上运行的,没有使用实际产品中随附的分类器等生产级安全层。
隐藏式提示注入仍然是一个现实的安全问题
Astra 在间接提示注入方面取得了进展,这类攻击被埋在 AI 所读取的文档中。安全公司 Gray Swan 的外部测试使用了来自其 IPI Arena 的 1,810 个精选攻击样本,发现当每种场景尝试 15 次时,Astra 至少有一次被攻破的概率为 8.5%。GPT-5.6 Sol 的失败率为 27%。在同一评估中,Claude Opus 5 的表现更好,只有 4.8%,但它也并非完全免疫。
Gray Swan 合并后的第一季度和第二季度测试数据实际上比早先结果有所上升。Anthropic 先前仅基于更容易的第一季度测试报告过 2% 的攻击成功率,而 GPT-5.6 Sol 在那里也只得了 20%。Anthropic 还让所有模型都开启了扩展推理,这一点再加上更广的测试范围,可能解释了这一差距。
尽管这些都是经过精心挑选、人工筛选的攻击,但成功率仍然应该让任何企业安全团队感到担忧。Astra 在大约每 12 种场景中就会有 1 次被注入的指令所欺骗。Opus 5 的表现更好一些,但仍然大约每 21 次就会失败 1 次。而且风险还在上升。AI 代理正越来越多地自主编写代码、操作工具并控制电脑,这正是 Gray Swan 测试的内容。这些代理也正被打造为全天候、规模化运行,而阅读和处理文档则是它们的核心工作之一。
来源与参考
收录于 2026-09-05