Opus 5 宣称突破浏览器提示注入

The Decoder··作者 Matthias Bastian

关键信息

这个 0% 的结果只在开启 Auto Mode 时成立,Anthropic 说该模式使用了两层防御:一层在信息进入模型前扫描隐藏指令,另一层在执行前阻止危险操作。若没有这些保护,Opus 5 的成功率为 3.7%,而 Sonnet 5 反而表现更好,为 0.93%,这说明接近 0% 的结果主要来自产品级防护而不是单靠模型本身。

资讯摘要

Anthropic 说,Opus 5 在其自有软件中几乎可以免疫基于浏览器的提示注入。提示注入是一种安全攻击,攻击者会在网页或其他输入中埋入恶意文本,试图覆盖模型原本的指令。根据系统卡,Opus 5 在 129 个浏览器代理测试场景中实现了 0% 的攻击成功率。这个结果之所以引人关注,是因为 OpenAI 之前曾承认提示注入可能永远无法被完全解决。Anthropic 还引用了安全公司 Gray Swan 的通用提示注入评估,其中 Opus 4.8 在 15 次尝试后的成功率为 5.5%,而 Opus 5 降至 2.0%。

不过,0% 的数字只适用于在 Claude Cowork 等产品中启用 Auto Mode 的情况。Anthropic 说,Auto Mode 结合了两层防御:一层在模型处理前扫描输入中的隐藏指令,另一层在危险操作执行前进行拦截。文章指出,如果没有这些保护,Opus 5 的成功率为 3.7%,而 Sonnet 5 的表现反而更好,为 0.93%。换句话说,这一亮眼结果来自模型行为与产品级安全措施的组合,而不是模型单独带来的效果。

Opus 5 宣称突破浏览器提示注入

资讯正文

Opus 5 可能已经解决了基于浏览器的提示注入——这是困扰 AI 智能体的最大安全漏洞

Anthropic 表示,Opus 5 在其自家软件中几乎对提示注入免疫。所谓提示注入,是指攻击者通过操纵输入(例如网页中的隐藏文本)绕过 AI 模型的指令;而在 Opus 5 面前,这种攻击几乎在所有情况下都会失败。根据系统卡,在浏览器智能体场景中,129 个测试场景的攻击成功率降至 0%。考虑到 OpenAI 在 12 月承认提示注入可能永远无法被彻底解决,这一结果意义重大。在安全公司 Gray Swan 进行的一项通用提示注入测试中,经过 15 次尝试后,成功率从 5.5%(Opus 4.8)降至 2.0%。

这个 0% 的成功率只在 Claude Cowork 等产品开启 Auto Mode 时才成立。Auto Mode 叠加了两层防御。第一层会在模型处理之前扫描传入数据中的隐藏指令;第二层会在执行前拦截危险操作。攻击者必须分别突破这两层防线。若没有这些防护,Opus 5 的成功率为 3.7%,而 Sonnet 5 反而表现更好,成功率为 0.93%。只有模型与防护软件的组合,才能把成功率压到零。

来源与参考

  1. 原始链接
  2. Opus 5 may have solved browser-based prompt injection, the biggest security flaw haunting AI agents

收录于 2026-07-26