Opus 5 更能抵抗提示注入

Simon Willison··作者 Simon Willison

关键信息

这段引文没有给出具体数值分数,而是强调了来自提示注入评测和红队测试的定性结果。这里的说法特指对成功提示注入的抵抗能力,并不等同于模型整体能力,也不覆盖所有越狱行为。

资讯摘要

2026 年 7 月 25 日,Simon Willison 发布了一篇简短帖子,引用了 Boris Cherny 关于 Claude Opus 5 的说法。Cherny 表示,真正让他兴奋的不是模型的评测分数,而是 Opus 5 是 Anthropic 迄今为止最不容易被提示注入的模型。按照他的说法,这一点在系统卡里写得比较低调,但无论是提示注入评测还是红队测试,都显示 Opus 5 很难被成功注入提示。帖子中还重复了这段引文,并提示读者去看系统卡第 73 页的相关部分。

原文没有给出更深入的技术分析、基准表格或后续讨论。整篇内容的核心信息是:Anthropic 正在把对提示注入的更强抵抗能力,视为 Opus 5 的一个重要优势。对于关注 LLM 安全的人来说,这意味着模型在对抗最常见攻击类型之一方面可能有了实质性进步。

资讯正文

2026年7月25日

比起这些评测分数中的任何一个,更让我兴奋的是另一件事:Opus 5 是我们迄今为止最不容易被提示注入的模型。虽然这一点有点埋在 system card 里,但在 PI 评测和红队测试中,Opus 5 都非常难以成功进行提示注入。

比起这些评测分数中的任何一个,更让我兴奋的是另一件事:Opus 5 是我们迄今为止最不容易被提示注入的模型。虽然这一点有点埋在 system card 里,但在 PI 评测和红队测试中,Opus 5 都非常难以成功进行提示注入。

—— Boris Cherny,这是 system card 中的相关章节,第 73 页

来源与参考

  1. 原始链接
  2. A quote from Boris Cherny

收录于 2026-07-26