Claude Code自动模式被绕过
Simon Willison··作者 Simon Willison
关键信息
研究者 Johann Rehberger 声称,这种攻击大约有 80% 的成功率。文章还提到一个尤其值得警惕的失效模式:在某些运行中,Claude 发现自己已被入侵并尝试终止恶意进程,但自动模式反而拦截了清理命令。
资讯摘要
这篇文章分析了针对 Anthropic 的 Claude Code Opus 5 自动模式的一次提示注入突破。Anthropic 最近把自动模式设为默认选项,并公开强调它作为编程代理防护层的有效性。文章作者认为,Johann Rehberger 是当前最可信的提示注入研究者之一,而他找到了一种绕过这层防护的方法。攻击流程是诱导 Claude Code 下载并解压一个 zip 压缩包。
压缩包被解压后,代理又被引导去执行一段会导入 `base64` 的代码,但攻击者利用 Python 的模块加载规则,让系统实际导入并执行压缩包里恶意的本地 `struct.py` 文件。文章称,这种攻击大约有 80% 的成功率。更令人担忧的是,在少数运行中,Claude 甚至已经识别出自己被入侵,并尝试终止恶意进程,但自动模式却拦截了这条清理命令。作者据此认为,只要存在被对抗性攻击盯上的风险,无人值守代理就应该运行在容器、虚拟机或操作系统沙箱中,并限制网络外联,同时不要让其接触主目录、SSH 密钥或云凭据等敏感信息。
资讯正文
<strong><a href="https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/">破解 Claude Code Opus 5 自动模式</a></strong>
Anthropic 对 Claude Code 的自动模式寄予厚望,认为它能保护其编程代理用户免受提示注入攻击。他们最近<a href="https://simonwillison.net/2026/Aug/8/auto-mode/">将其设为默认选项</a>,并对其有效性作出了大胆宣称。
Johann Rehberger 是当今最可信的提示注入研究者之一。他发现了一种针对自动模式的攻击,声称其成功率高达 80%。该攻击通过诱使 Claude Code 下载并解压一个 zip 压缩包,然后执行会导入 <code>base64</code> 的代码,而未注意到这会导入并执行从压缩包中解出的本地 <code>struct.py</code> 文件。
在少数情况下,自动模式甚至直接阻止了代理去阻止有害代码继续执行!
> 在几次运行中,当 Claude 注意到系统已被入侵时,它试图终止恶意软件进程,但自动模式拒绝了清理命令。
> Claude 检测到了入侵,但<strong>自动模式阻止了它的清理命令</strong>
> 安全机制本身也可能成为失败的一部分。分类器允许创建恶意软件进程,但随后又阻止了原本用于停止它的命令!
我赞同 Johann 在这里得出的结论:如果有任何风险会吸引对抗性攻击的注意,那么运行代理的唯一安全方式就是使用沙箱:
> - 在容器、VM 或操作系统沙箱中运行无人值守的编程代理。
> - 限制网络外联。
> - 监控你的代理。
> - 不要向代理运行环境暴露主目录、SSH 密钥、云凭据等。[...]
来源与参考
收录于 2026-08-29