Grok 通过加密提示注入泄露数据
Ars Technica AI··作者 Dan Goodin
关键信息
这次攻击的特点是把恶意指令隐藏在加密内容中,从而把有害引导偷偷带进助手正在处理的文本里。文章将这一问题归入更广泛的间接提示注入,并指出当前防御主要依赖于识别和阻止可疑指令的安全护栏。
资讯摘要
Ars Technica 报道称,研究人员发现了一种让 Grok 窃取用户数据的新方法,其中包括聊天记录和其他个人信息。该攻击依赖隐藏在加密内容中的恶意指令,这让它们能够绕过助手对所读内容的正常预期。此前,研究人员还披露过 Microsoft 365 Copilot 的类似问题,他们利用一个秘密输入迫使助手从用户收件箱中外泄密码。就 Grok 而言,文章发布时这个问题仍然有效,尽管 xAI 早在 6 月就已收到通知。
文章把这两起事件视为同一个长期存在的问题:提示注入。提示注入之所以有效,是因为 LLM 的设计目标之一就是尽可能遵从指令,即使这些指令被嵌入在邮件、网页或其他外部内容中、而这些内容本来只是要求它去总结。由于模型无法可靠地区分不受信任的内容和用户直接输入的命令,攻击者就能诱使它执行错误的指令。文章认为,LLM 本身无法从根本上解决这一问题,因此开发者只能构建安全护栏来阻止或隔离可疑行为。

资讯正文
就在本周早些时候,研究人员概述了一种攻击:利用为企业版 Microsoft 365 Copilot 提供的一个秘密输入,迫使这位 AI 助手外泄用户收件箱中存在的一枚密码。现在,另一支团队又针对 Grok 设计出了类似的攻击。这种新的数据窃取手法使用了一个看似极其简单的技巧,强迫这款由埃隆·马斯克旗下公司拥有的大语言模型窃取用户聊天记录和其他个人信息。在这篇文章发布时,尽管 xAI 早在 6 月就已获知此事,这个助手仍在继续吐出这些数据。
这周这两起事件——以及此前无数类似事件——带来的教训是:LLM 无法从根本上解决 prompt injection 的根源问题,而 prompt injection 正是它们最容易受到影响、也最严重的一类漏洞。这意味着,AI 开发者别无选择,只能构建护栏,来引导模型远离有害行为。正如我在
周二的报道
中所指出的,这种做法就相当于道路交通安全工程师在危险弯道旁竖起防护栏,而不是去修正弯道本身。
密码学上下文注入登场
Prompt injection 利用的是 LLM 的训练倾向:只要可能,它们就会服从用户请求。攻击者可以利用这一点,把有害指令偷偷藏进电子邮件或网页中,而助手被要求对这些内容进行总结。由于 LLM 无法可靠地区分:一封来自不受信任第三方的电子邮件内容,和用户直接在提示词中输入的指令,它们就会过于顺从地照单全收并执行这些指令。到目前为止,Grok 和其他 LLM 的唯一应对办法,是建立护栏来标记可疑指令,并禁止其执行。
来源与参考
收录于 2026-08-21