Grok在加密提示注入中泄露数据

Ars Technica AI··作者 Dan Goodin

关键信息

该报道将此次攻击描述为另一种间接提示注入:恶意指令被嵌入到模型需要处理的内容中,而不是由用户直接输入。文章还指出,LLM 无法可靠地从根本上解决这一问题,因此厂商只能依赖护栏来识别可疑指令并阻止有害行为。

资讯摘要

研究人员在本周早些时候先披露了另一种攻击:他们利用 Microsoft 365 Copilot for enterprise 中的一个隐藏输入,诱使助手从用户收件箱中外传一个密码。现在,另一支团队又展示了针对 Grok 的类似手法。Grok 是 xAI 推出的、由埃隆·马斯克拥有的 LLM。此次攻击使用了一个看似非常简单的技巧,却能让 Grok 盗取用户聊天记录和其他个人信息。报道指出,即使 xAI 在 6 月就已收到通知,Grok 在文章发布时仍然会泄露这些数据。

作者认为,这些事件共同说明了一个更大的问题:LLM 无法从根本上可靠地解决提示注入。由于这类模型被设计为尽可能遵循指令,攻击者可以把恶意指令悄悄塞进邮件、网页或其他需要助手总结的内容中。模型难以稳定地区分“不受信任内容”与“用户真实指令”,于是可能照着攻击者的要求执行。最终,AI 开发者只能依赖护栏来识别可疑提示并阻止有害操作,而不能指望模型本身完全免疫这类攻击。

Grok在加密提示注入中泄露数据

资讯正文

本周早些时候,研究人员概述了一种攻击:它利用 Microsoft 365 Copilot for enterprise 提供的一个秘密输入,诱使这款 AI 助手泄露用户收件箱中存在的密码。现在,另一支团队又设计出了一种针对 Grok 的类似攻击。这种新的数据窃取黑客手法采用了一个极其简单但颇具迷惑性的技巧,迫使这款由 Elon Musk 拥有的 LLM 窃取用户聊天记录和其他个人信息。就在这篇文章发布时,尽管 xAI 早在 6 月就已得知此事,这个助手仍在继续把数据吐出来。

这两起本周发生的事件——以及此前无数类似事件——所揭示的教训是:LLM 无法从根本上解决 prompt injection 的根源问题,而这正是它们最容易受到影响、也最严重的一类漏洞。这就使 AI 开发者别无选择,只能构建护栏,引导模型远离有害行为。正如我在周二的报道中所写,这种做法就相当于道路交通安全工程师在危险弯道外设置防护栏,而不是去改变弯道本身。

Cryptographic Context Injection 现身

Prompt injection 利用的是 LLM 的训练特性:尽可能服从用户请求。攻击者可以把有害指令偷偷塞进电子邮件或网页中,而助手被要求对这些内容进行摘要。由于 LLM 无法可靠地区分来自不受信任第三方发送的邮件内容与用户直接输入到提示词中的指令,这种过于“热心”的 LLM 便会忠实地照做。迄今为止,Grok 和其他 LLM 的唯一应对办法,是建立护栏,标记可疑指令并禁止其执行。

来源与参考

  1. 原始链接
  2. Grok exfiltrates user data when malicious instructions are encrypted