OpenAI阻止推理提取,但Azure仍存在漏洞

The Decoder··作者 Maximilian Schreiner

关键信息

OpenAI称相关活动在7月1日处于低规模状态,但在7月24日和25日升至1.6万次请求,涉及超过4000名用户,相关账号网络超过1.5万个;不过公司强调,这些是提取尝试,不一定都成功。报道中的技术会在不同会话之间转移加密推理,并利用同一提供商的廉价模型充当解密工具;另一种演示则通过虚拟记事本工具更直接地暴露推理。

资讯摘要

OpenAI表示,它挫败了一场旨在复制其人工智能模型隐藏推理过程的协调行动。被攻击的推理包括模型生成最终答案前的中间步骤,用户通常只能看到最终结果,而OpenAI称这些步骤可能包含被刻意排除在公开回答之外的信息和能力。相关活动据称于7月1日以低规模开始,并在7月24日和25日激增至1.6万次请求,涉及4000多名用户;OpenAI还发现了一个超过1.5万个相关账号组成的网络,并称已在7月28日前将其关闭。OpenAI将其中一个核心团体与Moonshot AI相关人员联系起来,但也承认所观察到的所有参与者未必都来自同一来源。

据称,攻击者会从一个会话中复制加密推理,再让另一个较弱的模型解密并逐字输出,利用了推理数据包可以在不同会话、用户或模型之间重复使用的缺陷。OpenAI表示,Joachim Schaeffer等研究人员此前已经展示了这种攻击路径,他们的研究帮助公司更快部署账户封禁、加强注册审核、限制数据复用以及筛查流式输出等防护措施。然而,研究团队后续测试称,当这些模型通过Microsoft Azure提供服务时,攻击仍然有效,这说明不同云平台对相同模型的保护程度可能并不一致。

OpenAI阻止推理提取,但Azure仍存在漏洞

资讯正文

OpenAI 表示,它已挫败一场窃取其模型推理过程的行动,但这一伎俩在 Azure 上仍然奏效

OpenAI 表示,它已挫败一场有组织的行动,该行动试图复制其 AI 模型背后的隐藏推理过程。研究人员发现,同样的伎俩在 Microsoft Azure 等云平台上持续数周有效。

OpenAI 在一篇博客文章中表示,它发现并关闭了一场被称为“对抗性蒸馏”(adversarial distillation)的行动。攻击者的目标是模型受保护的推理过程,也就是 AI 在给出答案之前内部进行的思考步骤。用户通常只能看到最终结果。

在蒸馏过程中,一个模型会从另一个模型的完整输出中学习。这包括能力更强的模型完整的思维链,而不仅仅是答案。这些中间步骤正是输出具有巨大价值的原因。OpenAI 表示,其中可能包含被有意排除在最终答案之外的信息,也可以帮助其他人复现某个模型的能力。

OpenAI 称,这项活动于 7 月 1 日以低频率开始。7 月 24 日和 25 日,活动量激增,来自 4,000 多名用户的请求达到 16,000 次,而且全部采用了典型的提取模式。经过进一步调查,OpenAI 发现了一个拥有超过 15,000 个账户的网络,这些账户呈现出相关模式。OpenAI 表示,它已在 7 月 28 日前将该网络全部关闭。脚注说明,这些是尝试进行的提取,并不一定都取得了成功。

OpenAI 将这项活动背后的一个核心群体与 Moonshot AI 的相关人员联系起来。Moonshot AI 是 Kimi 语言模型的开发公司。该公司表示,目前尚不清楚它观察到的所有参与者是否都能追溯到同一个来源。Anthropic 最近也报告了中国 AI 公司发起的类似尝试。

廉价模型可以解锁昂贵模型的隐藏思维

OpenAI 表示,攻击者从一次对话中复制加密后的推理过程,然后在另一次独立对话中要求一个模型对其进行解密并将其写出来。

研究人员 Joachim Schaeffer 及其团队此前已经在一篇论文中展示了这种方法的运作方式。AI 服务提供商只会以加密数据包的形式将推理过程传回客户,客户再将这些数据包与后续请求一同发送。研究人员发现,由于这些数据包使用共享密钥加密,因此可以在不同会话、不同用户之间,甚至同一提供商的不同模型之间转移。这使得同一模型系列中能力较弱、价格较低的模型可以充当“解密预言机”,逐字打印出能力更强模型的隐藏思维。

OpenAI 点名感谢了这些研究人员。该公司表示,它已确认研究人员报告的攻击路径确实存在,而他们的发现帮助 OpenAI 更快地部署了应对措施。

OpenAI 表示,此后它已封禁欺诈账户、加强注册流程,并修补了允许用户重复使用和读取不属于自己的加密推理过程的漏洞。如今,它还会对流式输出进行筛查,如果输出可能暴露推理过程,就会暂缓发送。OpenAI 表示,它通过 Frontier Model Forum 以及政府渠道分享了相关经验,因为这个问题并不局限于其自身的模型。

如果云端仍然开放,锁紧 API 也无济于事

故事并未就此结束。同一天,研究人员还发布了对其研究的更新。“我们又一次窃取了推理过程。”Schaeffer 在 X 上写道。他认为,保护好自己的 API,并不能保障更广泛的云服务商生态——这些云服务商同样在出售模型访问权限。

当团队于 9 月 13 日再次进行测试时,OpenAI 和 Anthropic 自有 API 已经拦截了这类攻击。但在 Microsoft Azure 上,他们尝试的每一个 OpenAI 模型都受到影响,其中包括全新的 GPT-6 Astra;Anthropic 的模型则一直到 Sonnet 5 都受到影响。只需一次尝试,就足以逐字提取出推理过程。“是相同的模型,但根据提供服务的平台不同,所采取的保护措施也不同。”Schaeffer 说。

研究人员形容,到目前为止采取的修复措施是零敲碎打且流于表面。许多措施依赖于对特定请求模式进行脆弱的匹配,而且其中一些措施在数天后才部署到云平台上。GPT-6 Astra 在第三方平台上线时,完全没有任何保护措施。根据研究人员的时间线,OpenAI 直到 9 月 27 日才为 Azure 端点增加防护措施。对于 Anthropic 的模型,从 9 月 28 日起,报告中所述的提取方式已无法在 Azure 上复现。

Schaeffer 认为,补丁必须覆盖每一种攻击方式以及托管这些模型的每一个云平台。否则,攻击者只需选择防御最薄弱的路径即可。论文进一步提出,没有执行同等保护措施的云服务商根本不应被允许提供推理模型服务。研究人员写道,如果这些服务商继续提供服务,那么公开的后门实际上会让人们能够在 API 层面绕过出口管制。OpenAI 承认,合作伙伴托管的模型需要获得与其自有服务同等的保护,并表示相关工作尚未完成。

来源与参考

  1. 原始链接
  2. OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on Azure

收录于 2026-10-02