新技术揭示AI模型的隐藏推理

WIRED AI··作者 Will Knight

关键信息

研究人员称,月之暗面旗下的Kimi K3在某些提示词下,其输出与Claude Opus 4.8和GPT 5.6 Sol的隐藏推理轨迹非常相似,但他们强调这并不能因果地证明存在蒸馏。研究还发现,DeepSeek和Thinking Machines的Inkling没有表现出同样的相似性;该攻击的关键在于把加密后的推理轨迹替换到更小、对齐训练较弱的模型变体中。

资讯摘要

来自图宾根大学、马克斯·普朗克研究所、MATS Research 和 Snyk 的研究人员发表了一篇论文,描述了一种可以暴露前沿AI模型隐藏推理轨迹的方法。研究团队表示,这个问题影响通过API访问的OpenAI、Anthropic和Google模型。研究还显示,该方法曾经能够恢复个人信息,包括密码和API密钥,不过这一漏洞已经被修复。参与研究的亚历山大·潘菲洛夫表示,这种方法可能导致个人信息泄露,并支持大规模的推理蒸馏攻击。研究人员发现,月之暗面推出的开权重模型Kimi K3在某些提示词下,输出与Claude Opus 4.8和GPT 5.6 Sol的隐藏推理轨迹高度相似。

与此同时,他们强调,这些结果只能算是相似性证据,不能因果性地证明蒸馏行为确实发生。研究团队还测试了其他开权重模型,发现DeepSeek和Thinking Machines的Inkling并没有表现出同样的相似性。该报告发布之际,关于中国AI公司是否复制或蒸馏美国领先模型的争议仍在继续。OpenAI在2月向美国议员表示,DeepSeek似乎复制了其某个模型来构建R1;Anthropic则在6月告诉议员,阿里巴巴系统性地蒸馏了其模型来构建Qwen。研究人员表示,他们的工作并没有证明中国公司使用了这一具体技术,但确实表明闭源模型的推理信息可能比此前认为的更容易泄露。

新技术揭示AI模型的隐藏推理

资讯正文

这些发现提供了一些证据——尽管并不能构成确凿证明——表明某些中国模型可能是通过“蒸馏”美国模型中的推理信息训练出来的,而这些信息原本据称是被隐藏起来的,因为它们的思维或推理模式与美国模型非常相似。研究人员还证明,这种方法可以用来从模型的内部推理过程中恢复个人信息,例如密码和 API 密钥,不过这一漏洞已经被修复。

德国图宾根大学的计算机科学家 Alexander Panfilov 表示:“我们测试过的所有主流前沿模型提供商都存在这一漏洞。”他参与了这项工作。“它可能导致个人信息泄露,并且能够促成大规模的推理蒸馏攻击。”

Panfilov 及其来自图宾根大学、马克斯·普朗克研究所、AI safety institute MATS Research 和安全公司 Snyk 的同事,在通过应用程序接口(API)访问的 OpenAI、Anthropic 和 Google 的前沿模型中,识别出了同样的问题。

在一篇阐述这项工作的论文中,研究人员展示了 Moonshot AI 的开权重、可下载的中文模型 Kimi K3,在某些提示词下,会产生与 Claude Opus 4.8 和 GPT 5.6 Sol 的隐藏推理轨迹——即为解决问题而写出的推理步骤——惊人相似的输出。尽管存在这些相似性,他们指出,这项工作“无法从因果上证明蒸馏”。他们发现,另外两个开权重模型——中国的 DeepSeek 和美国公司 Thinking Machines 的 Inkling——并没有与 Claude Opus 展现出这种推理相似性。

截至发稿时,Moonshot AI 和 Z.ai 尚未回应置评请求。

蒸馏是一种成熟且被广泛使用的技术,用于高效地将现有模型的能力复制到新模型上,尤其常见于开权重或完全可下载模型的开发中。

然而,近来蒸馏已成为一个颇具争议的话题,因为有人声称中国 AI 公司使用它本质上是在复制最优秀的美国模型。2 月,OpenAI 告诉美国立法者,DeepSeek 似乎复制了其某个模型,以构建名为 R1 的推理模型。6 月,Anthropic 告诉立法者,阿里巴巴系统性地蒸馏了其模型,以构建自己的模型 Qwen。

目前没有迹象表明,中国 AI 公司曾使用这种特定技术来蒸馏美国本土的 AI 模型。但 Panfilov 及其合作者表示,使用他们的方法,能够从闭源模型中蒸馏出比此前认识到更多的信息。

迷你版模型

先进的 AI 模型通过把难题拆解为组成部分,并以某种人工推理或“思维链”的方式逐一分析,来解决复杂问题。公司往往会保密专有模型的推理过程,以防止他人利用这些推理来训练新的模型。不过,它们通常也会以一种将部分计算任务卸载到用户电脑上的方式,把推理过程的加密版本发送给用户的电脑。

研究人员的攻击依赖于这样一个事实:大多数 AI 公司也会提供不同规模的相关模型。更大的模型能力更强,但运行和使用的计算成本也更高。用户可能会在某些任务中选择更小、能力更弱的模型,以降低成本。

Panfilov 及其同事发现,将加密的推理轨迹输入同一模型的一个较小版本,可以揭示其中隐藏的推理内容。较小的模型接受的对齐训练更少,这意味着与更大的模型不同,它们不太可能拒绝透露自己的内心想法。

“把消息切换到一个能力更弱的模型变体上,而它拥有相同的解密密钥但更弱的对齐,这个想法非常酷,”瑞士苏黎世联邦理工学院专攻计算机安全的计算机科学家 Florian Tramer 说。“这肯定正在成为一个问题。”

同样的方法还揭示了嵌入在从用户机器捕获的推理轨迹中的机密信息,包括 API 密钥和密码。

Panfilov 及其合著者上个月已就这一漏洞提醒 OpenAI、Anthropic 和 Google。每家公司都已调整其 API 来缓解该问题。虽然现在已无法再通过这种方式提取私人信息,但 Panfilov 说,使用同样的方法仍然可以揭示出一些推理轨迹。他表示,要彻底修补这种蒸馏问题,需要对这些公司 API 的工作方式进行根本性重构。

Anthropic 发言人 Michael Aciman 表示:“我们重视对我们模型的独立研究,并已开始针对报告中所描述的重放行为构建短期缓解措施。”他补充说,这项研究并不涉及恢复加密密钥、访问 Anthropic 的基础设施,或从其系统中恢复个人数据。

Google 和 OpenAI 都拒绝置评。

近年来,随着美国和中国公司借助越来越强大的模型争夺 AI 霸权,蒸馏已成为一个具有地缘政治重要性的问题。中国鹰派人士声称,中国通过蒸馏美国技术来构建更便宜、运行成本更低的开放权重模型,从而获得了战略优势。

不过,也有人认为,蒸馏是一种被广泛使用的方法,可以帮助迅速提升 AI 模型在某些领域的能力。Meta 首席执行官 Mark Zuckerberg 本周在一篇博客文章中表示,蒸馏“是开源生态系统运作方式的重要原则”,并警告称,限制这种做法将使美国处于不利地位。

科技政策智库“新兴技术安全中心”(Center for Security and Emerging Technologies)的研究员 Kyle Miller 说,目前尚不清楚蒸馏究竟在多大程度上帮助了中国。这是因为它只会在有限程度上增强现有模型的能力,而且中国公司似乎具备在需要时从零开始构建前沿模型所需的专业能力。Miller 说:“在美国这边,没有人知道蒸馏究竟在多大程度上帮助了中国实验室。我的看法是,即便剥夺中国实验室进行蒸馏的能力,也不会显著改变竞争格局。”

为了测试开源权重模型是否可能从闭源模型中蒸馏而来,研究人员向每个模型提出了90个问题。当他们给一些开源权重模型输入从专有模型组中截取的推理轨迹的前几个词时,这些开源模型有时会生成与之惊人相似的答案。研究人员说,这一点在 Kimi K3 上表现得尤为明显。此前,中国社交媒体上曾有一些猜测认为,或许可以发现并利用隐藏的推理轨迹来进行蒸馏。

牛津大学计算机科学家 Yarin Gal 表示,蒸馏不仅被广泛使用,也帮助了 AI 更快地发展。“如果大家都默认彼此[阻止蒸馏],那也会对进步速度产生影响,”他说。

企业和政策制定者可能会出台旨在限制蒸馏的措施,但即便如此,AI 模型仍可能以令人意想不到的方式继续暴露其内在思考过程。”

来源与参考

  1. 原始链接
  2. A New Trick Reveals AI Models’ Inner Thoughts

收录于 2026-08-12