专家质疑Kimi K3蒸馏说法

TechCrunch AI··作者 Tim Fernholz

关键信息

Kratsios 将这一行为称为“规模庞大的、隐秘的工业级蒸馏”,但他没有给出证据,也没有解释所谓美国模型的“水印”到底是什么。TechCrunch 引述的专家认为,像 Fable 这样 7 月 1 日才公开的模型,不太可能在大约两周内被蒸馏并训练出像 Kimi K3 这样强的模型。

资讯摘要

《TechCrunch》报道称,白宫科学顾问 Michael Kratsios 指控 Moonshot 这家中国公司是通过复制 Anthropic 的 Fable 大语言模型来构建 Kimi K3 的。报道还称,他把这一指控与使用未获准出口到中国的芯片联系在一起。Kratsios 将此形容为“规模庞大的、隐秘的工业级蒸馏”,并称这相当于窃取美国专有技术,但他没有提供更多证据细节。文章提到,财政部长 Scott Bessent 也曾表示,美国正在许多中国模型中发现美国大语言模型的“水印”,但“水印”具体指什么,财政部并未说明。Moonshot 没有回应有关其训练流程的提问。

报道指出,Kimi K3 被称为目前可获得的最大开放权重 LLM。尽管如此,受访研究者对“仅靠蒸馏”能否解释 Kimi K3 的表现表示怀疑。Braden Hancock 认为,Fable 7 月 1 日才公开,不可能在这么短时间内完成足够多的数据蒸馏、模型训练和发布。Nathan Lambert 则表示,随着模型越来越强,仅靠监督微调的作用正在下降,要复现前沿水平能力可能需要更复杂的强化学习技术和更昂贵的基础设施。文章还提到,Anthropic 今年早些时候曾指控 Moonshot、DeepSeek 和 MiniMax 系统性蒸馏其模型,理由是其通过 IP 地址和其他元数据识别出了数百万次相关交互。

专家质疑Kimi K3蒸馏说法

资讯正文

白宫科学顾问 Michael Kratsios 表示,Moonshot——Kimi K3 背后的中国公司,也是目前可获得的最大开源权重 LLM——是通过复制 Anthropic 的 Fable LLM 并使用了未获准出口到中国的芯片来构建其模型的。

在有关禁止中国开源权重模型的讨论扰动 AI 领域之际,Kratsios 写道:“大规模、隐秘的工业级蒸馏,旨在窃取美国专有技术并削弱美国研究,这是不可接受的。” Moonshot 没有回应有关其训练过程的问题,而 Kratsios 也没有提供更多关于这些指控来源的细节。

Kratsios 的推文呼应了财政部长 Scott Bessent 的说法,即“我们在许多中国模型上发现了我们美国大型语言模型的水印,而这不可接受。” 这些水印具体是什么并不清楚,美国财政部也没有回应询问。

不过,专家们对“蒸馏”是否是 Kimi K3 所展现先进能力的原因持怀疑态度。蒸馏是指通过查询一个 LLM 来了解其内部运作并复制其能力的过程。

“Laude Institute 的研究员、Snorkel AI 联合创始人 Braden Hancock 告诉 TechCrunch:‘我不认为你能仅仅依靠对 Fable 进行严格意义上的蒸馏,在这么短时间内做出一个这么强的模型。’ 他说:‘说实话,时间根本不够,对吧?Fable 直到 7 月 1 日才公开可用。你不可能在两周内蒸馏那么多数据、训练一个模型并发布它。’”

“我一直认为,随着中国模型越来越接近前沿水平,而且训练范式转向 [强化学习],蒸馏的影响力正变得越来越小,”Allen Institute for AI 的 AI 研究员 Nathan Lambert 在昨天发布的一档播客中表示。“[I]f 真是那样的话,任何人都可以通过用它的数据进行蒸馏,轻松追上 GLM 或 K3。但我们没有看到这种情况,或者说,不会仅仅通过监督式微调看到这种情况。”

执行蒸馏要求实验室系统性地向目标模型发起查询,以生成可用于后训练的数据。有时,这明确地包括要求模型阐述其“思维链”,以理解它是如何解决问题的。另一些时候,模型的提示词和回复会被用于训练一个新模型,这一过程被称为监督式微调,或 SFT。

正是这种微调过程,可能会导致一个据称由第三方创建的模型声称自己是 Claude。按照 Lambert 的看法,微调是模型“学会举止礼仪”的地方。

但 Lambert 表示,随着模型变得越来越复杂,SFT 的收益正变得没那么重要。要蒸馏出类似 Fable 的能力,可能需要强化学习技术。在许多情况下,这意味着让更大的模型中的一个代理给小模型的回答打分,并根据分数进行调整。

更先进的技术还需要更大规模的基础设施。大规模强化学习运行可能需要数千万个智能体。使用前沿实验室的 API 来做这件事“会贵得离谱,而且可能还会成为时间瓶颈,因为这些模型相当慢,而且说实话,甚至未必能给你带来性能提升。”

前沿模型此前似乎也可能对 Kimi 有所贡献;Anthropic 今年早些时候公开指控 Moonshot、DeepSeek 和 MiniMax 系统性地蒸馏其模型。Anthropic 表示,它通过 IP 地址和其他元数据,发现了其模型与它识别出的这些公司员工用户之间的数百万次交互。这些查询“不同于正常使用模式,反映的是有意进行能力提取,而非合法使用。” Anthropic 没有回应 TechCrunch 关于 Fable 蒸馏的询问。

不过,蒸馏被认为在 AI 公司中很常见,而不仅限于中国。埃隆·马斯克今年早些时候作证称,他的公司 SpaceXAI 蒸馏了 OpenAI 的模型来开发 Grok,而且这种做法在业内很常见。例如,蒸馏与构建合成数据集之间的界限就可能相当模糊。

汉考克说:“一般来说,美国人低估了这些中国团队的技术实力。[Moonshot] 的一位创始人曾是卡内基梅隆大学(CMU)的博士生。这些都是真正的研究人员和工程师,在做扎实的工作。……如果美国模型停滞不前,我认为中国的进展会放缓,但仍会继续。他们并不是只是在搭顺风车。”

同样很难把蒸馏与克拉齐奥斯评论的第二部分区分开来——即 Moonshot 获得了先进的 Nvidia 芯片、Grace Blackwell 300,而且还接入了泰国配备 GB300 的服务器。乔治城大学安全与新兴技术中心研究员萨姆·布雷斯尼克表示,这些芯片被禁止出口到中国,但存在黑市。5 月,美国服务器制造商 Supermicro 的创始人因将先进芯片走私到中国而被起诉。

布雷斯尼克说:“我支持在全球范围内针对数据中心实施‘了解你的客户’法律。如果你允许一家公司在你最先进的硬件上进行大规模训练,就需要有一个报告机制,说明这家公司是谁,以及他们在做什么。”

乔·拜登总统领导下的美国商务部曾在 2024 年提议对数据中心实施联邦层面的‘了解你的客户’规则,但在唐纳德·特朗普任内似乎没有再取得进一步进展。不过,向海外运送先进芯片的出口商应当确保这些芯片只用于获批用途。”}]}

来源与参考

  1. 原始链接
  2. Experts say exploiting Anthropic's Fable isn't how Kimi K3 got so good | TechCrunch

收录于 2026-07-24