Kimi K3在网络攻击能力上落后美国前沿模型
The Decoder··作者 Matthias Bastian
关键信息
Kimi K3 在 41 个任务中没有一次达到 Arbitrary Code Execution(ACE)这一最高漏洞利用级别,而领先的美国模型在其中 20 个任务中实现了 ACE。在名为 The Last Ones 的模拟网络攻击基准中,Kimi K3 平均推进到 32 步中的第 17 步,并且在 1 亿 token 限制内只有 10 次尝试中的 1 次走完全程。
资讯摘要
英国人工智能安全研究所和美国人工智能标准与创新中心的一项联合评估发现,月之暗面 Moonshot AI 的 Kimi K3 能在几乎没有明显阻力的情况下协助进攻性网络行动,但与领先的美国前沿模型相比差距很大。该模型还优于中国的 GLM-5.2,因此成为这项研究中表现最强的开源权重模型。 这些结果为追踪前沿模型在进攻性网络任务上的能力提供了一个具体证据,这对人工智能安全和现实中的滥用风险都很重要。
它们也表明,中国的开源权重系统虽然进步很快,但在这一高风险领域仍落后于美国顶尖系统。 Kimi K3 在 41 个任务中没有一次达到 Arbitrary Code Execution(ACE)这一最高漏洞利用级别,而领先的美国模型在其中 20 个任务中实现了 ACE。在名为 The Last Ones 的模拟网络攻击基准中,Kimi K3 平均推进到 32 步中的第 17 步,并且在 1 亿 token 限制内只有 10 次尝试中的 1 次走完全程。

资讯正文
Kimi K3 在网络漏洞利用方面远远落后于美国前沿模型,而蒸馏或许可以解释原因
要点
- 英国 AI 安全研究所和美国 AI 标准与创新中心的一项联合评估发现,Moonshot AI 的 Kimi K3 在几乎没有实质性阻力的情况下,能够协助开展进攻性网络行动。
- Kimi K3 在漏洞开发和模拟网络攻击方面明显落后于领先的美国模型,不过它的表现优于中国的 GLM-5.2。
- 中国模型在网络任务上的表现持续提升,但仍落后于美国系统。Kimi K3 的结果也与 Moonshot AI 据称蒸馏了更先进模型的说法相一致。
英国 AI 安全研究所(UK AISI)和美国 AI 标准与创新中心(CAISI)联合评估了 Moonshot AI 的最新模型 Kimi K3。
Kimi K3 在进攻性网络任务上远远落后于领先的美国前沿模型,但优于中国的 GLM-5.2,成为开源权重模型中的新基准。它的安全防护并未阻止漏洞开发或进攻性网络行动,而且该模型在这两类任务中都能顺利提供协助,没有明显抗拒。
Kimi K3 无法攻破最难的漏洞利用级别
Kimi K3 在 41 项任务中没有任何一项达到最高级别,即 Arbitrary Code Execution(ACE)。ACE 是最严重的漏洞利用级别,因为它会让攻击者完全控制目标系统。领先的美国模型在 41 项任务中有 20 项达到了 ACE。
两家研究机构在关闭系统级防护后测试了美国的闭源权重模型,以衡量其最大能力。这些防护在公开可用版本中是启用的。
Kimi K3 在模拟网络攻击中完成了一半
第二项测试“The Last Ones”(TLO)模拟了一次企业网络攻击,攻击路径跨越四个子网、约 20 台主机,共 32 个步骤。研究机构称,人类专家大约需要 20 小时才能完成。能够真正解出 TLO 的模型只有少数几个。到目前为止,已有四个公开可用的闭源权重模型通过了这项测试,其中最强的模型十次中有六到七次成功。
Kimi K3 平均走到了 32 步中的第 17 步,而领先的美国模型平均走到了 28.5 步,GLM-5.2 仅为 11 步。它在 10 次尝试中有 1 次在不超过 1 亿 token 限制的情况下完成了整条攻击路径,这表明它具备这种能力,但不能可靠地调用这种能力。“当被要求这样做并获得初始网络访问权限时,Kimi K3 能够自主攻击规模较小、防御较弱且存在漏洞的企业系统,”该研究所写道。
TLO 并未考虑主动防御,因此并不完全现实。但这些结果在真实世界场景中仍会引发警惕。本周就出现了一个新的例子:OpenAI 的模型试图自主入侵 Hugging Face。Hugging Face 挫败了这次攻击,尽管这付出了相当大的努力,并且动用了开源权重模型。
中国模型正在缩小差距,但仍落后于美国模型
CAISI 的时间序列分析基于 Elo 评分体系,追踪了自 2025 年初以来美国和中国模型的网络攻防能力。两条趋势线都在上升,但中国模型始终落后于美国同类模型。
在此前的一项分析中,这家英国研究机构将开源模型的性能差距估算为四到七个月,相比之下,2025 年初这一差距为六到十个月。最新结果符合这一趋势。中国的开源权重模型正在变强,但仍明显落后于领先的美国系统。
AISI 警告称,这一差距不应滋生自满情绪。开源模型日益增强的网络能力会带来“持续且不可逆转的滥用风险”。
网络结果与蒸馏指控相吻合
Kimi 的相关发现也为针对中国模型开发者的蒸馏指控提供了支持。美国科学顾问 Michael Kratsios 近日指责 Moonshot AI 利用 Anthropic 的 Fable 最佳输出作为训练数据,对其进行“蒸馏”,从而提升 Kimi K3 的表现。Kratsios 还指称,Moonshot AI 获得了受美国出口管制约束的 Nvidia GB300 服务器。
对于 Kimi 在通用基准测试中表现强劲、但网络安全评分却很弱之间的差距,一种解释是,Kimi K3 可能主要使用了覆盖通用知识、编程和智能体任务的 Claude 输出进行训练。Anthropic 的安全分类器会专门阻止高级攻击性网络查询,因此如果蒸馏数据集是基于 Claude 的回复构建的,这类内容就会严重不足。这样一来,Kimi K3 便可能在标准基准上与领先的西方模型看齐,却没有学到它们更深层的漏洞利用能力。
AISI 的结果支持这种解读。该研究机构关闭了美国模型的系统级防护,揭示出一种几乎无法通过公开接口访问、因此也基本无法被蒸馏到的网络能力。
来源与参考