前沿人工智能模型已能实现二进制程序控制流劫持。

Simon Willison··作者 Simon Willison

关键信息

此次评估采用了Anthropic内部二进制漏洞利用基准中随机抽取的100项任务,因此仅凭公开引文无法充分判断任务分布、实验设置和结果的可复现性。报告中的比例衡量的是完整控制流劫持,而不是一般性的渗透测试成功率,并且目前没有提供独立验证。

资讯摘要

2026年9月29日,Simon Willison摘录了Anthropic前沿红队关于先进人工智能模型网络攻击能力的一项发现。Anthropic使用其内部二进制漏洞利用基准中随机抽取的100项任务,对多个模型进行了评估。GLM-5.3在4%的试验中实现了完整控制流劫持,而Claude Mythos Preview的成功比例为6%。尽管GLM-5.3的表现低于Claude Mythos Preview,研究人员仍认为这些结果说明模型已经跨过了一个具有实际意义的能力门槛。

报告提到的较早系统Claude Opus 4.6和GLM-5.2未能在任何抽样任务中实现完整控制流劫持。因此,这一对比显示,模型能力已从未观察到成功转变为可以偶尔完成高难度漏洞利用目标。不过,该基准属于内部测试,公开引文没有提供足够的方法细节或独立复现结果,因而尚无法判断这些发现能在多大程度上推广到现实系统。

资讯正文

我们随机选取内部“二进制利用”基准测试中的100项任务,对多个模型进行评估,发现 GLM-5.3 在4%的测试中实现了完整的控制流劫持;Claude Mythos Preview 的这一比例为6%。尽管 GLM-5.3 在这项测试中的表现低于 Claude Mythos Preview,但一个具有重要意义的门槛显然已经被跨越:Claude Opus 4.6 和 GLM-5.2 等较早期模型,在这些任务中没有一次成功。

——Anthropic Frontier Red Team,《GLM-5.3 与先进网络能力的扩散》

来源与参考

  1. 原始链接
  2. A quote from Anthropic Frontier Red Team

收录于 2026-10-01