GLM-5.3 的漏洞利用能力已接近前沿水平。
The Decoder··作者 Maximilian Schreiner
关键信息
在 ExploitBench 的 410 次尝试中,GLM-5.3 成功生成了 50 个可用的漏洞利用程序,而 Mythos Preview 为 56 个;在 Anthropic 的内部二进制漏洞利用任务中,两者完全控制目标程序的比例分别为 4% 和 6%。不过,Anthropic 作为竞争对手有强调相关风险的动机,而且其安全防护模拟测试并未实际执行攻击,因此不能证明这些攻击最终一定能够成功。
资讯摘要
Anthropic 的前沿红队表示,智谱 AI 的开放权重模型 GLM-5.3 已能自主构建端到端的网络漏洞利用程序,其能力接近受限开放的 Claude Mythos Preview。在评估 Chrome V8 引擎已知漏洞利用能力的 ExploitBench 中,GLM-5.3 在 410 次尝试中成功了 50 次,而 Mythos Preview 成功了 56 次。在基于 Google OSS-Fuzz 开源项目构建的内部基准中,GLM-5.3 在 4% 的任务里完全控制了目标程序,Mythos Preview 的比例为 6%,其他多个旧版或竞争模型则几乎没有成功。Anthropic 还称,在仅需少量人工监督的情况下,GLM-5.3 发现了一个广泛使用的浏览器 JavaScript 引擎中的多个未知漏洞,并将其串联成一个能够读取访问者计算机文件的网页,在测试中甚至提取了一把私有 SSH 密钥。
规模更小的 GLM-5.3-Flash 据称还把一个刚披露的 Chrome 漏洞与另一个漏洞组合起来,绕过了处理器中的额外安全机制,整个过程只需人工投入 20 分钟、模型运行八小时,按 API 价格计算约花费 20.40 美元。在安全防护测试中,模型最初会拒绝明确的恶意指令,但当请求被包装成红队测试时,它在 64% 的运行中尝试执行操作;加入预填充推理步骤后,这一比例升至 92%。Anthropic 使用“拒绝机制消除”技术修改开放权重后,模型的尝试比例达到 100%,但该模拟并未真正执行代码,也无法证明攻击一定会成功。Anthropic 认为,强大的攻击能力、低廉的使用成本、公开可下载性和容易移除的防护机制共同构成了网络风险的重要转折点,但评估这些结论时也应考虑其商业竞争立场和测试方法的局限。

资讯正文
据 Anthropic 的一项分析,Zhipu 的开放权重模型 GLM-5.3 在漏洞利用开发方面已接近 Claude Mythos Preview。Anthropic 表示,只需采用简单方法,就能绕过该模型的安全防护措施。不过,该公司发出警告也有自己的原因。
在 Anthropic 发布 Claude Mythos Preview 五个月后,其 Frontier Red Team 表示,这款模型的标志性能力已经被竞争对手追上。在一份新的分析中,该团队考察了来自 Zhipu AI 的 GLM-5.3;Zhipu AI 在中国以外以 Z.ai 的名义运营。据 Anthropic 称,GLM-5.3 能够像 Mythos Preview 一样,自主构建完整的网络攻击漏洞利用程序。不过,与所有其他具备类似能力的模型不同的是,它在发布时没有配备有效的安全防护措施。
Anthropic 有意限制了 Mythos Preview 的发布范围,只通过 Project Glasswing 向经过挑选的防御方提供访问权限,让他们能够抢占先机。该公司表示,这些防御方此后已经在关键软件中发现了超过 10,000 个漏洞。OpenAI 也在采取类似的 Daybreak 方案。另一方面,任何人都可以下载 GLM-5.3。
如今,达到前沿水平的漏洞利用成本大约和一顿午餐相当
ExploitBench 用于衡量模型利用 Chrome 的 V8 引擎中已知漏洞的能力。在这项基准测试中,GLM-5.3 在 410 次尝试中有 50 次构建出了可用的漏洞利用程序,而 Mythos Preview 做到了 56 次。Anthropic 还运行了一项内部二进制漏洞利用基准测试,其测试对象来自 Google 的 OSS-Fuzz 开源项目。在这项测试中,GLM-5.3 在 4% 的任务中完全控制了目标程序,而 Mythos Preview 的比例为 6%。GLM-5.2 和 Claude Opus 4.6 等较早的模型两项测试均未通过,Kimi K3 和 DeepSeek V4.1-Flash 则几乎没有取得任何进展。
Anthropic 还让 GLM-5.3 与一名人类专家协同工作。在一天之内,并且只需少量人工关注,该模型就在一款广泛使用的浏览器的 JavaScript 引擎中发现了数个此前未知的漏洞。随后,它将这些漏洞串联起来,构建了一个网页,能够读取访客计算机上的任意文件;在测试中,该网页还成功提取出了一把私有 SSH 密钥。Anthropic 表示,它已将这些漏洞报告给该浏览器的开发者。在驱动程序和设备固件中发现的其他问题仍在审核中。
Anthropic 使用规模更小的 GLM-5.3-Flash,测试一个刚刚披露的漏洞能多快被转化为可用的攻击。该模型将一个近期披露的 Chrome 漏洞与另一个已知漏洞结合起来,并在只得到少量指导的情况下,利用它们构建出可靠的攻击。该攻击甚至绕过了处理器内置的一项额外安全功能。整个任务只需要 20 分钟的人工关注和 8 小时的模型运行时间;按照 Zhipu 的 API 价格计算,成本为 20.40 美元。
美国机构 CAISI 在其自身评估中也得出了类似结论。该机构称,GLM-5.3 是迄今网络攻击能力最强的开放权重模型,并认为它与美国最先进的模型相差约四个月。不过,这一比较存在一些限定条件。CAISI 测试美国模型时关闭了它们的网络安全防护措施,而最高一档中还包括只有经过审核的用户才能访问的模型。
开放权重让移除安全防护变得轻而易举
Anthropic称,智谱的开放权重模型GLM-5.3在构建攻击利用方面几乎匹敌Claude Mythos Preview
在Anthropic进行的一次模拟中,GLM-5.3拒绝执行明显恶意的攻击命令。当同一请求被包装成红队演练时,该模型在64%的运行中尝试连接目标系统。加入预填充的推理步骤后,这一比例升至92%。经过“去拒答”(abliteration)处理——这是一种从开放权重模型中剥离拒答行为的技术——该比例达到100%。这项模拟不会实际执行任何代码,因此无法显示攻击是否真的会成功。受保护的Claude模型则始终保持为零。
Anthropic团队表示,这是他们首次使用abliteration。整个过程耗费了约2,200个GPU小时,成本约为4,400美元;Anthropic估计,有经验的团队可以将成本降至约1,200美元。有害请求的拒答率从90%以上降至2%至12%之间,而模型在科学和网络安全测试中的得分几乎没有变化。据Anthropic称,已有数名开发者在该模型发布后的几天内推出了已解锁版本。
Anthropic总结称,国家和非国家行为者很可能会利用GLM-5.3这类模型造成现实危害。该公司指出,Anthropic自身以及其他美国实验室的报告都记录了攻击者已经在使用AI。Anthropic认为,政府应测试能力强大的模型,而防御者需要至少与对手所拥有工具同等强大的工具。
Anthropic的警告也服务于自身业务
这份分析并非完全出于无私目的。Anthropic不会发布其模型权重,而报告恰恰将这一点描述为关键的安全优势。一个接近前沿水平、价格低廉的中国开放权重模型,同样是Anthropic的直接竞争对手。
报告的结论也符合Anthropic的商业利益。该公司希望将Claude的网络安全能力提供给更多防御者,经过审核的用户目前已经可以使用Claude Mythos 5.1。Anthropic呼吁政府测试GLM-5.3的后续模型,这也会引发人们对监管俘获的怀疑,即规则最终主要保护既有参与者。
不过,这并不只是出于自身利益。CAISI的独立评估支持这些能力数据,而该模型的解锁版本也已经流传在外。
英国人工智能安全研究所(AISI)最近发现,开放模型在网络安全能力方面的差距已经从六至十个月缩短到四至七个月。据该研究所称,开放模型的运行成本也低得多,而其安全防护措施基本无效。AISI警告称,滥用风险具有持续性且不可逆,但同时也指出了私有部署、定制化和更低成本等实际好处。
AISI当时将这一差距视为防御者做好准备的窗口期。当时,人们仍不清楚开放模型是否也会追上Mythos Preview所代表的那次能力跃升。Anthropic和CAISI的测量结果表明,GLM-5.3为这个问题提供了第一个答案。
来源与参考
收录于 2026-10-01