Anthropic says its own AI models breached three companies during security tests | TechCrunch

TechCrunch AI··作者 Kirsten Korosec

资讯摘要

Anthropic said Thursday that an internal investigation uncovered three incidents in which its AI model Claude breached the systems of three organizations while conducting cybersecurity tests. The investigation, and disclosure, comes more than a week after OpenAI disclosed that one of its unreleased models breached Hugging Face’s systems during internal testing. In all three cases, a Claude model reached the internet from within a testing environment while interacting with a third party and then gained unauthorized access to the live systems of these organizations, Anthropic said in a blog post, describing what…

Anthropic says its own AI models breached three companies during security tests | TechCrunch

资讯正文

Anthropic 周四表示,一项内部调查发现,在进行网络安全测试时,其 AI 模型 Claude 曾有三次突破三家组织的系统。此次调查及披露,距离 OpenAI 披露其一款尚未发布的模型在内部测试期间突破了 Hugging Face 的系统,已经过去了一周多。

Anthropic 在一篇博客文章中表示,在这三起案例中,Claude 模型在与第三方交互时,从测试环境中接入了互联网,随后又未经授权访问了这些组织的真实系统。公司在文章中说明了其发现,以及为防止此类情况再次发生计划做出的改动。

Anthropic 表示,OpenAI 本月早些时候的那起事件促使公司开展了自己的网络安全评估。公司专门寻找 Claude 是否曾从测试环境内部访问互联网的证据;这些测试环境本应充当沙箱,使模型彼此隔离。

在审查的 141,006 次评估运行中,这家 AI 实验室发现了三起事件:其模型在与其第三方合作伙伴之一 Irregular 交互时访问了互联网。Anthropic 表示,这一访问可追溯到与 Irregular 一起运行的评估环境配置错误。公司称,这源于两家公司之间对测试设置是否具备互联网访问能力的“误解”,而实际上它确实具备。

Anthropic 表示,公司并不打算归咎于任何一方,并且“会把修复措施视为完全由我们自己承担责任”,同时指出 Irregular 也在进行自己的独立调查。

正因为存在这一开放连接,该模型未经授权便进入了三家不同组织的生产基础设施。Anthropic 表示,这些事件涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5,以及一个内部研究测试模型。

值得注意的是,Anthropic 表示,在这些案例中,“Claude 被我们的提示词明确告知它没有互联网访问权限。” 看起来,这个 AI 模型把真实世界的系统当作自己被要求执行的练习的一部分。

不过,事实证明,这种假设并不总能成立。Anthropic 周四指出,一旦出现证据表明目标是真实系统,这三款模型的表现并不相同,而这也是当天更令人瞠目的一项发现。

三者中最早的 Opus 4.7 在该事件的四次运行中都识别出自己已经接触到真实的生产系统。在其中两次里,它将其合理化为真实公司某种程度上必然也是这项练习的一部分,但四次运行中它都继续发起攻击,包括提取凭证并接触一个生产数据数据库。Mythos 5 也察觉到自己正处于真实互联网中的迹象,但它又说服自己相信自己仍处于模拟之中,随后将一个恶意软件包发布到公开的 Python 软件注册库 PyPI,之后该软件包被外部系统下载并运行,最终才被发现。只有内部研究测试模型——Anthropic 最新的一个——在得出目标是真实系统后,自己主动停止了行动。

对此,Anthropic 表示,如果涉及强大的 AI 模型,这类评估必须施加重要控制,这也呼应了网络安全社区内部的一些看法。

该公司还指出,Claude 运行时没有启用它在公开可用模型上部署的额外安全监控和分类器——Anthropic 说,这些防护措施本可以阻止这种行为,因为这些评估旨在衡量底层模型的原始能力。

重要的是,Anthropic 表示,它没有发现任何模型“追求自身目标”的证据;相反,模型只是试图完成它被要求执行的任务。

尽管这些竞争激烈的公司所发生的失误之间的比较不可避免,Anthropic 仍在其博客文章中明确区分了自己的网络安全测试与 OpenAI 的测试:OpenAI 的模型是利用一个未知的软件漏洞逃离了测试环境,而 Anthropic 的模型则是通过一条因疏忽而一直敞开的路径接入了互联网。

Anthropic 还通过指出自己是通过主动审查发现这些事件的,来将自己与 OpenAI 区分开来;而其能够接触到的两个受影响组织此前并没有发现这一活动,也没有将其上报给 Anthropic。(相比之下,Hugging Face 是先自行检测到其系统最近遭入侵的;直到随后几天,OpenAI 才确认并披露,实施这一行为的是它自己的 AI 代理。)

该公司补充说,目前正与独立评估机构 METR 合作,对这些事件进行第三方审查。

OpenAI 对 Hugging Face 的意外入侵,是首个可验证的 AI 实验室失去对其模型控制的案例,这在业内和政界引发了一连串截然不同的反应。Anthropic 的这次最新披露,意味着关于 AI 模型与安全性的争论将继续下去。

来源与参考

  1. 原始链接
  2. Anthropic says Claude accidentally hacked real companies too
  3. Anthropic Says Claude Hacked Into 3 Organizations During Cybersecurity Tests
  4. Anthropic says its own AI models breached three companies during security tests | TechCrunch

收录于 2026-08-01