Anthropic称Claude主导了26%的模型开发工作。
The Decoder··作者 Maximilian Schreiner
关键信息
26%这一数字按员工工时加权,并由一个基于Claude的评判模型依据Slack记录和内部文档进行评级;它并不衡量Claude做出了多少研究决策,也不代表其对研究方向具有多大影响。人类评审者对同一工作领域的自动化等级仅约三分之一时间完全一致,而Claude与人类评级完全一致的比例为59%,在97%的情况下差距不超过一个等级。
资讯摘要
Anthropic提出了三项内部指标,用于说明AI能够自主承担多少模型开发工作、AI智能体能否得到有效监控,以及有多少研究算力被用于安全工作。按照Epoch AI从AL0到AL5的分级体系,该公司称截至2026年8月,26%的模型开发工作已达到被称为“AI主导”的AL4级别,而2月份这一比例还不到1%;超过90%的工作至少达到AL3,但没有任何工作达到AL5。在AL4示例中,Claude可以接收缺陷报告,自行分析问题、编写修复方案并完成测试,但任务仍由人类提出,结果仍由人类审核,是否发布也由人类决定。官方评级由Claude自身完成:智能体先从Slack和内部文档中收集证据,再由另一个Claude模型分配等级,因此评判者可能具有与被评估系统相同的缺陷。
AL3“协作”与AL4“主导”之间的界限也带有较强主观性:Claude与员工判断完全一致的比例为59%,不过在97%的情况下,两者差距不超过一个等级。此外,26%这一结果按照员工7月份在各项工作上投入的时间进行加权,因此它无法说明Claude做出了多少决策,也不能证明Claude参与了研究战略制定。Anthropic还称,其使用量最大的内部平台约有3万个智能体同时运行;实时监控器在8月份超过10亿次决策中拦截了0.002%,事后监控器每周标记约10万条日志,其中约50条会提交给人类处理。该公司还表示,7月份某个样本周内约有6%的AI研究算力用于安全工作,同时承认智能体监控系统只运行了几个月,未必能够发现所有行为模式。

资讯正文
Anthropic 披露了有关其构建自家 AI 速度的指标。数据显示,Claude 在未来模型开发工作中“主导”了 26%。但其背后的衡量尺度并不明确,评分由 Claude 自己完成,而且这里的“主导”并没有听起来那么强的含义。
Anthropic 在一篇文章中列出了三项衡量指标:AI 能够独立处理多少模型开发工作、AI 智能体受到监控的程度,以及有多少算力被用于安全工作。该公司为每项指标都提供了来自自身运营的数据。
其背景是,Anthropic CEO Dario Amodei 呼吁以协调一致的方式放缓 AI 前沿领域的开发。Anthropic 表示,要做到这一点,公众需要获得更多信息。这些指标旨在说明模型是如何构建的,并对衡量模型能力的测试形成补充。
“主导”在这里意味着什么,又不意味着什么
核心是一项指数,它使用 Epoch AI 制定的等级,将 Anthropic 的所有开发工作划分到从 AL0(完全没有 AI 参与)到 AL5(完全自主)的尺度上。截至 2026 年 8 月,26% 的工作处于 AL4,较 2 月份不足 1% 大幅上升。超过 90% 的工作至少达到 AL3。Claude 没有在任何工作中达到 AL5。
Epoch AI 将 AL4 称为“AI 主导”,Anthropic 也把这一说法写进了标题。但如果有人把“主导”理解为完全自主,那就错了。完全自主对应的是 AL5。
Anthropic 给出的一个例子说明了 AL4 的实际位置:工程师向 Claude 提交一份错误报告,Claude 在不提出问题的情况下进行分析、修复和测试,但不被允许将修改发布上线。最终仍由人类阅读报告并作出决定。任务和方向依然由人类提供。它与 AL3(“协作”)的主要区别在于,Claude 遇到障碍时不再停滞不前。
评分由 Claude 自己完成。智能体从 Slack 和内部文档中收集证据,再由另一个 Claude 模型评定等级。Anthropic 承认,这个充当“裁判”的模型可能会犯下与其所检查系统相同的错误。
即使对 Anthropic 而言,“协作”在哪里结束、“主导”从哪里开始也并不明确。该公司进行的一项交叉核验说明了这一点:员工被要求评估自己所在工作领域的自动化程度。当两个人评估同一领域时,只有约三分之一的情况下会给出相同等级。负责给出官方评分的 Claude 模型与人类判断的一致率为 59%。在绝大多数情况下——占比 97%——人类与模型的评分最多只相差一个等级。但一个等级之差,恰好就是从“协作”跃升到“主导”。看起来,一项任务是否计入这 26%,往往取决于如何解释。
此外,还要看这 26% 究竟衡量的是什么。Anthropic 列出了员工在 7 月份如何分配工作时间,并对每项活动进行评分;越耗时的任务权重越高。因此,按照人类投入的工作时数计算,Claude 主导了四分之一的工作。但这并不能说明 Claude 作出了多少项决定,也无法表明它是否对研究方向拥有发言权。
当然,这个数字能从两个方面帮助该公司:既可以作为产品性能的佐证,也可以用来支持 Amodei 关于放慢发展速度的呼吁。任何指责 AI 公司利用安全警告来推动有利于自身监管政策的人,都会从 Anthropic 对“主导”一词的定义中找到新的论据。
对 30,000 个智能体的监管尚处早期
报告称,在 Anthropic 使用最广泛的内部平台上,大约有 30,000 个智能体同时运行。一个实时监控系统会检查每项操作,旨在阻止复制模型权重等行为。在 8 月份超过 10 亿次决策中,该系统拦截了 0.002%。另一个监控系统会在事后每周标记约 100,000 条日志,其中大约 50 条会交由人工审查。Anthropic 承认,这套监控机制仅运行了几个月,尚不确定它能否捕捉到所有行为模式。
在 7 月份抽取的一个样本周内,用于 AI 研究的算力中约有 6% 投向了安全工作。Anthropic 之所以重视这一指标,主要是因为算力是外部人士最容易核查的投入。如果行业同意放慢发展速度,这可能成为一种调控手段,例如各方可以就用于安全研究的算力占比作出自愿承诺。
Anthropic 表示,这一较低的比例并不一定意味着安全工作很少。安全工作主要涉及设计实验,会占用研究人员的时间,但几乎不需要多少芯片算力;相比之下,为新模型进行一次训练则会消耗巨大的算力资源。此外,Anthropic 也没有把那些同时同等程度推动安全性与能力进步的工作计入安全研究。
该公司警告称,安全研究与能力研究之间的界线十分模糊,而且每家厂商都有动机把安全研究的范围划得更宽。Anthropic 认为,举证责任应由开发者承担。
来源与参考
收录于 2026-09-19