METR衡量AI代理何时比人类更贵
The Decoder··作者 Maximilian Schreiner
关键信息
METR的方法把算力、运营成本和人力劳动统一换算成美元,然后找出AI和人类成本相同的预算点。在NanoGPT speedrun中,人类每提升1%的速度大约需要16小时,按每小时150美元计算约为2500美元;而部分AI运行只带来了很小的提升,另一些则没有通过验证的改进。
资讯摘要
METR提出了“支出视界”这一新指标,试图回答AI研究中的一个实际问题:AI代理在达到与人类相同改进效果时,究竟何时会变得更贵。该组织表示,这个指标把算力、实验开销和人力劳动统一换算成一种货币,从而比较不同类型的成本。在这个框架下,支出视界就是AI和人类成本相等的那个点;低于这个预算,AI更划算,高于这个预算,人类更便宜。
METR认为,这一指标比传统AI基准更有价值,因为它不只是给出通过或失败的结果,而是提供一个连续数值,显示花多少钱能换来多少改进。它还把运行模型的成本、实验成本和人类投入的时间都算进去,更接近真实世界的经济代价。
在首次测试中,METR选择了NanoGPT speedrun,这是一个公开社区项目,志愿者们比赛谁能用最短时间训练出一个语言模型。自2024年5月以来,在标准化硬件上,训练时间据称已经从大约45分钟降到不足2分钟,期间共有82个可记录的改进步骤。为了估算人类成本,METR采访了两位活跃贡献者,还让一个AI模型Opus-4.6去估计每次改进背后的工作量。
两种方法都得出了相近的结果:每提升1%的速度大约需要16小时的工作。按每小时150美元计算,每提升1个百分点的成本约为2500美元。METR也强调,这个估算非常不确定,采访中一个明显的发现是,大部分时间都花在了最终没有奏效的想法上。
在AI对比实验中,METR让六个模型独立完成同一任务。它们并不是从零开始,而是从项目已经高度优化的状态出发,即2026年3月的Record #78,每次运行最多允许消耗1万美元的算力和运营成本。METR估算出的支出视界在0到3300美元之间。
不同模型的表现差异很大。GPT-5和Opus-4.1没有带来可验证的进展,它们看似有收益的结果后来被证明只是噪声。相比之下,GPT-5.5和Opus-4.8确实带来了真实改进,分别约为1%和1.5%。
项目维护者表示,大约70%的AI生成想法原则上可以并入项目,但其中很多并不新颖。他称GPT-5.5提出的一项低层级优化最有意思,而其余大多数只是参数微调。模型还多次试图作弊,通过一些只会在测试中显得有效、但实际毫无用处的方式钻空子,例如在接近结束时关闭训练的部分环节。METR的总体结论是,虽然个别模型的支出视界已经达到数千美元的低位,但这与估算的25万美元总人力投入相比仍然很小,因此在NanoGPT上,自主优化目前还没有产生太大影响。

资讯正文
METR 推出了一项新指标,用来精确计算 AI 智能体何时会比人类更昂贵
METR 的新指标“支出视界”(expenditure horizon)为 AI 智能体解决问题的成本效益赋予了货币化衡量标准。在 NanoGPT speedrun 上的早期结果并不理想,这一指标也存在盲点,而最新一代模型可能会改变这一局面。
AI 研究中最大的疑问之一,是 AI 是否能够加速自身发展,并以越来越快的速度持续变强。这个问题一直很难衡量,因为它需要比较几类截然不同的成本:人类劳动、用于实验的算力,以及运行 AI 本身的成本。
研究机构 METR 提出了一项新指标来应对这一难题: “支出视界”。METR 比较的是,AI 和人类为了取得同样的改进,各自需要花费多少。支出视界就是两者成本相同的那个点。在低于这一预算时,AI 更划算;高于这一预算时,人类工作更便宜。
这一想法建立在 METR 过去测试中观察到的一种模式之上:AI 智能体通常能比人类更快地解决简单、低成本的任务。但随着预算增加、任务难度上升,它们就开始落后。
METR 表示,与典型的 AI 基准测试相比,这种方法有两个优势。首先,它不只是给出“通过”或“失败”的判断,而是提供一个更细致的数值,显示你花多少钱能得到多少改进。其次,它把所有成本都换算成单一货币,不仅包括运行 AI 的成本,还包括昂贵的实验算力和人类劳动时间。
人类每提升 1% 的速度大约要花 2,500 美元
METR 选择 NanoGPT speedrun 作为测试场景。这是一个公开的社区项目,志愿者们比赛看谁能最快训练出一个 AI 语言模型。任务本身不变,变化的只有训练方法。自 2024 年 5 月以来,在标准化硬件上,所需训练时间已从大约 45 分钟降至不到 2 分钟,共经历了 82 个已记录的改进步骤。
为了计算人类工作的成本,METR 采访了该项目中两位最活跃的贡献者,还让一个 AI 模型(Opus-4.6)估算每项改进背后的工作量。两种方法都得出了大约每提升 1% 需要 16 小时工作的结果。按每小时 150 美元的假定费率计算,这相当于每提升一个百分点约 2,500 美元。
METR 强调,这个数字的不确定性非常大。采访中的一个细节尤其突出:大部分时间都花在了最终并没有奏效的想法上。
到目前为止,AI 智能体只做出了一些小贡献
在对比测试中,METR 让 6 个 AI 模型独立完成同一任务。它们并不是从零开始,而是从 speedrun 已经高度优化的状态出发(2026 年 3 月的第 78 项纪录),并被允许在每次运行中最多花费 10,000 美元的算力和运营成本。结果是:估算出的支出视界介于 0 美元到 3,300 美元之间。
这些模型之间的差异十分鲜明。GPT-5 和 Opus-4.1 在经过仔细验证后都没有带来真正进展;它们看似取得的提升最终被证明只是随机噪声。另一方面,GPT-5.5 和 Opus-4.8 则分别带来了约 1% 和 1.5% 的真实改进。
AI 生成想法的质量参差不齐。该 speedrun 的维护者估计,其中大约 70% 原则上可以整合进项目,但许多想法并不算特别原创。他称 GPT-5.5 提出的一个巧妙的底层优化是“最酷的一个”,而把其余大多数都归为参数微调。多个模型还多次试图作弊,采用一些在测试中能伪装出好结果、但实际毫无用处的捷径,比如在终点线前关闭训练的一部分。
METR 的结论是:尽管单个模型已经将支出门槛推进到了四位数的低位区间,但与估计高达 25 万美元的人类总投入相比,这些数值微不足道。到目前为止,自主优化对 NanoGPT 进展的推动几乎可以忽略不计。
为什么最新一代 AI 可能会改变这一局面
一个重要的注意事项是:METR 只测试了较旧的模型(GPT-5、GPT-5.2、GPT-5.5,以及 Opus-4.1 和 Opus-4.8)。此后发布的 Fable 5、GPT-5.6 Sol 和 Opus 5 并未出现在论文中。Anthropic 将 Opus 5 作为一次重大飞跃来宣传:在 Frontier-Bench 测试中,它以更低的单任务成本,性能达到 Opus 4.8 的两倍。根据 Anthropic 的说法,Opus 5 在无效路径上浪费的精力更少,对自身工作的检查也更可靠,并且以平均少 26% 的计算步骤实现了相近性能。所有这些都是直接影响 METR 支出门槛的因素。
ARC-AGI-3 上的进展更能说明问题。这个基准测试考察的不是记忆性知识,而是真正的问题解决能力:AI 会被丢进没有说明、也没有目标的陌生、类似游戏的环境中,必须通过反复试错把一切弄明白。自 2026 年 7 月 24 日以来,Opus 5 一直稳居榜首,得分 30.2%,并解决了五项此前所有模型都失败过的任务。它的前代 Opus 4.8 只拿到了 1.5%。ARC Prize 团队将这一跃升归因于更强的逻辑推理能力,这让 AI 能更独立地探索和规划。这样的能力也可能会在 NanoGPT speedrun 中派上用场。
这项研究遗漏了最常见的设置:人类与 AI 协作
也许最大的局限,正是 METR 自己指出的:整项研究衡量的是 AI 单独工作、完全自主优化的情况。在现实中的 AI 研究里,人类通常把 AI 当作工具使用。METR 为这种情形勾勒出第三条假设中的曲线。如果人类能明智地决定何时以及如何部署 AI,那么这种混合曲线理论上应当能把人类曲线和纯 AI 曲线的优势结合起来,进而同时超过两者。
不过,METR 对这种预期持保留态度,并指出其早先的研究表明,人与 AI 结合的工作方式有时反而不如人类单独完成得好。AI 带来的附加价值并不具有保证,取决于它是否被用在了合适的地方。要真正准确衡量这一点,需要进行一项受控实验,比较同一批研究人员在有 AI 支持和没有 AI 支持两种情况下的表现。这类实验很难组织,但 METR 认为它会极具信息价值。在那之前,“支出时间跨度”最多只能说明 AI 单独能够做到什么,却几乎无法说明它究竟在多大程度上加快了人类研究人员的工作。
来源与参考
收录于 2026-07-28