Claude Opus 5 领先 ARC-AGI-3
The Decoder··作者 Matthias Bastian
关键信息
ARC Prize 认为,Opus 5 的领先很可能来自更强的逻辑推理能力,这种能力有助于在陌生环境中进行更自主的探索、规划和执行。该基准只计算模型自身的表现,不包括外部 harness,ARC Prize 还表示,如果放在 Claude Code 中,Opus 5 的分数可能会更高。
资讯摘要
Anthropic 的 Claude Opus 5 现在成为 ARC-AGI-3 的新榜首。ARC-AGI-3 是一个用来衡量 AI 是否能处理全新交互式任务的基准,强调的是在陌生环境中的探索、规划和执行能力。根据 ARC Prize 团队的数据,Opus 5 得分为 30.2%,几乎是 OpenAI 之前由 GPT-5.6 Sol(Max)保持的 7.8% 纪录的四倍。该模型还解出了 5 个此前从未被解决的环境,其中 4 个解法达到了人类水平或更高。ARC Prize 认为,这一结果反映的是更强的逻辑推理能力,而不只是更会迎合基准测试。
测试过程中,Opus 5 还表现出研究人员以前没有在 AI 模型上见过的行为,例如把任务转写成代数记号,并且独立构造反思方程。公开演示集的 25 个环境中,目前已经有 6 个被解出,而且完整结果、回放和代码都已公开。文章还提到,在更早的 ARC-AGI-2 上,Opus 5 得分为 90.4%,在 ARC-AGI-1 上为 97.5%,这两个结果都与此前的最高分持平,但成本略高。另一个重要背景是,一些系统可能借助了外部的 harness 才能通过基准,而官方成绩只计算模型自身表现;ARC Prize 还表示,如果把 Opus 5 放进 Claude Code,它的分数可能还会更高。

资讯正文
Anthropic 的 Opus 5 在衡量真实智能的基准上,轻松超越 Fable 5 和 GPT-5.6 Sol
要点
- Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上获得了 30.2% 的成绩,几乎是 OpenAI 的 GPT-5.6 Sol(Max)此前 7.8% 纪录的四倍。
- ARC Prize 团队认为,这一领先优势源于真正更强的逻辑推理能力,从而能在陌生环境中进行更自主的探索和规划。
- 在测试中,Opus 5 展现出此前未曾在 AI 模型上见过的行为,包括将任务转换为代数符号,并独立构建反思方程,同时还解决了五个此前未解的环境。
ARC-AGI 基准的创造者表示,Anthropic 的 Claude Opus 5 在 ARC-AGI-3 上取得如此巨大领先,归功于其确实更强的推理能力。
该模型在 ARC-AGI-3 上得分 30.2%,成为新的第一名。此前纪录为 7.8%,由 OpenAI 的 GPT-5.6 Sol(Max)保持。Opus 5 解决了五个此前未解的环境,其中四个达到了人类水平或更高。这也让它领先于 Anthropic 的“Fable 级”模型;据 ARC Prize 介绍,这些模型的成绩大约在 20% 左右。
ARC Prize 的分析认为,这一领先来自更强的逻辑推理,“这使其能够在陌生环境中进行更自主的探索、规划和执行。”在测试期间,Opus 5 还表现出研究人员此前从未在模型上见过的行为。它首次将任务转换为代数符号,并独立构建出反思方程。
目前,25 个公开演示环境中已有 6 个被解决。完整结果、回放以及基准测试代码均已公开。在更早的 ARC-AGI-2 基准上,Opus 5 得分为 90.4%,在 ARC-AGI-1 上则达到 97.5%。据 ARC Prize 称,这两项结果都追平了此前的最高分,不过成本略高。
ARC-AGI-3 衡量的是 AI 模型解决训练过程中未接触过的新任务的能力,包括那些人类通常可以轻松完成的任务。当前版本的运行方式类似一款游戏。模型必须推断交互式环境的规则,规划自身动作,并一步一步执行。这测试的是通用推理能力,而非存储知识。
一些 AI 系统或许已经通过了这一基准,但它们依赖一种称为 harness 的额外软件。官方分数只计算语言模型自身的表现。ARC Prize 认为,未来的 AGI 系统在解决新任务时不应需要外部帮助。如果在 Claude Code 中使用,Opus 5 的得分很可能会更高。
独立测试显示,实际提升可能更有限
Anthropic 并未解释这一提升,但有针对性的数据标注和强化学习是合理的因素。与更早的模型不同,Opus 5 是在 ARC-AGI-3 发布且其格式公开之后才开发出来的。这或许让 Anthropic 能够针对该基准的技能和谜题格式进行优化,尽管这并不能说明公司对这些具体任务进行了训练。标注人员可能对来自相似谜题的推理轨迹、有效行动、失败尝试以及恢复步骤进行了标注。随后,强化学习可以对探索、规划、发现规则和自我纠错给予奖励。
ARC-AGI-3 背后的一位研究者 Greg Kamradt 表示,这些结果并不能排除更广泛的推理能力提升。传统的谜题未必能测试新颖性,因为它使用的是熟悉的机制,而在某个不寻常游戏上的较弱表现,也可能只是一次孤立的回退。Kamradt 指出,尽管总体上 Opus 4.8 明显落后于 Opus 5,但它在一些 ARC-AGI-3 游戏上的表现也优于 Opus 5。由于 Opus 5 在整个 Witness 基准上都有提升,要判断这种增益究竟有多广泛,还需要来自更多不熟悉任务的详细结果。
Ning 后来澄清说,Opus 5 确实在 Witness 上表现出更广泛的提升,只是幅度远小于在 ARC-AGI-3 上的提升。他将这一模式与编码基准的发展演变相类比。作为交互式推理的一个重要目标,ARC-AGI-3 很可能会最先获得最多的训练投入。随着研究人员加入更多边缘案例,模型可能会学会处理更广泛的抽象推理任务。Ning 说,编码也走过类似路径:从 HumanEval 这类已经饱和的基准,到频繁更新的竞赛,再到当今的编程代理。
来源与参考
收录于 2026-07-27