OpenAI称GPT-5.6 Sol在ARC-AGI-3上领先

The Decoder··作者 Matthias Bastian

关键信息

OpenAI 的更高分来自两个通用设置:Retained Reasoning 会在步骤之间保留推理链,Compaction 会用摘要替代直接截断旧上下文。ARC Prize 联合创始人 François Chollet 表示,只要这些设置没有为 ARC-AGI-3 专门定制、且对所有 API 用户开放,就属于公平使用;但他也指出,不同厂商使用不同设置会带来公平性问题,只要配置和成本被清楚披露,这种差异是可以接受的。

资讯摘要

OpenAI 表示,GPT-5.6 Sol 在 ARC-AGI-3 上可以追上 Anthropic 最近的进展。ARC-AGI-3 是一个面向 AI agent 的交互式推理基准,重点考察模型在新环境中的推理和适应能力。根据 OpenAI 的说法,GPT-5.6 Sol 通过 Responses API,并开启 Retained Reasoning 和 Compaction 后,取得了 38.3% 的成绩。这个结果高于 Anthropic 的 Claude Opus 5 在同一基准上的 30.2%。不过,这一对比高度依赖测试方式。OpenAI 也承认,在官方 ARC-AGI-3 测试框架中,GPT-5.6 Sol 只得到 7.8%,因为它在每一步之后都会丢失推理内容。

OpenAI 的观点是,基准测试衡量的不只是模型参数,还包括 API 设置和评测框架等外围技术条件。ARC Prize 回应称,官方成绩采用标准化流程,是为了保持比较公平,但也提出一个可能性:如果他们先前使用的是较旧的 completions 风格 API,那么 OpenAI 可能确实处于不利位置。随后,ARC Prize 联合创始人 François Chollet 进一步澄清,专门为某个基准定制的 harness,或包含对基准格式的特殊知识,都是不允许的;而对所有 API 用户都可用、并非为 ARC-AGI-3 开发的通用设置,则属于公平范围。他还表示,ARC Prize 与 OpenAI 围绕模型测试,尤其是 compaction,已经进行了多次讨论,并欢迎 OpenAI 开始找到解决方案。不过,他也指出,不同供应商使用不同设置会带来一定的公平性问题,只要这些设置和成本被明确报告,这种做法是可以接受的。

OpenAI称GPT-5.6 Sol在ARC-AGI-3上领先

资讯正文

OpenAI声称,GPT-5.6 Sol凭借其最新的API和另外两项设置,在ARC-AGI-3上击败了Opus 5

更新——

- 新增 ARC Prize 声明

更新:

ARC Prize 联合创始人 François Chollet 在回应 OpenAI 的结果时,将两类测试设置区分开来。他说,专门“为解决基准测试而定制,或包含关于基准格式知识”的 harness 不允许使用。通用的 API 设置“并非为 ARC-AGI-3 开发,且对所有 API 用户开放”则可以使用。实际上,Chollet 等于承认,ARC Prize 自己给出的 GPT-5.6 Sol 分数让 OpenAI 处于了不利地位。

他指出,ARC Prize 与 OpenAI 之间“就如何最好地测试他们的模型进行了大量来回沟通,尤其是关于 compaction”,并对该公司“开始弄清答案”表示欢迎。Chollet 说,不同提供商使用不同设置确实会带来“潜在的公平性问题”,但只要“设置和成本都被清楚地报告”,他认为这是可以接受的。

原文:

OpenAI 表示,它在 ARC-AGI-3 上能够跟上进度。在 Anthropic 的 Claude Opus 5 将这项逻辑基准测试的纪录分数翻了四倍之后,OpenAI 现在展示称,GPT-5.6 Sol 通过两项 API 设置拿下了 38.3% 的成绩,超过了 Opus 5 的 30.2%。

不过,OpenAI 并没有使用官方测试环境。相反,它是通过自家的 Responses API 运行 GPT-5.6 Sol,并使用“Retained Reasoning”,该功能会在步骤之间保留模型的思维链;同时还使用“Compaction”,它会对旧上下文进行总结,而不是直接截断。在官方 harness 中,GPT-5.6 Sol 只得到了 7.8%,因为模型的推理会在每次操作后被丢弃。

OpenAI 认为,基准测试衡量的从来不只是模型本身,还包括其周边的技术设置。这话没错,而 ARC-AGI-3 的设计目标就是测试纯粹的模型表现。ARC Prize 在回应 OpenAI 的结果时表示,官方 ARC 分数使用的是标准化方法,不包含任何特定于厂商的设置,以确保公平比较。争议点在于,ARC Prize 是否使用了一个更早期的“OpenAI 风格 completions API”,而该 API 缺少 Claude API 已经提供的功能;如果是这样,那么这种比较对 OpenAI 就不公平。

来源与参考

  1. 原始链接
  2. OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings

收录于 2026-07-31