OpenAI称GPT-5.6 Sol在ARC-AGI-3上击败Opus 5
The Decoder··作者 Matthias Bastian
关键信息
OpenAI 的说法依赖于通用 API 功能:一个是在步骤之间保留推理上下文,另一个是用压缩方式处理旧上下文而不是直接丢弃。ARC Prize 联合创始人 François Chollet 表示,只要这些设置对所有 API 用户开放、并且不是为 ARC-AGI-3 定制的,就可以接受;但他也提醒,如果不同厂商使用的设置和成本没有清楚披露,仍然会存在公平性问题。
资讯摘要
OpenAI 表示,GPT-5.6 Sol 在 ARC-AGI-3 上可以跟上 Anthropic 的 Claude Opus 5,这是一项强调交互式推理能力的基准测试。根据 OpenAI 的说法,GPT-5.6 Sol 通过 Responses API 并启用 Retained Reasoning 和 Compaction 后,得分达到了 38.3%。这个结果高于 Opus 5 的 30.2%。不过,OpenAI 并没有在官方 ARC-AGI-3 测试框架中得到这个分数。在官方环境里,GPT-5.6 Sol 只拿到 7.8%,因为它在每一步操作后都会丢失推理上下文。
OpenAI 认为,基准测试衡量的不只是模型本身,也包括外围的技术设置。ARC Prize 则回应说,他们的官方分数使用标准化框架,目的就是保证不同厂商之间的比较公平。争议焦点在于,ARC Prize 之前是否使用了较旧的 completions 风格 API,而这种 API 可能缺少 Claude API 已经具备的一些功能,这会让对 OpenAI 的比较显得不对称。随后,François Chollet 进一步表示,专门为某个基准定制的框架或包含基准知识的设置不应被使用,但所有 API 用户都能使用的通用设置是公平的。他还说,ARC Prize 过去已经和 OpenAI 就 compaction 进行过多次讨论,并欢迎他们逐步找到正确答案;只要设置和成本披露清楚,即使存在一定的 parity 问题,他也认为可以接受。

资讯正文
OpenAI声称,GPT-5.6 Sol凭借其最新的API和另外两项设置,在ARC-AGI-3上击败了Opus 5
更新——
- 新增 ARC Prize 声明
更新:
ARC Prize 联合创始人 François Chollet 在回应 OpenAI 的结果时,将两类测试设置区分开来。他说,专门“为解决基准测试而定制,或包含关于基准格式知识”的 harness 不允许使用。通用的 API 设置“并非为 ARC-AGI-3 开发,且对所有 API 用户开放”则可以使用。实际上,Chollet 等于承认,ARC Prize 自己给出的 GPT-5.6 Sol 分数让 OpenAI 处于了不利地位。
他指出,ARC Prize 与 OpenAI 之间“就如何最好地测试他们的模型进行了大量来回沟通,尤其是关于 compaction”,并对该公司“开始弄清答案”表示欢迎。Chollet 说,不同提供商使用不同设置确实会带来“潜在的公平性问题”,但只要“设置和成本都被清楚地报告”,他认为这是可以接受的。
原文:
OpenAI 表示,它在 ARC-AGI-3 上能够跟上进度。在 Anthropic 的 Claude Opus 5 将这项逻辑基准测试的纪录分数翻了四倍之后,OpenAI 现在展示称,GPT-5.6 Sol 通过两项 API 设置拿下了 38.3% 的成绩,超过了 Opus 5 的 30.2%。
不过,OpenAI 并没有使用官方测试环境。相反,它是通过自家的 Responses API 运行 GPT-5.6 Sol,并使用“Retained Reasoning”,该功能会在步骤之间保留模型的思维链;同时还使用“Compaction”,它会对旧上下文进行总结,而不是直接截断。在官方 harness 中,GPT-5.6 Sol 只得到了 7.8%,因为模型的推理会在每次操作后被丢弃。
OpenAI 认为,基准测试衡量的从来不只是模型本身,还包括其周边的技术设置。这话没错,而 ARC-AGI-3 的设计目标就是测试纯粹的模型表现。ARC Prize 在回应 OpenAI 的结果时表示,官方 ARC 分数使用的是标准化方法,不包含任何特定于厂商的设置,以确保公平比较。争议点在于,ARC Prize 是否使用了一个更早期的“OpenAI 风格 completions API”,而该 API 缺少 Claude API 已经提供的功能;如果是这样,那么这种比较对 OpenAI 就不公平。
来源与参考