GPT-6 Astra基准分歧,AGI时间表提前
The Decoder··作者 Maximilian Schreiner
关键信息
Epoch AI 表示 GPT-6 Astra 在 50 多项基准上以 169 分领先,而 Artificial Analysis 只给它 61 分,认为它与前代持平并落后于 Claude Fable 5.1。文章还指出,Astra 在部分编码任务上由于使用更少的计算步数而更便宜,但按处理文本单价计算,它整体上仍比前代贵约 75%。
资讯摘要
文章称,OpenAI 的 GPT-6 Astra 在不同独立评测机构那里得到了互相矛盾的结果。Epoch AI 汇总了 50 多项基准,把 Astra 排在第一位,得分为 169 分;而 Artificial Analysis 只给它 61 分,认为它与前代持平,并落后于 Claude Fable 5.1。不同任务上的表现也不一致:Astra 在数学、知识和谜题方面看起来更强,但在大多数编码测试上,Fable 5.1 领先。根据 Artificial Analysis 的 Coding Agent Index,Astra 得到 67 分,同时只用了 Sol 大约三分之一的 token,但 Fable 5.1 仍以 70 分领先。模型还呈现出一些混合信号,比如在 AA-Omniscience 上幻觉率下降,但在 GDPval-AA v2、银行客服、SciCode 和长上下文推理任务上出现退步。
Epoch AI 还表示,Astra 在 FrontierMath Erdős 子集上用 Lean 可验证证明解出了 68 个公开 Erdős 问题中的 2 个,每次尝试预算约为 300 美元;另外还有几次非标准额外运行解出了更多题目,但没有计入正式评分。最引人注目的进展来自 ARC-AGI-3:在 OpenAI 自己的 harness 下,Astra 报告达到 99.9%,而 ARC Prize 的测量显示,与其内部 harness 相比,Astra 在 167 对匹配的游戏推理样本上运行速度快了 3.66 倍,token 使用量减少了 49%。ARC Prize 还提到,之前 GPT-5.6 Sol 的对比中,vendor harness 的使用方式就曾引发争议,因此目前只有内部 harness 上的 62.7% 被视为更公平的跨厂商比较。文章最后指出一个反常现象:在 ARC-AGI-3 上,提高推理强度反而会降低成本,因为 Astra 能用更少的步数解题,成本从不启用推理时的 49,791 美元降到最高推理时的 26,098 美元,而得分则从 35.2% 提升到 62.7%。

资讯正文
关于 GPT-6 Astra 的各项基准测试结论并不一致,但它在 ARC-AGI-3 上超越人类的效率,让 Chollet 对 AGI 的预测提前了。
OpenAI 的 GPT-6 Astra 收到了相互矛盾的基准评测结果。Epoch AI 将它排在前列,而 Artificial Analysis 则认为它并不比前代产品更强。最大的惊喜来自 ARC-AGI-3,在那里 Astra 首次以比平均人类更高的效率完成任务。ARC Prize 负责人 François Chollet 称这一进展比他预期的“快了 2 倍”,并将自己的 AGI 预测时间提前了。
两个独立实验室都把数十项单独测试合并为一个总分,但得出的结论却截然相反。Epoch AI 汇总了 50 多项基准测试,将 GPT-6 Astra 明确排在第一,得分为 169 分,领先于 267 个模型。Artificial Analysis 则测试知识、编码和文本理解能力,给 GPT-6 Astra 打出 61 分,与其前代完全持平,并落后于 Claude Fable 5.1 的 66 分。
Astra 显然比自己的前代更贵。OpenAI 按处理文本单位收取的费用高出 2.5 倍,这意味着完成同一任务的成本大约比使用 Sol 时高出 75%。但与 Anthropic 相比,情况又反了过来。根据 Artificial Analysis,在编码任务上,Astra 与 Claude Fable 5 的得分相同,但每项任务的成本不到后者一半。原因在于该模型更加节省:它只需要 Sol 所用计算步骤的三分之一,以及 Opus 5 的五分之一。
* GPT-6 Astra 处于 xhigh reasoning effort;在 max 设置下可达到 97.5%。ARC-AGI-1 目前被认为在很大程度上已经饱和。
在 Coding Agent Index 上,它在大约消耗 Sol 三分之一 token 的情况下拿到 67 分,而 Fable 5.1 以 70 分领先。AA-Omniscience 的幻觉率从 92% 降至 51%。与此同时,该模型在 GDPval-AA v2 上失去约 80 个 Elo 点,并在银行支持、SciCode 和长上下文推理任务上出现下滑。
Epoch AI 报告称,在新的 FrontierMath Erdős 测试中,GPT-6 Astra 是唯一一个在每次尝试 300 美元预算内,使用 Lean 认证证明解决 68 个开放 Erdős 问题中的 2 个的模型。还有 3 个解答来自非标准化的额外运行,这些运行消耗了超过 22 万美元的算力,但 Epoch 表示这些不计入该分数。
更仔细看 Epoch 的单项数据可以发现,到目前为止,GPT-6 Astra 和竞争对手 Fable 5.1 一直是在不同的测试条件下被衡量的。Astra 在数学、知识和谜题方面领先。Fable 5.1 则在几乎所有编码测试中都占据最高分。但 Epoch 迄今为止只记录了 Astra 的一个编码分数,而且那还是在中等推理等级的一次运行中得到的。
ARC-AGI-3 显示出大幅跃升
OpenAI 报告的 99.9% 是在不同条件下得到的。在那一设置中,Astra 可以使用 OpenAI 构建的 harness,该 harness 会在单次请求之间保留推理链,并自动总结长流程。按照 ARC Prize 的测量标准,与双方都解出的 167 组游戏推理配对相比,这些运行大约快了 3.66 倍,使用的 token 少了 49%。
这些 harness 的使用,以及随之而来的性能提升,早在 GPT-5.6 Sol 时代就已经是 ARC Prize 与 OpenAI 之间的一个争议点。ARC Prize 指出,只有在内部 ARC harness 上跑出的较低数值 62.7%,才能让不同供应商之间进行公平比较,不过它也计划未来同样发布供应商各自 harness 的结果。
在这里,更多思考反而降低了账单
思考力度与成本之间的关系很不寻常。通常,更高的推理等级会让一次测试运行更昂贵。到了 Astra,这种关系却相反。在标准 ARC scaffold 上,不进行推理时成本为 49,791 美元,而在最高推理等级下则降至 26,098 美元;与此同时,得分则从 35.2% 上升到 62.7%。ARC Prize 认为,原因在于 Astra 用更少的步数就能解出这些游戏,这意味着更少的模型调用和更少的 token。还有一个奇怪之处:在“low”等级下,它的得分只有 17.5%,甚至比完全不进行推理还差。ARC Prize 没有对这一离群值发表评论,不过 GPT-6 Astra 在其他基准测试中显示,它凭借新架构能够在不进行推理的情况下解决更长时程的任务,推测其内部会先循环处理,再生成第一个 token。
作为对比,人类测试者每个 90 分钟时段获得 115 美元,外加每解决一个游戏 5 美元,因此按大约 9 次尝试来算,每个游戏约合 12.78 美元。不过这主要是在为时间和参与意愿付费。如果只计算大脑的代谢能量,而把它当作电力来衡量,ARC Prize 得出的数字是每个游戏 0.067 美分。
比原始分数更有意思的是效率。在发布之前,ARC Prize 让大约 500 名测试者在没有预筛选的情况下参与,并且针对每个难度等级记录了所有解题者所用步数的中位数。在使用 OpenAI scaffold 的这次运行中,Astra 以更少步数完成了 96% 的关卡,平均只用了这个中位数略微超过一半的步数。与常见的成本指标不同,这个数字并不追踪消耗了多少算力,而是追踪模型在真正掌握某个环境之前,需要积累多少与该环境相关的经验。
这正是组织者原本预期人类会保持长期优势的地方。对于蛮力式方法,这一点仍然成立;但对于顶级模型,ARC Prize 看到的则是一种近乎二元的模式。一旦模型摸清了机制,它的执行效率就会落在人类的范围内。
Astra 会自己发明记号
为了做到这一点,Astra 会自己做笔记,并推导出一种自创的、类似代数的简写,用来记录对象、坐标、规则和待定计划,例如将 extend8 to3; retract10 to2 作为一串有序动作,或者将 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 在其他模型上也看到了类似行为,但特别指出 Astra 在精确性和信息密度方面尤为突出。在标准 harness 上,这是一项重要技能,因为模型没有保存到自己可见笔记里的任何内容,都会丢失。
ARC 联合创始人 François Chollet 在 X 上将其描述为“针对每个游戏和每一关进行高度高效、即时的符号世界建模”。这种模型甚至会“开发出自己的一套简写 DSL 来表示游戏中的情境”,其本质上“基本就是一种游戏专用的代数记号系统”。对 Chollet 来说,最重要的是这种行为从何而来:“Astra 展现出我们此前只在复杂的外部工具系统中见过的符号建模行为,因此,这些工具系统的能力正越来越多地转移到模型本身之中。”
Astra 创建了一个密集、紧凑的符号世界模型,以完成 ARC-AGI-3 环境中的任务。
例如,在环境 s5i5 中,Astra:
- 记录了当前关卡、枢纽朝向和机关长度:“L8: hub q2 (8↓). Lengths: 14=1…”
- 将操作映射到精确控制:… pic.twitter.com/tMHP002mkB
— ARC Prize (@arcprize) 2026年9月3日
第三个测试环境展示了 Astra 借助外部工具时的能力。PRO-LONG 是一个由第三方开发的智能体框架,ARC Prize 团队在早期将其部署为 ARC-AGI-3 的红队测试伙伴——也就是系统性地探查这一基准测试的边界。与标准设置不同的是,模型获得了一个可以执行自己代码的沙箱环境。
Astra 充分利用了这一点,并为每个游戏编写了小型程序库:包括游戏棋盘解析器、状态模型、搜索算法和规划器。在一个带守卫的迷宫游戏中,系统先后开发出路径规划器、战斗规则模块、巡逻行动模型,以及一个持续将自身预测与观察结果进行比对的脚本。ARC Prize 没有观察到任何试图逃离沙箱的行为。这些运行结果无法与人类测试条件直接比较,因为受试者既没有代码解释器,也没有记事本。这里衡量的是模型与其自建工具结合后的整体表现。
Chollet:这还不能证明 AGI,但速度比预期更快
ARC Prize 明确表示,并不将这些结果解读为通用人工智能的证据。Chollet 写道:“到目前为止,我们对这个系统所知的一切,只有它在基准测试中的得分。”在 ARC-AGI-3 发布时,他们在每场演讲中都强调一点:“解出来并不等于证明了 AGI。它也并非被设计成终点线。”虽然该基准测试确实检验了 AGI 系统预期应具备的正确定性特征——即在不确定性下探索、在没有指导的情况下适应,以及从稀疏数据中进行因果世界建模——但它是在“很小的尺度上”完成这些测试的。游戏运行的时间尺度比现实世界任务短了几个数量级,因此所需数据更少、建模复杂度更低、即时学习也更少。
当 ARC-AGI-3 大约六个月前发布时,Chollet 在被问及何时会达到饱和时回答说:“大约一年”,这取决于针对该基准的推进方式有多聚焦。因此,Astra 的到来“比预期快了大约两倍”。“我相信,进步的速度会让很多人感到惊讶,而新模型所能做到的事情会挑战人们基于早期几代模型所形成的对 AI 的认知。”当有用户问他先前设定的 2030 年 AGI 预测是否仍然成立时,Chollet 简洁地回答:“会更早,因为进展比我预期的更快。”
结果又多了一个基准。Chollet 表示,自 ARC-AGI-3 发布以来,ARC-AGI-4 一直在开发中,计划于 2027 年第一季度发布。基准测试是一个持续进行的过程,会随着模型的发展而演进,并始终瞄准 AI 与人类智能之间剩余的差距。该组织认为 ARC-AGI-3 本身相当有限:它是确定性的机制、封闭式目标,且没有对开放现实世界的表征。下一代旨在探索的内容包括递归自我改进和开放式创新。
来源与参考
收录于 2026-09-05