Artificial Analysis 因 Astra 争议修订智能指数

The Decoder··作者 Matthias Bastian

关键信息

Artificial Analysis 表示,Astra 在每个任务上的用 token 数比指数中其他所有前沿模型都少,而在性价比方面,Anthropic、OpenAI、Meta 和智谱 AI 目前并列领先。此次修订新增了 AA-Briefcase 和 Surge AI 的 GDP.pdf,因模型已“解题”而移除 GPQA-Diamond,将私有测试数据权重提高到 40%,并修正了多个评分和分级问题以获得更稳定的结果。

资讯摘要

Artificial Analysis 将其 Intelligence Index 更新到了 4.2 版,背景是外界质疑此前的评分体系没有真实反映 GPT-6 Astra 的进展。争议的原因在于,其他评测给 Astra 的位置明显更高:OpenAI 自己的结果据称把它放在明显领先的位置,Epoch AI 在 267 个模型中将其排第一,并给出 169 分、覆盖 50 多项基准,而 ARC-AGI-3 则因使用不同 harness 得出了从“显著提升”到“非常显著提升”的不同结果。相比之下,Artificial Analysis 早先只把 Astra 评到与其前代大致持平。新版指数中,Astra 相比前代高出 4 分,排名升到第二,仅次于 Anthropic 的 Claude Fable 5.1,领先于 Meta。Artificial Analysis 还表示,Astra 在该指数中的每个任务 token 使用量少于其他所有前沿模型。

按性价比指标来看,Anthropic、OpenAI、Meta 和智谱 AI 目前并列领先。新版本加入了用于真实知识工作的 AA-Briefcase,以及来自 Surge AI 的 GDP.pdf 文档分析基准;由于模型已经“解出”该题,GPQA-Diamond 被移除。与此同时,私有测试数据的权重提高到 40%,以增强抗刷分能力。该公司还修正了多个评分错误并调整了分级系统,以获得更稳定的结果,并表示更大的 5.0 版本已开发 8 个月,将分阶段推出。

Artificial Analysis 因 Astra 争议修订智能指数

资讯正文

在 GPT-6 Astra 的评分引发质疑后,Artificial Analysis 对其 Intelligence Index 进行了大幅调整。

Artificial Analysis 发布了其 Intelligence Index 的 4.2 版,这很可能是为了回应外界批评,认为其基准测试未能反映 GPT-6 Astra 的真实进展。

此前,包括 OpenAI 自身在内的多项评测都将 Astra 置于明显领先位置。Epoch AI 在 267 个模型中将其排在第一,在超过 50 项基准测试中拿到 169 分;而 ARC-AGI-3 则显示出从大幅到非常大幅的提升,具体取决于所使用的测试框架。Artificial Analysis 给予 Astra 的评分仅与其前代产品持平。

随着更新后的指数发布,GPT-6 Astra 现在较其前代产品高出 4 分。Anthropic 的 Claude Fable 5.1 仍位居榜首,Astra 紧随其后排名第二,Meta 位列第三。根据 Artificial Analysis 的数据,Astra 在每项任务中使用的 token 数也少于所有其他前沿模型。在性价比方面,Anthropic、OpenAI、Meta 和 Zhipu AI 并列领先。

该指数新增了两项基准测试:用于现实世界知识工作场景的 AA-Briefcase,以及来自 Surge AI、用于 PDF 文档分析的 GDP.pdf。GPQA-Diamond 已被移除,因为模型已经能够解决它。为了更难被“刷分”,私有测试数据现在占权重的 40%。Artificial Analysis 还修正了多个基准测试中的评分错误,并调整了其评分系统,以获得更稳定的结果。

Artificial Analysis 表示,它一直推迟更新,以便在重大模型发布期间保持分数稳定,但排行榜顶部变化太快,因此有必要进行一次临时更新。它称,Version 5 已经开发了 8 个月,并将分阶段推出。

来源与参考

  1. 原始链接
  2. Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism

收录于 2026-09-06