Anthropic 推出更便宜更强的 Claude Opus 5
The Decoder··作者 Matthias Bastian
关键信息
Opus 5 保持了 100 万 token 的上下文窗口,并延续与 Opus 4.8 相同的基础定价:输入每百万 token 5 美元、输出每百万 token 25 美元;新的 Fast Mode 速度提升 2.5 倍,但价格翻倍。Anthropic 还提供五档努力级别,并表示较低档位往往更划算,不过在某些基准上,max 档反而可能得分更低,因为它会做出额外且未被要求的代码修改。
资讯摘要
Anthropic 表示,Claude Opus 5 是其新的旗舰模型,并将其定位为 Fable 5 的更便宜替代品,同时在许多领域拥有接近的表现。公司称,这个模型在代理式编程和知识工作等多个评测中领先,而且它在迭代中自我检查、自我改进的能力也更强。Anthropic 报告称,Opus 5 在衡量新颖问题解决能力的 ARC-AGI-3 上得分为 30.2%,并称这一成绩几乎是 GPT-5.6 Sol 的四倍。该模型在 Frontier-Bench v0.1 的代理式终端编程测试中达到 43.3%,在知识工作基准 GDPval-AA v2 上达到 1,861 的 Elo 分,均领先于 Fable 5 和 GPT-5.6 Sol。
与此同时,它并不是所有测试都取胜:在 DeepSWE v1.1 代理式编程测试中,GPT-5.6 Sol 排名第一,而在健康、法律和网络安全相关任务上,Fable 5 与 Mythos 5 也有更好的表现。Anthropic 还表示,它刻意没有用网络安全任务训练 Opus 5,并指出该模型虽然在发现漏洞方面接近 Mythos 5,但在利用漏洞方面要弱得多。Opus 5 保留了 100 万 token 的上下文窗口,也维持了与 Opus 4.8 相同的 token 价格,用户可以在 low、medium、high、xhigh 和 max 五档努力级别之间选择,以平衡质量、成本和延迟。Anthropic 认为较低档位往往更划算,而新的 Fast Mode 则以两倍价格换取 2.5 倍速度提升。

资讯正文
Anthropic 的 Claude Opus 5 以一半的 token 价格,交出了接近 Fable 5 的性能
要点
- Anthropic 将 Claude Opus 5 定位为比 Fable 5 更便宜的替代方案,并称其在多项基准测试中表现更优。
- Opus 5 在代理式编码和知识工作测试中领先。在衡量新颖问题解决能力的 ARC-AGI-3 上,该模型得分为 30.2%,几乎是 GPT-5.6 Sol 的四倍。
- Anthropic 表示,Opus 5 能通过迭代检查并改进自己的工作,并在需要时通过编写代码构建自己的工具。
更新——
- 补充了 Opus 5 在基准测试的最高努力设置下有时得分更低的原因说明。
- 补充了早期独立基准结果。
Anthropic 的新旗舰模型 Claude Opus 5 在编程和知识工作方面取得了最高分,同时以一半的 token 费率接近 Claude Fable 5 的性能。
Anthropic 正在应对来自 GPT-5.6 Sol 和中国竞争对手的定价压力。其新推出的 Opus 5 模型旨在缩小与价格高得多的 Fable 5 之间的性价比差距。Opus 5 将成为 Claude Max 的默认模型,也是 Claude Pro 可用的最强模型。
100 万 token 的上下文窗口和 token 费率保持不变。与其前代 Opus 4.8 一样,Opus 5 的价格为每百万输入 token 5 美元、每百万输出 token 25 美元。新的 Fast Mode 可将速度提升 2.5 倍,但价格会翻倍。
更高的努力程度可能带来更高成本,也可能表现更差
用户可以通过五种努力设置在性能和 token 使用之间进行权衡,这五种设置分别是 low、medium、high、xhigh 和 max。Anthropic 表示,Opus 5 在每个努力级别上的性价比都优于其前代产品。
在其提示指南中,Anthropic 建议广泛使用“low”和“medium”设置。公司表示,这些设置只需消耗一小部分 token 和更低的延迟,就能取得良好结果,同时在同样设置下也优于早期的 Opus 模型。对于编程和代理式任务,Anthropic 仍建议从“xhigh”开始。
尽管成本更高,Opus 5 在最高努力设置下,在两个基准上的得分却略低于第二高设置。这个下降出现在 Frontier-Bench v0.1 和 Artificial Analysis Coding Agent Index 上。
更新:根据 FrontierCode 开发者 Cheng-Yuan Lee 的说法,这种行为是意料之中的。该基准不仅评估正确性,还评估模型是否只对代码做出最少必要的改动。在更高努力级别下,Opus 5 往往会重构周边代码,即便只需要做一个很小的修复。一个例子中,Opus 5 在最低设置下只改了一个字符,而在“xhigh”设置下,它重构了整个周边代码。该基准会将此类未经要求的改动计为错误。
Opus 5 在代理式编码中击败 Fable 5
根据 Anthropic 自己的基准测试,Opus 5 在多项评测中创下纪录。在 Frontier-Bench v0.1 上,该模型在代理式终端编码中拿到 43.3%,大幅领先 Fable 5(33.7%)、GPT-5.6 Sol(34.4%)以及其前代 Opus 4.8(21.1%)。在知识工作基准 GDPval-AA v2 上,Opus 5 以 1,861 的 Elo 分数领先,超过 Fable 5(1,747)和 GPT-5.6 Sol(1,736)。
Opus 5 并非在所有方面都能取胜。在通过 DeepSWE v1.1 进行的代理式编码测试中,GPT-5.6 Sol 以 72.7% 领先,其后是 Fable 5(69.7%)和 Opus 5(68.8%)。在医疗任务和法律基准测试中,Fable 5 和 Mythos 5 分别优于 Opus 5。
在网络安全任务上,Opus 5 落后于 Mythos 5。Anthropic 表示,公司刻意没有用网络安全任务训练 Opus 5,这一点与其前代产品相同。该模型在寻找漏洞方面已接近 Mythos 5,但在被要求利用这些漏洞时表现要差得多。
Anthropic 还表示,Opus 5 在生成视觉输出以及分析图表、示意图等视觉内容方面都有所提升。
Opus 5 在需要工具时会自己构建工具
Anthropic 将 Opus 5 描述为在检查自身工作并通过迭代加以改进方面有了显著提升。在一项 Frontier-Bench 任务中,Opus 5 收到了一张机器零件的图纸,并必须在 FreeCAD 中创建一个 3D 模型。难点在于,该模型被故意设置为无法直接查看这张图纸。Anthropic 说,Opus 5 的做法是编写自己的计算机视觉管线,从原始像素中提取几何信息,然后重建出完整的机器零件。Anthropic 表示,在五次尝试后,没有其他模型解决这项任务。
Opus 5 还参与处理了一个流行开源包管理器中的真实漏洞。根据 Anthropic 的说法,它找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。另一款竞争模型只修复了表面症状,就报告漏洞已解决。
据报道,一家交易公司的工程师曾在一次会话中使用 Opus 5 为一家新交易所搭建市场数据馈送。此前的模型即便有详细方案,也无法完成这项任务。
Opus 5 的网络安全过滤器触发频率低于 Fable 5
根据 Anthropic 的说法,Opus 5 的安全设置允许进行源代码漏洞研究,但会阻止基于二进制文件的漏洞扫描、渗透测试以及漏洞利用生成。其网络安全分类器的触发频率大约比 Fable 5 低 85%。Fable 5 频繁介入曾招致强烈批评。在 Claude.ai、Claude Code 和 Claude Cowork 中,被拦截的请求默认会回退到 Opus 4.8,这与 Fable 5 采用的做法相同。
除了 Opus 5 之外,Anthropic 还发布了两个 beta 功能。Claude Platform 上的 Mid-Conversation Tool Changes 允许开发者在对话过程中切换可用工具,而不会使提示缓存失效。API 上的 Automatic Fallbacks 则会将被拦截的请求自动路由到另一款模型。
AI News Without the Hype – Curated by Humans
订阅 THE DECODER,获取无广告阅读、每周 AI 新闻简报、我们独家的“AI Radar”前沿报告(每年六次)、完整归档访问权限,以及评论区访问权限。
来源与参考
收录于 2026-07-26