Claude Opus 5 以更低成本对标 Fable 5

The Decoder··作者 Matthias Bastian

关键信息

Anthropic 保持了 100 万 token 的上下文窗口不变,定价也维持在每百万输入 token 5 美元、每百万输出 token 25 美元,同时新增了 Fast Mode,速度提升 2.5 倍但价格翻倍。公司还表示,Opus 5 支持五档 effort 设置,并且能够通过迭代检查自己的工作,必要时甚至会自己生成代码工具。

资讯摘要

Anthropic 发布了 Claude Opus 5,并将其定位为一款更便宜、能力更强的旗舰模型,目标是对标 Fable 5。公司表示,这一模型在编程和知识工作任务上的表现明显提升,同时在总体价格性能比上缩小了与更昂贵竞品之间的差距。Anthropic 还把这次发布视为对 GPT-5.6 Sol 以及中国竞争对手带来的定价压力的回应。Opus 5 现在成为 Claude Max 的默认模型,也是 Claude Pro 中最强的可用模型。该模型仍然保留 100 万 token 的上下文窗口,基础价格也没有变化,仍是每百万输入 token 5 美元、每百万输出 token 25 美元。Anthropic 另外提供了 Fast Mode,速度可提升 2.5 倍,但价格会翻倍。公司强调,token 单价并不能完整反映真实成本,因为在实际任务中,更强模型可能会因为 token 使用效率不同而产生不同的总费用。

Opus 5 支持五档 effort 设置,Anthropic 说 low 和 medium 往往就能以更少延迟和更少 token 获得很好的结果,而在编程和代理式任务中仍建议从 xhigh 开始。根据 Anthropic 自己的基准,Opus 5 在 Frontier-Bench v0.1 的代理式终端编程和 GDPval-AA v2 的知识工作任务上都取得领先,并在 ARC-AGI-3 上拿到 30.2% 的成绩。与此同时,它并不是所有项目都最强:在 DeepSWE v1.1 上 GPT-5.6 Sol 更好,而在部分医疗、法律和网络安全任务上,Fable 5 或 Mythos 5 也领先于它。Anthropic 还表示,Opus 5 并未针对网络安全任务进行训练,这与上一代模型一致,而且它更擅长发现漏洞,而不是利用漏洞。公司同时称,Opus 5 在生成视觉输出以及分析图表、示意图等视觉内容方面也有所提升。文章举了一个例子:在 FreeCAD 任务中,模型面对一张不能直接查看的机械零件图时,自己编写了计算机视觉管线,从原始像素中提取几何信息并重建了完整零件。

Claude Opus 5 以更低成本对标 Fable 5

资讯正文

Anthropic 声称,其新款 Claude Opus 5 以一半的 token 价格,提供接近 Fable 5 的性能

要点

- Anthropic 正在将 Claude Opus 5 定位为 Fable 5 的更便宜替代品,并且在多项基准测试中超越后者。

- Opus 5 在智能体编码和知识工作测试中领先。在衡量新颖问题解决能力的 ARC-AGI-3 上,该模型得分为 30.2%,几乎是 GPT-5.6 Sol 的四倍。

- Anthropic 表示,Opus 5 能通过迭代检查并改进自己的工作,并在需要时通过代码构建自己的工具。

Anthropic 的新旗舰模型 Claude Opus 5 在编码和知识工作方面拿下顶级分数,同时以一半的 token 费率逼近 Claude Fable 5 的性能。

Anthropic 正在回应来自 GPT-5.6 Sol 和中国竞争对手的定价压力。其新的 Opus 5 模型旨在缩小与昂贵得多的 Fable 5 之间的性价比差距。Opus 5 现已成为 Claude Max 的默认模型,也是 Claude Pro 上可用的最强模型。

100 万 token 的上下文窗口和 token 费率保持不变。与前代 Opus 4.8 一样,Opus 5 的价格为每百万输入 token 5 美元、每百万输出 token 25 美元。新的 Fast Mode 可将速度提升 2.5 倍,但价格也会翻倍。

但如果不考虑 token 效率,token 费率并不能说明全部情况。Opus 4.7 的单任务成本最终比 Opus 4.6 高出 30% 到 40%,尽管这两个模型的基础费率相同。最近 Claude Sonnet 5 也出现了类似模式。

更高的投入可能带来更高成本,甚至更差表现

用户可以通过五档投入设置在性能与 token 消耗之间进行权衡,这五档分别是 low、medium、high、xhigh 和 max。Anthropic 表示,Opus 5 在每个投入级别上都比前代更具性价比。

在其提示指南中,Anthropic 建议广泛使用“low”和“medium”设置。公司表示,这些设置只需消耗一小部分 token 和更低的延迟,就能取得不错的结果,而且优于以往 Opus 模型的相同设置。对于编码和智能体任务,Anthropic 仍建议从“xhigh”开始。

在最高投入档位下,Opus 5 在两个基准上的表现略差于倒数第二高档位,尽管成本更高。下滑出现在 Frontier-Bench v0.1 和 Artificial Analysis Coding Agent Index 上。

Opus 5 在智能体编码中击败 Fable 5

根据 Anthropic 自家的基准,Opus 5 在多项评估中都创下纪录。在 Frontier-Bench v0.1 上,该模型在智能体终端编码中达到 43.3%,大幅领先 Fable 5(33.7%)、GPT-5.6 Sol(34.4%)以及其前代 Opus 4.8(21.1%)。在知识工作基准 GDPval-AA v2 上,Opus 5 以 1,861 的 Elo 分数领先,超过 Fable 5(1,747)和 GPT-5.6 Sol(1,736)。

Opus 5 并非在所有方面都能取胜。在通过 DeepSWE v1.1 进行的智能体编码测试中,GPT-5.6 Sol 以 72.7% 领先,其次是 Fable 5(69.7%)和 Opus 5(68.8%)。在医疗任务和法律基准上,分别是 Fable 5 和 Mythos 5 的表现优于 Opus 5。

Opus 5 在网络安全任务上落后于 Mythos 5。Anthropic 表示,它是有意没有让 Opus 5 接受网络安全任务训练的,其前代产品也是如此。该模型在发现漏洞方面接近 Mythos 5,但在被要求利用这些漏洞时表现要差得多。

Anthropic 还表示,Opus 5 在生成视觉输出以及分析图表、示意图等视觉内容方面都有所提升。

Opus 5 需要工具时会自己构建

Anthropic 将 Opus 5 描述为在检查自身工作并通过迭代改进方面强得多。在一项 Frontier-Bench 任务中,Opus 5 收到了一张机器零件的图纸,需要在 FreeCAD 中创建一个 3D 模型。难点在于,该模型被故意设置为无法直接查看图纸。Anthropic 称,Opus 5 的做法是先编写自己的计算机视觉流程,从原始像素中提取几何信息,然后重建出完整的机器零件。Anthropic 表示,经过五次尝试后,没有其他模型解决了这项任务。

Opus 5 还参与修复了一个广受欢迎的开源软件包管理器中的真实漏洞。根据 Anthropic 的说法,它找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。另一款竞争模型则只修复了表面症状,随后便报告漏洞已解决。

据报道,一家交易公司的工程师曾用 Opus 5 在一次会话中为一家新交易所搭建了市场数据馈送。此前的模型即使有详细计划也无法完成这项任务。

Opus 5 的网络安全过滤器触发频率低于 Fable 5

Anthropic 表示,Opus 5 的安全设置允许进行源代码漏洞研究,但会阻止基于二进制文件的漏洞扫描、渗透测试和利用程序生成。其网络安全分类器的触发频率比 Fable 5 低约 85%。Fable 5 频繁的干预曾招致猛烈批评。在 Claude.ai、Claude Code 和 Claude Cowork 中,被拦截的请求会默认回退到 Opus 4.8,做法与 Fable 5 相同。

除了 Opus 5 之外,Anthropic 还发布了两个测试版功能。Claude 平台上的 Mid-Conversation Tool Changes 允许开发者在对话过程中切换可用工具,而不会使提示缓存失效。API 上的 Automatic Fallbacks 会自动将被拦截的请求路由到另一款模型。

AI News Without the Hype – Curated by Humans

订阅 THE DECODER,可享受无广告阅读、每周一次的 AI 新闻通讯、每年 6 次的独家前沿报告“AI Radar”、完整存档访问权限,以及评论区访问权限。

来源与参考

  1. 原始链接
  2. Anthropic claims its new Claude Opus 5 delivers near-Fable 5 performance at half the token price