Claude Opus 5.5 声称以更低成本达到 Fable 级性能
ZDNET AI··作者 David Gewirtz
关键信息
Box 表示,Opus 5.5 使用的令牌数量只有 Opus 5 的三分之一,同时回答简洁了 40% 且没有损失准确性;Ramp 则称其写作和推理更易于理解。Anthropic 还强调了对齐测试、外部评估以及网络安全和生物学领域的防护措施,但这些主要是公司和客户的说法,尚未得到独立验证。
资讯摘要
Anthropic 将 Claude Opus 5.5 描述为面向重度用户的重要效率升级,尤其针对使用 Claude Code 的开发者。该公司表示,这款模型的输出速度比 Opus 5 快逾 30%,能够用更少的令牌完成质量更高的工作,并且令牌价格降低 20%。Box 的人工智能产品副总裁 Yashodha Bhavnani 表示,内部评估发现 Opus 5.5 使用的令牌数量只有 Opus 5 的三分之一,回答冗长度降低 40%,同时没有牺牲准确性。Anthropic 还将订阅用户的五小时使用额度提高 20%;由于模型消耗更低,五小时和每周额度预计还能支持更多工作,报道估算综合有效运行能力可能提高约 50%。
Ramp 的客户反馈称,这款模型表达更自然、内容更易于理解,并能以极少修改生成可用的设计规范和提示词改写。除速度和成本外,Anthropic 还表示 Opus 5.5 接受了广泛的对齐测试、发布前外部评估,以及针对网络安全和生物学等高风险领域的防护。经过批准的机构可以申请 Anthropic 的生命科学验证计划,而经过审查的网络安全机构预计将在网络安全验证计划下获得访问权限。

资讯正文
ZDNET 要点
- Claude Opus 5.5 可能会让重度用户受益匪浅。
- 开发者或许能用更少的步骤更快地完成编码工作。
- Anthropic 表示,这次升级更安全、更便宜,也更简洁。
“我们的客户会使用 Box AI 处理海量内容,因此速度和成本是首要考虑因素。”Box AI 产品副总裁 Yashodha Bhavnani 表示,“在我们的评估中,Claude Opus 5.5 使用的令牌数量只有 Opus 5 的三分之一,而且回答在不牺牲准确性的情况下,冗长度降低了 40%。对于那些在金融服务和公共部门等领域,让智能体处理自身内容的团队来说,我们预计这会非常重要。”
我一直在大量使用搭载 Opus 5 的 Claude Code,因此尤其希望该公司的性能声明是准确的。该公司表示,Claude Opus 5.5“生成输出的速度比 Opus 5 快 30% 以上”。
今天的公告还谈到了令牌价格和订阅方案。使用 Opus 5.5 时,令牌价格比 Opus 5 低 20%。据报道,Opus 5.5 还“能用更少的令牌完成质量更高的工作”。
对于像我这样的订阅用户,Anthropic 将五小时使用限额提高 20%。这基本上意味着,在五小时内你能使用的 AI“燃料箱”容量扩大了 20%。虽然我的 Max 方案并不经常重置,但它确实会重置。对于每月支付 20 美元方案的用户来说,这可能是一项相当大的利好。此外,该公司表示,由于 Opus 5.5 的成本低于 Opus 5,五小时使用限额和每周使用限额都能支持更长时间的使用。
这些提升似乎是叠加的:使用额度扩大 20%,消耗速度又放慢 25%,这意味着使用 Opus 5.5 时,实际可运行容量似乎提高了约 50%。这无疑是一次相当明显的使用体验改善。
Anthropic 还表示,Opus 5.5 比之前的模型交流得更自然。如果它哪怕只是稍微没那么谄媚一点,我都会很高兴。有时 Opus 会变得极其阿谀奉承,尤其是在它做错事情的时候。
Ramp 的软件工程师 John Ruelas 表示:“冗长、难以理解的输出一直是我对前沿模型最大的不满,而 Claude Opus 5.5 解决了这个问题。”
他说,Opus 5.5“写作方式像一位优秀的同事,并且会遵守我们的写作规范。一份设计规格说明几乎无需修改就可以使用;当它重写我们的一个提示词时,我更喜欢它的版本,而不是我自己的版本。在它优化我们的测试套件时,我很容易理解它的推理过程,并且能够放心地发布这项改动。”
把控前沿发展速度
说到做错事情,Anthropic 公告的后半部分主要围绕 Opus 5.5 如何成为一个行为更可靠的 AI 展开。
Anthropic 引用了首席执行官 Dario Amodei 关于控制 AI 能力进步速度的博文,并重点介绍了一系列针对 Opus 5.5 的最佳实践,包括“广泛的对齐测试、由外部机构进行的发布前评估,以及针对网络安全和生物学等高风险领域的安全防护措施”。
“对齐”(Alignment)是一个用于衡量人工智能是否有可能失控的术语。Anthropic 表示,Opus 5.5 是“我们迄今测试过的性能最强的模型,在导致近期网络安全事件的多种行为方面尤其有所改进(例如偏置推理、试图逃离沙盒环境等)”。
该公司表示,他们采用了外部测试机构,并在网络安全、生物学和前沿大语言模型开发领域,使用了“与 Fable 5.1 类似的一套防护措施”。
目前,一些“经过审核的组织”可以申请 Anthropic 的生命科学验证计划(Life Sciences Verification Program),以获得用于生物研究的更强大访问权限。通过 Anthropic 网络安全验证计划(Cyber Verification Program)获批开展网络安全工作的机构,将能够在几周后开始使用 Opus 5.5。
披露:作为我在 ZDNET 之外参与的国家基础设施保护工作的一部分,我本人已获准加入网络安全验证计划。
客户使用体验
GitHub 首席产品官 Mario Rodriguez 分享了他对这款新品的看法。他表示:“开发者希望使用能够承担实际软件工作并将其完成的智能体。在我们针对 GitHub Copilot CLI 和 VS Code 进行的测试中,Claude Opus 5.5 使用的令牌数和步骤数都位居测量结果中最少的一档。在 VS Code 中,它完成的终端任务多于 Opus 5,同时所用步骤不到后者的一半。它带来的不仅是单个任务效率的提升,也让开发者完成更大型的项目变得更加可行。”
四大会计师事务所之一 Deloitte Consulting LLP 的首席信息官 Carl Bennett 表示:“即使在最低努力程度设置下,Claude Opus 5.5 在我们的代码审查中也发现了 72% 的已知漏洞;相比之下,Opus 5 在高努力程度设置下的比例为 56%,而且误报更少,输出量也只有其一小部分。在美国咨询分析任务中,低思考努力程度的表现与更高思考设置相当,但输出量只有一半,并通过了我们的质量检查。当更多低思考努力程度的实例被部署到生产环境中时,就能以高效的方式交付可直接供客户使用的成果。”
所以,情况就是这样:更强的能力、更高的安全性、更低的成本,以及更少的冗长输出。在距离上一次重大版本发布还不到两个月的时间里,这已经是相当大的改进。
来源与参考
收录于 2026-09-23