Claude Sonnet 5.5 低成本逼近 Opus 性能

The Decoder··作者 Matthias Bastian

关键信息

Sonnet 5.5 的标价与 Sonnet 5 相同:每百万输入令牌 2 美元、每百万输出令牌 10 美元、每百万缓存读取令牌 0.20 美元,但 Anthropic 称其每项任务使用的令牌更少。在最高的“Max”努力等级下,FrontierCode 1.1 的表现可能反而下降,因为额外的代码审查子代理调用可能导致超时或修改任务范围之外的内容;对于高风险网络安全请求,系统会将其转交 Sonnet 5,同时新增措施用于防范网络安全滥用和模型蒸馏攻击。

资讯摘要

Anthropic 发布了 Claude Sonnet 5.5,将其定位为 Sonnet 5 的更强、更高效继任者。该公司称,Sonnet 5.5 的输出生成速度提升超过 30%,并且由于完成任务所需的令牌更少,每项任务的实际成本最多可降低 30%,尽管其令牌单价没有变化。在 FrontierCode 1.1 的 High 设置下,Anthropic 报告称 Sonnet 5.5 比 Sonnet 5 高出 10 分,而每项任务的成本约为后者的十五分之一。该模型还更频繁地批量调用工具,从而减少完成编程任务所需的步骤。

不过,在部分情况下,Max 努力等级的 FrontierCode 得分低于 Xhigh,因为代码审查子代理导致超时,或修改了请求范围之外的内容。Anthropic 表示,Sonnet 5.5 在部分知识工作评测中已接近 Opus 5.5,并且能够较好地重做用户界面、执行幻灯片模板,还能仅凭截图游玩《宝可梦 红》。该模型已通过 AWS、Google Cloud、Azure 和 Claude Platform 提供,并支持零数据保留;Anthropic 同时加入了更严格的网络安全控制,以及用于减少模型蒸馏攻击的安全分类器。上述成本和基准测试提升目前主要来自公司披露,仍需独立测试确认。

Claude Sonnet 5.5 低成本逼近 Opus 性能

资讯正文

要点

Anthropic 发布了 Claude Sonnet 5.5。得益于更高效的 token 使用方式,该模型的输出速度提升了 30% 以上,并将单项任务的成本最多降低 30%。

Sonnet 5.5 在编程和知识工作基准测试中取得了大幅进步;在部分测试中,它以低得多的成本,几乎达到了顶级模型 Opus 5.5 的水平。

该模型目前已在 AWS、Google Cloud 和 Azure 上提供。Anthropic 还新增了针对网络安全风险和蒸馏攻击的防护措施。

Anthropic 已经拥有 Fable、Opus 和 Sonnet 三个模型系列,分别可以视为 OpenAI GPT-6 Astra、Sol 和 Luna 的对应产品,而后者引发了新一轮定价大战。粗略来说,Opus 的定位略高于 Sol,Sonnet 高于 Luna,而 Fable 高于 Astra,不过 Anthropic 的整体收费更高。对应定位的模型之间性能差距很小,因此成本最终可能成为决定性因素。Haiku 或许能帮助 Anthropic 缩小这一差距。

编程性能大幅提升

推理强度方面存在一个奇怪的细节。在最高的“Max”努力程度下,Sonnet 5.5 在 FrontierCode 上的得分反而低于“Xhigh”设置。Anthropic 表示,在最高努力程度下,该模型更频繁地触发代码审查函数,将工作拆分给多个子代理。在某些情况下,这会导致超时,或对任务范围之外的内容进行修改;这两种情况都会受到 FrontierCode 的扣分。

知识工作表现几乎追平 Opus 5.5

早期测试者将 Sonnet 5.5 描述为更自然的对话伙伴,并认为它具备良好的设计感。Anthropic 声称,该模型能够重新设计用户界面,并以出色的效果执行幻灯片模板,生成的结果几乎不需要后续润色。

Anthropic 还表示,Sonnet 5.5 是首个仅凭截图就能通关《Pokémon Red》的 Sonnet 模型。OpenAI 的 Astra 最近也在游戏基准测试中展现了类似的进步。几年前,这类任务还被认为非常困难,通常需要定制算法才能完成。如今,即使是产品系列中的中端模型也能够处理这些任务。

每个 token 的价格不变,但每项任务所需的 token 更少

Sonnet 5.5 的每百万个 token 价格与 Sonnet 5 相同:输入 token 为 2 美元,输出 token 为 10 美元,缓存读取为 0.20 美元。Anthropic 表示,由于该模型每项任务使用的 token 更少,实际成本最多可降低 30%。输出生成速度也提升了 30% 以上。不过,这些说法仍需经过独立测试确认。

与 Anthropic 的其他模型以及 OpenAI 的对应产品一样,Sonnet 5.5 提供可调节的努力程度设置,让用户在成本、速度和输出质量之间进行权衡。Anthropic 表示,在低或中等设置下,Sonnet 5.5 已经在多个基准测试中超过 Sonnet 5 的最佳成绩,而每项任务的成本约为后者的十分之一。不过,为每项任务找到合适的努力程度,仍然更多是一门艺术,而不是一门科学。

更强大模型配套的新网络安全防护措施

Claude Sonnet 5.5 现已在所有主要云平台上提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。与 Opus 5.5 和 Sonnet 5 一样,Anthropic 为该模型提供零数据留存选项。开发者可以通过 Claude Platform 使用该模型,模型 ID 为“claude-sonnet-5-5”。

由于 Sonnet 5.5 在网络安全方面的能力远超前代模型,Anthropic 首次为 Sonnet 系列模型增设了防护措施。涉及高风险网络安全任务的请求会被明确转交给 Sonnet 5。通过扩展后的 Cyber Verification Program,符合条件的专业人士可以申请分级访问权限。

Anthropic 还增加了针对蒸馏攻击的安全分类器,这类分类器此前已用于其最强大的模型。未来几个月应该就能看出这些措施是否真的有效。如果中国实验室一直在从此类攻击中获益,堵住这一途径可能会再次扩大其与西方实验室之间的差距。

来源与参考

  1. 原始链接
  2. Anthropic's Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task

收录于 2026-09-29