Claude Fable 5.1 提升科学基准与鹈鹕测试
Simon Willison··作者 Simon Willison
关键信息
Willison 还用一个有趣的“骑自行车的鹈鹕”SVG 提示词做了测试,并指出 Fable 5.1 有五个推理等级:low、medium、high、xhigh 和 max,而且不能完全关闭推理。在他的测试里,low 和 medium 看起来都没有显式推理文本,而更高等级则产生了更长输出和更高成本。
资讯摘要
Simon Willison 的这篇文章发布在 Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1 的当天。Anthropic 将 Fable 5.1 描述为在编程、知识工作以及长时间问题求解任务上树立了新标准。公司特别强调了它在科学相关任务上的表现,并称该模型在全新的 Terminal-Bench-Science 0.1 基准上得分达到 52.6%。这个基准是在 8 月 27 日首次公布的。Willison 还把这个成绩与其他模型做了对比,包括 Fable 5 的 24.7%、Claude Opus 5 的 29.0% 和 GPT-5.6 Sol 的 22.4%。
他指出,其他基准的提升也有,但都没有科学基准这么显著。随后,文章转向他一贯喜欢的“鹈鹕基准”测试,也就是让模型生成一只骑自行车的鹈鹕 SVG。对于 Fable 5.1,Willison 发现它提供 five 个推理等级:low、medium、high、xhigh 和 max,而且不能完全关闭推理。按照他的记录,low 和 medium 两档都没有显示出摘要化的推理文本,像是对这个提示词直接跳过了显式推理。更高推理等级则生成了更长的输出,也带来了更高的用时和成本。

资讯正文
但它到底有多像鹈鹕呢?
早在 7 月,我写过<a href="https://simonwillison.net/2026/Jul/16/kimi-k3/">我如何开始对鹈鹕基准测试失去信心</a>,因为它和模型在其他任务上的表现之间的关联,似乎不像<a href="https://simonwillison.net/2025/Jun/6/six-months-in-llms/">2025 年时</a>那样紧密。如今,我从这个基准测试中得到的最有意思的洞见,是对同一家族模型之间的比较,尤其是同一提示词在不同推理力度级别下的比较。
Fable 5.1 有五个推理级别:low、medium、high、xhigh、max——而且没有完全关闭推理的选项。
我先修复了 <a href="https://github.com/simonw/llm-anthropic/issues/88">一个问题</a>,该问题导致推理轨迹无法被正确记录,随后又运行了一些提示词。
这里是涵盖所有推理级别的<a href="https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7">完整鹈鹕集合</a>,每个都附带完整的推理转录。我在这里把它们复现出来:
<h4 id="low-and-medium-both-without-reasoning-">Low 和 medium,二者都没有推理?</h4>
接下来有点神秘。以下是我在 effort <code>low</code> 下得到的结果:
<img alt="Minimalist flat illustration of a white pelican with an orange beak riding a black bicycle to the left, its orange legs pedaling and wings gripping the handlebars, with motion lines behind on a light blue background." src="https://static.simonwillison.net/static/2026/fable-5.1-low.png" />
<a href="https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#options">转录</a>里没有显示任何总结后的推理 token,输出 token 数为 1,998。对于 Claude 来说,这个输出 token 数包含推理 token。整个过程耗时 23.8 秒,费用为 <a href="https://www.llm-prices.com/#it=27&ot=1998&sel=claude-fable-5-1">10.017 美分</a>。
我把它提高到 <code>medium</code>,得到了这个:
<img alt="Minimalist flat-style illustration of a white pelican with an orange beak riding a black bicycle to the right, with motion lines behind it, on a light blue background." src="https://static.simonwillison.net/static/2026/fable-5.1-medium.png" />
奇怪的是,这个结果同样显示<a href="https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#options-1">没有推理文本</a>,并且使用了 1,977 个输出 token——比 <code>low</code> 还少 21 个 token。整个过程耗时 23 秒,费用为 <a href="https://www.llm-prices.com/#it=27&ot=1977&sel=claude-fable-5-1">9.912 美分</a>。
因此,就这个特定提示词(“Generate an SVG of a pelican riding a bicycle”)而言,Fable 5.1 在 <code>low</code> 和 <code>medium</code> 两个设置下似乎都完全跳过了推理。
<h4 id="high">High</h4>
这是 <code>high</code> 级别的结果——29.6 秒,2,612 个输出 token,<a href="https://www.llm-prices.com/#it=27&ot=2612&sel=claude-fable-5-1">13.087 美分</a>:
<p><img alt="一幅极简平面插画:一只白色鹈鹕,橙色喙,骑着一辆黑色自行车,橙色的腿在蹬踏板,身后有运动线,背景为浅蓝色。" src="https://static.simonwillison.net/static/2026/fable-5.1-high.png" /></p>
这个结果确实做了一点推理,<a href="https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#reasoning">摘要见此</a>:
<blockquote>
<p>我正在为一只骑自行车的鹈鹕规划 SVG 布局:背景有天空和地面,一辆带两个辐条轮、车架、车座和车把的自行车,以及一只白色身体、长脖子、橙色喙的鹈鹕,放在上方。</p>
</blockquote>
不过,这和 <code>low</code> 和 <code>medium</code> 相比,其实也并没有太大区别。
<h4 id="extra-high">Extra High</h4>
在 <code>xhigh</code> 下,事情就发生了<em>剧烈</em>变化。36,767 个输出 token,7 分 51 秒,<a href="https://www.llm-prices.com/#it=27&ot=36767&sel=claude-fable-5-1">1.83 美元</a>!
<p><img alt="一幅极简平面插画:一只白色鹈鹕,橙色喙,骑着一辆向左的黑色自行车,橙色的腿在蹬踏板,身后有运动线,背景为浅蓝色。" src="https://static.simonwillison.net/static/2026/fable-5.1-xhigh.png" /></p>
<a href="https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F17318f748f8c2b476051ddc2ebeb94a7#reasoning-1">推理轨迹相当长</a>,其中包括这样的细节:
<blockquote>
<p>增加眼睛、向下伸到车把握把的翅膀、伸向脚踏板的橙色腿,以及一根小尾羽,同时为了喜剧效果,刻意保持鹈鹕相对于自行车的比例过大。[...]</p>
<p>我会把这点轻微的厚重感接受为一种可爱之处,而不是过度设计。</p>
</blockquote>
<h4 id="max">Max</h4>
把 effort 设为 <code>max</code> 后,得到了我见过的 Anthropic 任何模型输出中最好的鹈鹕。65,927 个输出 token,13 分 54 秒,<a href="https://www.llm-prices.com/#it=27&ot=65927&sel=claude-fable-5-1">3.30 美元</a>:
<p><img alt="一幅极简平面插画:一只白色鹈鹕,橙色喙,骑着一辆黑色自行车,橙色的腿在蹬踏板,身后有运动线表示速度,背景为浅蓝色。" src="https://static.simonwillison.net/static/2026/fable-5.1-max.webp" /></p>
这幅图有很多可取之处。背景很雅致,腿清楚地位于车架两侧,脚踩在踏板上,翅膀搭在车把上,鹈鹕还戴着一顶可爱的蓝帽子,而且车前篮里还有一条鱼。
它仍然远没有<a href="https://simonwillison.net/2026/Aug/13/llm-gemini/">Gemini 3.7 Flash</a>那种花哨程度,但我并没有<em>要求</em>花哨——我要求的是一个 SVG,而我确实得到了一个。
下面是那段推理轨迹中的一些亮点:
在两只脚附近添加踏板形状,远处那只脚则在画框后方,第二条腿的一部分隐约可见。我在考虑要不要再加一条小围巾或一顶帽子来增加个性,但我更倾向于保持简洁,避免画面显得杂乱。
现在我在纠结头上是放一个自行车头盔,还是保留鹈鹕标志性的羽冠——喙和喉囊已经很清楚地表明这是“鹈鹕”了,所以头盔可以在不丢失身份识别的前提下强化自行车主题,不过它可能会和羽冠在视觉空间上竞争。
我意识到位于 (484,84) 的喙会和圆顶头盔重叠,所以我需要把头盔缩小,让它只覆盖头顶部分,并调整它的弧线端点,使其位置更高、更窄,这样喙就能在前方干净地连接上,不会发生碰撞。 [...]
我正在增加一个更深色的尖端区域来表现初级飞羽,然后重新考虑后缘,把原本一条平滑的线改成扇贝状的羽毛曲线,以获得更自然的外观。 [...]
现在我在检查头盔上的通风槽位置,确保在考虑到描边宽度和圆角端帽后,它们位于头盔边缘足够靠内的位置,并确认每个通风槽都保持在头盔的圆形边界内。 [...]
我决定不加车把铃和轮胎高光,因为这些都是没必要的附加元素。现在我在重新考虑前叉的弧线——当前的控制点把形状往后拉,而它本来应该向前弯,以形成合适的前伸角度,所以我需要把控制点向右移动,以修正前叉的倾斜。
好了,让它动起来吧
在 Hacker News 上,swalsh 在那只 Max 鹈鹕下面评论道:
现在它已经成了一个解决了的基准测试,我们能不能拿到动画版?
我不想再花 3 美元,所以我把那只 Max 鹈鹕拿出来,接到了 High 的默认思考级别:
6,121 输入,26,201 输出 = 1.37 美元。结果看起来是这样的,我把它导出成了视频,因为有些人查看动画 SVG 会有困难:
你的浏览器不支持 HTML5 视频。
视频里的轮子转动方向不对,不过我认为这是转换成 MP4 时造成的伪影——在原始 SVG 中,它们似乎是朝正确方向转动的。
来源与参考
收录于 2026-09-03