Sakana AI 的 Fugu 协调多个大模型

The Decoder··作者 Matthias Bastian

关键信息

Fugu 有两个版本:基础版面向更低延迟的日常编码、代码审查和聊天任务,Fugu Ultra 则针对更复杂的多步骤问题追求最高质量。Sakana 还表示,出于隐私或合规原因,用户可以把特定代理从模型池中排除,而且模型选择、任务分派、检查和综合都在系统内部完成。

资讯摘要

Sakana AI 发布了 Fugu,这是一个多大语言模型编排系统,对外表现为单一的、兼容 OpenAI 的 API,同时会从可替换的模型池中动态选择并组合模型。公司称 Fugu Ultra 在多项基准上可匹配 Anthropic 的 Fable 5 和 Mythos Preview,尽管这两个 Anthropic 模型并不在 Fugu 的模型池中。 如果这些基准表现经得起验证,Fugu 可能通过把任务路由给最合适的模型,而不是依赖单一供应商,来提升成本效率、系统韧性和供应商独立性。

这对构建智能体系统、代码工具和企业 AI 栈的团队尤其重要,因为他们往往同时关注延迟、合规和厂商锁定。 Fugu 有两个版本:基础版面向更低延迟的日常编码、代码审查和聊天任务,Fugu Ultra 则针对更复杂的多步骤问题追求最高质量。Sakana 还表示,出于隐私或合规原因,用户可以把特定代理从模型池中排除,而且模型选择、任务分派、检查和综合都在系统内部完成。

Sakana AI 的 Fugu 协调多个大模型

资讯正文

萨卡纳 AI 的 Fugu 通过协调多个大语言模型,力图追平 Anthropic 的 Fable 和 Mythos 基准

要点

- 日本 AI 初创公司 Sakana AI 正在推出 Fugu,这是一套可动态协调来自可替换模型池的多个语言模型的系统,同时通过一个 API 表现得像单一模型一样。

- Sakana 表示,尽管 Fable 和 Mythos 都不在其大语言模型池中,Fugu 在基准测试中的表现仍超过 Anthropic 的最佳模型。

- Fugu 提供适用于日常任务的基础版本,以及更强大的 Fugu Ultra 变体。可替换模型池的设计也旨在降低对任何单一 AI 提供商的依赖。

更新——

- 补充了第一印象

更新,2026 年 6 月 23 日:

首次上手测试呈现出喜忧参半的局面

早期对 Fugu 的评测,和基准测试相比,显得没那么令人兴奋。AI 研究员 Ethan Mollick 在 X 上写道,Fugu Ultra “慢得惊人”。他平时的编码测试花了 30 分钟。结果“还行”,但在实际使用中不及 Fable。他用自己的 3D 模拟基准“Harbor Town”演示了这一点。

X 用户 @LLMJunky 在 $20 套餐上,一个提示词就耗尽了自己全部五小时额度。一个 ThreeJS 编码任务返回的结果“明显比 GPT 5.5 更差”,而且在游戏甚至能运行之前,就需要七八轮修复。“初步印象……不太好,”他写道。

在 Hacker News 上,开发者抱怨每月 $200 的套餐每周只能用不到三小时。该 API 据称速度很慢,输出质量也远谈不上接近 Fable。不过,代码审查倒是一个亮点,表现大致与 Opus 4.8 或 GPT 5.5 相当。X 上的 Hamel Husain 也认为它在代码审查方面表现不错,但在前端工作上较弱,称其“能力有点参差不齐”。

X 用户 Mark Santos 对一个 Crossy Road 克隆项目进行的正面对比显示,Fugu Ultra 用时 22 分钟、花费 $7.32 就完成了,比 Opus 4.8 的 79 分钟和 $37.85 快得多、也便宜得多。但 Santos 更不喜欢它的输出结果。

Sakana AI 关于主权性的说法也遭到质疑。该系统仍然依赖其模型池中现有的模型,而 Sakana 在基准测试中使用了 Claude Opus 等专有模型。巧妙的工程设计确实能从 AI 模型中榨出更多能力,但这并不新鲜。所谓的“harness engineering”在 agentic AI 中扮演着重要角色。

2026 年 6 月 22 日的原文:

总部位于东京的 AI 初创公司 Sakana AI 正在推出 Fugu,这是一套可动态协调多个 AI 模型的系统,旨在与 Anthropic 的 Fable 5 等领先系统一较高下。该方法也希望降低对任何单一 AI 提供商的依赖。

这家总部位于东京的初创公司 Sakana AI 发布了 Fugu,这是一种多大语言模型协调器,在用户看来和感觉上都像单一模型。Sakana 在面向编码的协调器方案上已经取得了强劲结果。其 ALE-Agent 在一场编码比赛中,在 1,000 名人工专家中排名第 21 位。

Fugu 本身就是一个语言模型,经过训练后会从一个智能体池中调用其他大语言模型,其中也包括它自己的副本。根据请求不同,它要么独立处理任务,要么组建一支由专门模型构成的团队。模型选择、任务分派、检查和综合都在内部完成。用户则通过一个兼容 OpenAI 的 API 访问全部功能。

Fugu Ultra 旨在匹配顶级模型

Sakana AI 正在推出两个版本。基础版 Fugu 模型面向低延迟,以及在编码、代码审查和聊天机器人等场景中的稳定日常表现。对隐私或合规有要求的团队可以从模型池中排除特定代理。

Fugu Ultra 则面向复杂的多步骤问题,追求最高答案质量。早期用户已将其用于 AI 研究、科学论文复现、网络安全分析,以及专利和文献检索。

根据 Sakana AI 发布的基准测试结果,Fugu Ultra 在一系列编码、推理、科学和代理基准上,表现与 Anthropic 的 Fable 5 和 Mythos Preview 不相上下。

不过,这两个 Anthropic 模型并不在 Fugu 的代理池中,因为它们并未公开提供。如果把这些模型纳入其中,Fugu 的得分很可能还会更高。Sakana AI 表示,基线对比数字来自模型提供方本身。下表展示了 Fugu 与底层基础模型相比的表现。

**将编排作为对供应商锁定的对冲**

Sakana AI 将 Fugu 作为防止单一供应商依赖的一种保障来推销。该公司以近期对 Anthropic 的 Fable 和 Mythos 模型实施的出口管制为一个具体例子。由于监管变化或外交政策决定,顶级 AI 系统的访问权限可能会在一夜之间消失。

“对于一个组织或一个国家而言,在关键基础设施、金融或治理领域依赖单一公司的 API,是一种重大的脆弱性。这种风险不再是假设,而是现实。”Sakana AI 在公告中写道。Fugu 的模型池可以完全替换,因此如果某个供应商失去可用性,系统可以改由其他模型接管。

不过,系统在现实世界中的表现完全取决于模型池里有哪些模型。如果多个顶级提供方同时限制访问,Fugu 的可选项也会随之缩小。像 Fugu 这样的编排器或许能提升韧性,但这与真正的主权并不相同。

尽管如此,仅从原始性能来看,Fugu 仍值得关注。编排究竟会在多大程度上增加 token 用量和成本,仍是一个悬而未决的问题,而 Sakana 并未在公告中予以说明。

**早期测试者报告复杂工作流有提升**

据 Sakana AI 介绍,约有 500 名 beta 用户已经在真实场景中测试过该系统。Fugu 在自动化数据研究、安全分析和代码审查等长周期、多步骤工作流上的表现最强。

视频:据 Sakana 称,Fugu 比单个模型更快地解出了并可视化了一个魔方。

“beta 测试清楚地表明,只有当任务杂乱、耗时且难以通过一次模型调用解决时,多代理编排才最有价值,”Sakana AI 写道。

这两个版本现已通过产品页面和控制台上的单一 API 上线。Sakana 提供面向日常使用的订阅方案,以及面向更大工作负载的按量计费。

Sakana 的押注不是某一个单独模型,而是一个 AI 生态系统。

Fugu 的技术路线建立在 Sakana AI 自身关于学习型模型编排的研究之上,具体来说,是 ICLR 2026 上发表的两篇论文 Trinity 和 Conductor。

这个想法契合了 Sakana AI 更宏大的愿景:将群体行为、进化和集体智能等自然原理应用到 AI 系统中。该公司认为,强大的 AI 并不是单一模型的问题,而是一个协作生态系统,其能力超越任何单个模型单独能够做到的程度。

Sakana AI 由前 Google AI 研究员 Llion Jones 和 David Ha 创立。Jones 是 2017 年论文《Attention Is All You Need》的共同作者,这篇论文提出了 Transformer。

来源与参考

  1. 原始链接
  2. Sakana AI's Fugu orchestrates multiple LLMs to match Anthropic's Fable and Mythos benchmarks

收录于 2026-06-24