Cloudflare 自动路由器旨在降低 AI 推理成本
Cloudflare AI··作者 Harrison Harnisch
关键信息
在 Cloudflare 包含 291 次试验的内部基准测试中,`cloudflare/auto` 的成功率为 86.6%,总成本为 2.10 美元;Claude Opus 5.5 的成功率为 96.6%,总成本为 5.91 美元;GPT-6 Sol 的成功率为 84.2%,总成本为 2.64 美元。这些数据来自厂商在公开测试阶段对模拟知识工作任务进行的内部评估,因此尚不能证明路由器适用于所有工作负载,也无法完全说明选择低成本模型可能造成的质量损失。
资讯摘要
Cloudflare 将自动路由器作为 AI Gateway 的公开测试功能推出,目标是控制企业不断增长的 AI 使用成本。用户或应用无需指定某个供应商的具体模型,只要使用模型标识符 `cloudflare/auto` 发送请求,网关就会选择它认为足以完成该任务的模型。Cloudflare 希望借此避免在总结电子邮件或聊天记录等常规工作中过度使用昂贵的前沿模型,同时确保复杂任务仍可调用能力更强的模型。该公司已通过 OpenCode 和自研智能体执行框架 Cloudflare OS 在内部部署这套路由器,并称其编码任务表现可与前沿模型相近,成本最高可降低 30%。
Cloudflare 还使用 97 项通用知识工作任务进行评估,每个模型对每项任务运行三次,场景涵盖电子邮件、日历、Slack、文件、旅行和财务流程。在总计 291 次试验中,自动路由器成功完成 252 次,总成本为 2.10 美元,每次成功成本为 0.0084 美元;Claude Opus 5.5 成功 281 次,总成本为 5.91 美元;GPT-6 Sol 成功 245 次,总成本为 2.64 美元。Cloudflare 将其描述为以 Sol 约 80% 和 Opus 约 35% 的成本取得相近的日常使用表现,但这些结论仍来自厂商内部基准测试,而且产品目前处于公开测试阶段。

资讯正文
通过与处于 AI 采用之旅各个阶段的公司交流,我们发现了一些共同模式。首先是探索期:你会引入每一个新工具,随意分发 API 密钥,并让 token 尽情流动。随后,你会为组织确定一套标准工具,分别用于代理式编码、非技术工作流以及运行和部署代理。随着公司逐步正式化 AI 的采用,他们希望管理和监督用户的 token 支出,但预算和规则的作用终究有限。最好的节省,是用户根本察觉不到的节省。
今天,我们正式公开测试 Cloudflare 的 Auto Router,该功能通过 AI Gateway 提供。将模型设置为 cloudflare/auto 后,Auto Router 会自动把每个请求路由到足以胜任该任务的模型,而不要求终端用户考虑模型选择。我们早期在内部通过 OpenCode harness 使用 Auto Router 的结果显示,与只使用 OpenAI Sol 和 Anthropic Claude Opus 等前沿模型相比,成本最高可节省 30%。
我们为何构建它
根据我们自己在 Cloudflare 跟踪 AI 支出的经验,我们了解到,管理成本需要采取多管齐下的方法。此前,我们讨论过如何为 AI 支出设置预算和限制,以及如何通过将员工与其 AI 使用情况关联起来,了解组织内部哪些人在支出。
在包括 OpenCode、Claude Code 和 Codex 在内的许多 harness 中,用户仍然需要手动选择模型。当然,并非所有任务都具有同等复杂度,而用户往往会为自己的工作选择能力过剩的模型。例如,如果你只是想总结一封电子邮件或聊天记录,就不需要 Opus 级别的智能。不过,你也不会希望完全禁止安全工程团队使用该模型。
我们的目标是让 AI Gateway 成为在组织内部部署 AI 的控制平面。由于每个用户、代理和工具发出的每个请求本来就已经流经 AI Gateway,它所处的位置非常独特,可以完成的不只是观察和执行规则。预算、支出上限以及基于身份的分析能够让组织获得可见性并设置防护措施,但它们仍然依赖个人逐个请求地做出有成本意识的选择。下一步,是由网关本身代表用户做出智能决策:将每个请求发送到足以胜任该任务的模型。这样,组织就能自动降低支出,同时用户在工作确实需要时,仍可使用能力最强的模型。
结果
我们在 Cloudflare 内部的 OpenCode 部署以及 Cloudflare OS(我们定制的代理 harness)中使用 Auto Router。在内部使用中,我们看到它在编码任务上取得了与前沿模型相当的结果。
在涵盖各种知识工作任务时,Auto Router 的表现最佳,这类任务通常存在于业务范围广泛的大型组织中,既包括技术团队,也包括非技术团队。我们评估了 cloudflare/auto。
在我们的内部通用知识工作基准测试中,cloudflare/auto 的表现超过了 OpenAI 的 GPT-6 Sol 和 Anthropic 的 Claude Opus 5.5。该基准测试使用模拟工作区工具,涵盖电子邮件、日历、Slack、文件、旅行和财务等日常工作流程。每项任务都要求模型使用这些工具来生成可验证的答案或完成一项操作。
| 模型 | 成功试验次数 | 成功率 | 总成本 | 每次成功成本 |
| cloudflare/auto | 252/291 | 86.6%(+6.2/−6.9 个百分点) | 2.10 美元 | 0.0084 美元 |
| OpenAI GPT-6 Sol | 245/291 | 84.2%(+6.5/−6.9 个百分点) | 2.64 美元 | 0.0108 美元 |
共有 97 项任务,每个模型在每项任务上采样三次。括号中的数值显示了 95% 置信区间,该区间根据 10,000 次任务级自助法重采样估算得出,并保留了每项任务中的全部三次重复试验。“pp”表示百分点。
我们的 Auto Router 实现了与其他最先进日常使用模型相近的性能,而成本仅为 Sol 的 80% 和 Opus 的 35%。这乍看之下可能令人意外,但理解模型路由器所解决问题的一种方式,是观察不同模型之间的“锯齿状前沿”。解决某个问题的能力往往存在于这一组模型中的某个位置;路由器的任务,就是在平衡质量与价格的同时,为每项任务选择合适的模型。节省成本的原因在于,不必为非前沿任务支付前沿模型的价格;而这类任务占比越高,节省就越多。
另一个值得注意的发现是,更低的 token 价格并不总能带来更低的最终成本。一个从账面价格来看更便宜的模型,最终可能会为了完成问题而使用数量明显更多的 token。路由器应当尽量降低预测的完整执行轨迹成本,而不只是按照每百万 token 的价格进行负载均衡。
这项能力如今已经很有用,但它只是 Auto Router 能够从 Cloudflare 在推理路径中的位置学到更多信息的开始。
工作原理
当你向 cloudflare/auto 发送请求时,AI Gateway 首先会建立一个实际能够处理该请求的模型池。它会筛除不支持请求格式或执行模式的模型,同时考虑与该网关关联的凭据、计费配置、访问控制策略和支出限额。在上游服务商或模型发生故障期间,它还会筛除不健康的上游服务商或模型,并在中断结束后自动将它们重新加入模型池。
对于剩余的候选模型,路由器会查看对话的精简视图。它会考虑最近的消息,并优先关注最新的对话轮次。随后,对话会被发送到一个运行在 Workers AI 上、部署于我们边缘网络各处 GPU 上的多头分类模型。该分类器会生成两组信号。首先,它会针对 14 类任务(例如编程、规划、研究和数据分析)分别分配概率。然后,它会从四个维度对请求进行评级,每个维度的分值范围为一到五:复杂度、模糊性、利害程度,以及对早期上下文的依赖程度。
另一个独立的评分矩阵会将这些信号与模型基准测试结果结合起来,用于估算每个模型与请求的匹配程度。为了校准评分矩阵,我们为一组示例任务和难度档案定义了首选模型,然后调整权重,使其得出这些选择。
最后,路由器会将预期质量与每个模型的输入和输出 token 价格结合起来。在简单直接的请求中,价格所占的权重更高,因此只要能力足够,小型模型也可能胜出。随着难度上升,成本惩罚会降低,能力更强的模型也有更大的胜算。简单来说,cloudflare/auto 会选择效用最高的模型,其定义如下:
对于调试或编程这类持续时间较长的 agentic 会话,成本受模型标价的影响较小,更多取决于缓存读取成本,而缓存读取成本会随会话长度增长。切换模型会丢弃缓存,并迫使新模型重新写入整个上下文。如果某个模型的缓存读取和缓存写入价格更低,那么它很快就能通过节省的成本收回重写上下文的开销,因此切换模型仍然可能值得。
Auto Router 并不会完全避免模型切换,而是会将缓存读取和写入的成本纳入考量。在一轮对话中(即一次用户输入循环内),缓存处于热状态,切换模型很少能够带来收益,因此最好继续使用同一个模型。在不同轮次之间,Auto Router 会施加切换惩罚,而且上下文中已有的 token 越多,惩罚就越大。对于仍为该会话保留有效缓存的模型,会按较低的缓存读取费率计价。其他候选模型则全部按照重新写入上下文的完整成本计价。因此,对话越深入,切换模型就越需要通过更高质量的结果、整体使用更少的 token,或更便宜的缓存重复读取来收回成本。切换模型还会产生另一项成本:大多数模型无法读取另一个模型的推理 token,因此,如果模型切换导致推理 token 丢失,新模型可能必须以输出价格重新完成这些推理。未来,我们希望通过让路由器在切换时优先选择同一模型家族,来处理这一问题。
此后,路由器会返回一个排序后的列表。AI Gateway 会首先尝试排名第一的模型;如果该提供商无法处理请求,则可以转而使用其他符合条件的模型。
这种整体设计带来了多项好处。两阶段架构(从任务和维度分类器到评分矩阵)意味着路由决策是清晰可解释的:你可以检查每个任务被预测出的类别和复杂度,从而了解这些因素如何转化为最终的模型选择。新模型发布后,调整路由器也不需要重新训练——我们只需将根据基准测试得出的权重添加到评分矩阵中。同一个分类器还可以支持不同的路由配置。例如,除了 cloudflare/auto 之外,我们计划在未来发布其他路由器,包括 cloudflare/auto-best。它使用相同的分类方式和模型池,但会选择预期质量最高的模型,而不考虑成本权衡。
接下来
今天的发布只是起点,我们将继续投入研究并探索新的路由策略。近期,我们希望:
使用 AI Gateway 的 Auto Router 降低 AI 开支
扩大 cloudflare/auto 提供的模型范围。
筛选模型时纳入零数据保留要求。
选择模型时考虑供应商的容量。
为每个请求选择适当的推理或思考级别。
全面支持 Responses API 和 WebSockets。
探索将结构化决策模型作为第一阶段分类器。
Auto Router 在测试期间免费。
致谢:本项目也得益于 Mats Dodd、Sam Scott、Oliver Yu 和 Jeff Rafter 的贡献。
来源与参考
收录于 2026-10-01