Cloudflare 发布 Clef 决策模型与强化学习微调平台

Cloudflare AI··作者 Kevin Flansburg

关键信息

Clef 集成了视觉编码器,并提供 64k 上下文窗口;相比之下,Jev 当前主要处理文本,且上下文窗口为 32k,同时 Clef 兼容 Jev-API。在 Cloudflare 使用 Browser Run 进行域名分类的测试中,Clef 完成抓取、渲染和分类耗时 2.2 秒,而 gpt-oss-120b 耗时 4.7 秒,并返回了更多分类结果。

资讯摘要

Cloudflare 发布了 Clef 和 Clef-flash 两个开源决策模型,并将它们托管在 Workers AI 上。这些模型旨在输出带概率的、有边界的结构化结果,使软件能够据此进行请求路由、触发升级处理,或将决定交给人工。大型语言模型则更加开放,适合推理、文本生成和工具调用,但通常具有更强的非确定性。Cloudflare 表示,Clef 目前在 Jev Decision Index 上排名领先,并且通过兼容 Jev 的接口提供服务。

公司还以 Apache 2.0 许可证在 Hugging Face 上开源这些模型,开发者可以在本地运行和实验。Clef 增加了视觉编码器,可用于图像分类,并支持 64k 上下文窗口,是文中 Jev 所述 32k 窗口的两倍。在 Cloudflare 威胁情报团队的工作流中,Clef 使用 Browser Run 抓取并渲染网站后,在 2.2 秒内完成域名分类;相比之下,gpt-oss-120b 在相同流程中耗时 4.7 秒,且只返回两类结果。Cloudflare 还推出了强化学习微调产品,客户可以利用自己的数据和决策需求调整 Clef。

Cloudflare 发布 Clef 决策模型与强化学习微调平台

资讯正文

过去几周,围绕 Typesafe AI 的 Jev System One 等决策模型,业界出现了大量讨论。虽然分类器模型已经存在了一段时间,但 Jev 将一种全新的决策模型概念引入了 AI 世界——这类模型能够以低成本、快速且一致的方式生成有界的结构化输出,并可在需要作出决策时加入工作流。这些模型的能力足以处理任意一组输入,而无需不断重新训练模型来纳入新的分类类别。这与大型语言模型(LLM)的世界形成对比:后者在很大程度上具有非确定性,但具备足够的开放性,能够为代理型工作负载进行推理,并生成文本和工具调用。

今天,我们发布了两款由 Cloudflare 训练的决策模型 Clef 和 Clef-flash,它们托管在 Workers AI 上。在 Jev Decision Index 评测中,Clef 目前处于领先地位;你可以在实时基准测试演示网站上查看完整结果。这些模型更智能、更快速,并且完全兼容 Jev API,因此你可以轻松试用这些托管模型。我们还将在 Hugging Face 上以 Apache 2.0 许可证完全开源这些模型,方便你在本地运行并自行进行实验。

最后,我们很高兴推出全新的强化学习(RL)产品。借助这一产品,客户也可以针对自己的使用场景对 Clef 进行微调。

什么是决策模型?

决策模型会根据特定概率进行分类,帮助代理决定如何行动。例如,你可以传入一条客户支持消息(输入),并询问它是否紧急、应由哪个团队处理。决策模型会返回带有类型和概率的答案(输出),你的代码可以利用这些结果来分派工单、触发升级流程,或将问题转交人工处理。这意味着,在代理型决策中,人类不再必然需要处于流程之中——代理可以通过编程方式收集上下文、作出决策并执行任务,或者在需要时将任务交由人工处理。

具体来说,在 Cloudflare,我们一直在 Threat Intelligence 团队中测试新的 Clef 模型,以帮助我们对网站域名进行分类。将一个域名提供给 Clef(配合 Browser Run)后,它可以快速识别该域名所属的类别——例如,它可能会判断某个域名有 95% 的概率是时尚网站、85% 的概率属于电子商务网站,以及低于 1% 的概率是钓鱼网站,等等。Clef 模型完成网站获取、渲染和分类只需 2.2 秒。相比之下,在相同的工作流中,我们速度最快的通用 LLM——gpt-oss-120b——耗时 4.7 秒,而且只返回了两种分类。作为用户,你可以想象,延迟和结果数量实现 2 倍的改善,如何帮助我们改进威胁情报工作流,并更快识别恶意或合法域名。将这一能力推广到任何需要快速作出程序化决策的使用场景,你就能解锁强大的代理型工作流,让代理能够自主决定、推理并执行。

介绍 Clef:我们的开源决策模型,以及全新的强化学习微调平台

在音乐理论中,谱号(clef)是放置在五线谱开头的一种符号,用来为线和间指定具体的音名。决策模型与谱号类似,因为它有助于定义上下文所属的领域,以及随后出现的音符(即动作)。我们选择 Clef 作为这一系列决策模型的名称,是因为它发挥着类似的作用;其中的“CF”也呼应了 Cloudflare。

Clef 与其他决策模型有何不同?

尽管市场上的决策模型日益饱和,Clef 仍具有一些独特属性,让我们非常期待将其公开发布。首先,它配备了视觉编码器,因此能够接收图像并对视觉内容进行分类。这一点不同于 Jev,后者目前只能进行文本分类。其次,我们的模型拥有 64k 的上下文窗口(Jev 为 32k),这使用户能够向模型输入更多需要进行分类的状态信息。

第三,我们的模型准确且强大,在各种质量基准测试中都能与市场上的其他决策模型展开竞争。下面列出了一些对于决策制定至关重要的评测,这些评测依据 Jev Decision Index 的定义进行;我们还对市场上一些更受欢迎的模型进行了评分。有关基准测试,请查看下表;也可以在我们的实时决策指数演示网站上查看分数。

| 基准测试 | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |

| BFCL · case exact | 98.47 | 98.76 | 95.75 | 96.52 | 94.51 | 38.13 |

| ToolRet · nDCG@10 | 69.19 | 66.43 | 65.28 | 61.21 | 64.26 | 12.69 |

| API-Bank · accuracy | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 |

| Home appliances · case exact | 82.95 | 97.73 | 52.27 | 42.05 | 25.00 | 0.00 |

| When2Call · accuracy | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 |

| BANKING77 · macro-F1 | 94.20 | 90.93 | 79.74 | 74.28 | 84.83 | 14.29 |

| CLINC150+OOS · macro-F1 | 97.43 | 66.77 | 89.27 | 83.49 | 79.03 | 3.19 |

| BRIGHT · nDCG@10 | 45.91 | 39.26 | 47.52 | 42.94 | 38.53 | 19.90 |

| Amazon ESCI · macro-F1 | 57.48 | 57.39 | 55.21 | 53.37 | 49.22 | 24.40 |

| PhishNChips · accuracy | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 |

我们还使用 Typesafe 自有的评测套件进行了基准测试。我们的 Clef 模型表现良好,在 4 个领域中的 3 个领域击败了 Jev。值得注意的是,考虑到 Clef-flash 的速度快得多,它的表现尤其出色。

| 工作流 | Clef | Clef-flash | Jev |

| 发票处理 | 64.7 | 57.1 | 61.8 |

| 客户服务 | 76.3 | 77 | 76.0 |

| 安全事件 | 62.9 | 61.7 | 61.7 |

| 智能体轨迹可观测性 | 68.5 | 69.8 | 71.6 |

在我们运行的 43 项评测基准中,我们的 Clef 模型在延迟方面击败了其他决策模型(Laya 除外;Laya 的速度非常快,但在上面的基准测试中是以质量为代价的):

| 基准测试 | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev-9B | Laya |

| 中位延迟 · 毫秒 | 209.3 | 38.8 | 524.1 | 84.4 | 51.4 | 5.8 |

| p95 延迟 · 毫秒 | 238.6 | 122.4 | 536.0 | 211.2 | 187.9 | 222.5 |

除了模型本身带来的延迟优势之外,我们的 Clef 模型还托管在 Workers AI 上。由于它们运行在 Cloudflare 的基础设施上,我们能够利用部署在边缘的 GPU,从而实现较低的网络延迟和更快的决策速度。这意味着,你可以将 Clef 放入智能体的关键路径中来做出决策,再结合 Workers AI 上的某个 LLM 来执行操作。

Clef 也会生成与 Jev 类似的严格类型化输出,并且完全兼容 API,因此你可以非常轻松地完成替换。较大的 Clef 模型是功能更强、精度更高的模型,而 Clef-Flash 模型则非常适合对延迟敏感的决策场景。这些模型已达到企业级使用要求;我们保证不会读取、存储或使用你的请求或响应进行训练(除非你希望使用我们的微调产品,相关内容将在下文介绍)。你现在就可以开始使用 Clef 模型,首先可以查看我们的开发者文档,或在 Hugging Face 仓库中试用这个开源模型。

如果你希望针对特定工作负载调整 Clef,我们还提供微调服务——最初将由我们的前沿部署工程师(FDE)团队作为现场合作伙伴提供支持,之后将推出自助式微调平台,让客户能够训练模型,并将其重新部署到 Cloudflare 上。

我们如何训练 Clef

在 Jev 发布的同一周,我们曾发布过一篇文章,介绍我们使用自研决策模型进行的一些实验。我们的演示介绍了如何通过公开大语言模型生成的 logprobs,让 DiffusionGemma 模型输出确定性概率。最初的方法建立在 Matt Mastracci 的独立研究之上。Matt Mastracci 一直活跃在机器学习(ML)社区,通过分享新想法以及向 vLLM 推理引擎提交拉取请求,推动 DiffusionGemma 获得更强的支持。

Clef 延续了这一概念,但采用了不同的基础模型作为骨干。我们目前使用 Qwen 作为基础模型,并对其进行后训练,使其适用于决策模型的使用场景。在推理过程中,Clef 首先使用 Qwen 进行一次仅预填充(prefill-only)的处理,然后并行地为符合条件的模式选项进行评分。决策步骤采用非自回归方式,因此无需逐个 token 生成中间文本,这使得 Clef 的速度显著快于自回归 LLM。Clef 和 Clef-Flash 不通过生成中间文本来产生结构化答案,而是直接从内部骨干网络表示中推导出模式选项。这种方法依赖于专门的两阶段注意力路由过程:每个有效选项都会提取与提示相关的上下文,使各个字段参数能够在评分之前与其他字段进行交叉注意,并回溯关注原始载荷。通过利用词法先验,该模型能够在不同选项之间保留语义意图。最终,这一架构将面向选项的证据路由、字段间联合交叉注意力以及受模式约束的评分结合在了一起。

通过冻结用于 Clef 的 Qwen3.8-27B 以及用于 Clef-flash 的 Qwen3.5-9B,我们联合优化了路由头和秩为 256 的低秩适配器。我们的后训练采用带标签平滑的交叉熵来生成有效的 schema 输出,并结合 Brier 损失来改进概率校准。这一训练利用了我们自行构建的内部合成数据集,其中对字段顺序、提示词和 schema 结构进行了排列组合。我们还开发了“校准决策强化学习”(Reinforcement Learning for Calibrated Decisions,RLCD),将其作为辅助优化目标:对相邻的序数选择给予部分得分,对完全精准的记录输出给予奖励,并施加参考模型惩罚以防止分布偏移,从而获得更高的准确率和更好的泛化能力。

这意味着,我们借助 Clef 实现了一些新的能力:提高了模型的分类准确率,将其限制为只输出概率而不是生成文本,并且使其速度快于 Jev 和基础版 Qwen 模型。

微调如何扩展 Clef 的能力

我们听到了许多内部使用场景,这些场景要求对 Clef 模型进行微调,以便将其构建到 Cloudflare 的智能体工作流中。例如,内部团队希望分类器模型能够评估 Trust & Safety 提交内容,帮助我们对 Cloudflare Support 请求进行分流,甚至内置到我们的 Bot 产品中,用于判断爬虫是好机器人还是坏机器人。

这些使用场景都非常具体,而我们已经积累了多年的标注决策数据,可以用来训练特定的分类器。微调模型时,你可能需要牺牲一部分通用性能,以换取其在特定领域中的更高准确率。由于 Cloudflare 在不同领域拥有超过 15 年的网络数据,我们可以针对这些具体使用场景微调模型,使其比通用的 Clef 模型更准确、更快速。我们已经在与内部团队合作,研究如何对 Clef 进行后训练,以创建强大的 ML 模型,扩大我们的影响力并改进 Cloudflare 内部各处的工作流。这些内部团队及其使用场景,正是我们新 FDE 微调团队接下来负责的重点,也是我们强化学习(RL)产品的基础。

我们的新 RL 服务

我们将提供一项服务,由我们的 FDE 团队亲自协助客户微调 Clef,使其适应客户的工作负载。在此过程中,我们会从亲身实践中积累经验,进而构建一个自助式平台,让客户能够在 Cloudflare 上完成数据采集、模型微调和重新部署。

实际上,这项工作已经酝酿了很长时间——我们一直在构建 AI 平台,完善必要的基础能力,以便开发定制 RL 产品。Jev 引发的兴趣表明,市场需要一种快速、小型、专用的分类器模型,而我们选择以此作为切入点,开始试验 RL 环境。

为此,我们利用 Cloudflare 平台上已经构建的基础能力:

Cloudflare AI Gateway——将所有 AI 流量通过 AI Gateway 传输,并自动创建针对特定使用场景的请求数据集。

Cloudflare Workers AI——针对基础 Clef 模型生成 rollout。

Cloudflare Containers——用于为智能体动作评分并重放这些动作的 RL 沙箱。

[NEW] Trainer——更新微调后的 Clef 模型权重

Cloudflare Workers AI + BYO Model——在 Workers AI 上重新部署微调后的模型

这项工作整合了我们正在开发的 AI Platform 中的几个在研部分,包括 AI Gateway,它能够捕获 AI 流量,让你可以利用自己的请求/响应数据;用于 RL 沙盒的 Containers;以及 Workers AI 的 Bring Your Own Model(Cog)项目。自从我们收购 Replicate 以来,该项目一直在持续推进。

立即试用

今天,我们很高兴推出 Workers AI 团队训练的首个 Cloudflare 机器学习模型。我们目前仍处于早期阶段,未来还会有许多改进,但这款模型很好地展示了 AI Platform 团队一直以来辛勤工作的成果。我们相信,Clef 有能力颠覆我们使用智能体的方式,而这也与 Cloudflare 致力于成为“智能体云”的使命天然契合。

如果你有具体的使用场景,并且已经是这些产品的客户,我们很乐意与你交流,也欢迎你在我们探索这一领域的过程中成为设计合作伙伴。

你可以试用托管在 Workers AI 上的 Clef 模型;如果想自行探索,也可以在 Hugging Face 上下载模型权重。如果你有希望我们协助的微调使用场景,也欢迎联系我们。

我们的机器学习团队正不断扩大影响力,工作范围涵盖模型优化和模型训练研究。如果你有兴趣加入我们的使命,请查看我们的开放职位。

来源与参考

  1. 原始链接
  2. Introducing Clef: our open-source decision models, and new RL fine-tuning platform

收录于 2026-10-02