Cloudflare 开源决策模型 Clef:八天四款,Agent 的「选择」开始不交给大模型了

Cloudflare 开源决策模型 Clef 与 Clef-flash:Agent 的选择不再交给大模型

10 月 1 日,Cloudflare 开源了两个「决策模型」:Clef 和 Clef-flash。它们不写文章、不聊天,只做一件事——你给它一段输入和一组候选答案,它返回每个答案的概率。同一周里,亚马逊、Liquid AI 也各自发布了同类模型。八天之内,这个品类出现了四款产品。

对做 Agent 的人来说,这件事的分量不在于又多了两个模型,而在于「该让大模型做什么」这条边界,第一次被厂商明确地划了一道线。

一、事实梳理:Clef 到底是什么

先把能核实的信息摆出来(来源:Cloudflare 官方博客与开发者文档,10 月 1 日):

  • 两个规格。Clef 27B(基于 Qwen3.8-27B),Clef-flash 9B(基于 Qwen3.5-9B)。均为 Apache 2.0 开源,权重发布在 Hugging Face,同时托管在 Cloudflare Workers AI 上。
  • 只出概率,不出文本。支持三种提问形式:是非题、单选题(给选项带置信度)、量表打分。一次请求最多携带 64 个问题,最多 4 张图片。没有自由文本,也就没有「解析 JSON 失败」这一类问题。
  • 延迟。中位延迟 Clef 209.3ms、Clef-flash 38.8ms,官方对比对象是决策模型 Jev 的 524.1ms;上下文窗口 64K。
  • 基准成绩有领先也有落后。官方自报在 43 组测试中,Clef 系在 10 项决策基准里 7 项最高——比如 BANKING77 拿到 94.20(Jev 79.74)、工具选择基准 BFCL 98.5%。但在 GPQA Diamond、MMLU-Pro 这类考「知识」的基准上,它明显落后于 Jev。这组数字要注意:全部是厂商自报,暂无独立复现。
  • 价格未公布。官方只指向定价页,目前流传的每百万 token 单价来自二手报道。
  • 配套服务。Cloudflare 同时推出基于强化学习的微调服务(先由工程师驻场,后续开放自助平台),并称内部会用它做滥用举报审核、支持工单分诊、判断爬虫好坏。

二、八天四款:一个新品类的成形

  • 9 月 15 日,TypeSafe AI 发布 Jev,提出「决策模型」这个概念;
  • 9 月底,OpenAI 推出 Decisions API(基于 GPT-6 Luna);
  • 9 月 30 日,Liquid AI 发布 d1;
  • 10 月 1 日,亚马逊发布 Strands Decider 2B,Cloudflare 发布 Clef 与 Clef-flash。

四家在同一周押同一个方向,而且论证是同一句话:让一个 27B 模型去「写」一段 JSON,是在为一个它根本没用到的能力付钱。Clef 还兼容 Jev 的接口,迁移只改端点和模型名——连迁移成本都被算进了竞争里。

值得一提的是,Cloudflare 是这批玩家里第一个把权重开放出来的。这和站内此前讨论过的 Cloudflare 爬虫治理策略 是同一条思路:先用开放降低采用门槛,再用托管和微调服务收钱。

三、影响分析:Agent 的架构会怎么变

  1. 「生成」和「选择」开始分工。一个 Agent 里真正需要「写」的步骤其实很少,绝大多数步骤只是在「选」——选工具、选分类、选是否升级、选该不该拦。过去这些都用同一个大模型干,现在多了一层:分诊台用小模型,主治医生用大模型。
  2. 概率让「自动化阈值」第一次有依据。决策模型不只给答案,还给置信度,而且做了校准(官方训练里用了 Brier loss 与 RLCD 来对齐概率与实际正确率)。这意味着「置信度低于 0.7 就转人工」这类规则,终于有了可执行的输入,而不是拍脑袋。这比单纯省成本重要得多。
  3. 延迟从「等待」变成「无感」。38.8ms 的决策,用户感知不到。有些过去因为太慢而不值得做的实时判断(每条请求都过一遍安全过滤、每条消息都先分诊),现在变得可行。
  4. 成本结构会重排。若决策步骤被剥离出去,Agent 的 token 花费会明显向「真正需要生成」的部分集中。这和 缓存优化 是同一个方向:把不该花的钱省下来。
  5. 对工具选择这类难题是直接利好。BFCL 98.5% 的工具选择成绩,正好对上了工具数量膨胀这个老问题——把一个「选哪个工具」的判断交给专门做选择的模型,比让大模型在一长串工具描述里挑更稳,机制可参考 Function Calling 那篇。

四、老达点评

第一,别被「开源」两个字带跑。权重的确开放了,但真正的生产级服务还是在 Cloudflare 的托管上跑,微调服务也先走驻场。开源在这里主要作用是降低试用门槛,不是让你免费自建。

第二,看清它的能力边界。Clef 在「归类」和「分诊」上很强,在「需要知道点什么才能判断」的任务上明显弱。所以它不是大模型的替代品,是前置过滤器。把需要知识的判断硬塞给它,只会错得又快又自信。

第三,真正值得现在动手的,是先把「你的 Agent 里哪些步骤其实只是在选」列出来。列完之后你会发现,能剥离的比例比想象的高;如果比例很低,那说明你的 Agent 还太「重」,值得先按 评分器与判断设计 那套思路把判断逻辑理一遍。

第四,价格没公布之前,任何「成本降多少」的说法都先打个问号。一个以「每次决策成本」为卖点的产品,把价格留到后面说,本身就是个信号。

五、总结

  1. 事实:10 月 1 日 Cloudflare 开源 Clef(27B)与 Clef-flash(9B),输入 + 候选答案 → 概率输出,中位延迟 38.8–209.3ms,Apache 2.0,兼容 Jev 接口。
  2. 趋势:八天内四款决策模型(Jev、OpenAI Decisions API、Liquid d1、Strands Decider 2B、Clef),「选择」被从「生成」里拆出来成为独立品类。
  3. 影响:Agent 架构走向「小模型分诊 + 大模型主治」;概率校准让自动化阈值可执行;延迟和成本结构都会重排。
  4. 边界:知识型判断仍打不过大模型;价格未公布;基准是厂商自报。
  5. 建议:先盘点自己 Agent 里「只选不写」的步骤,再决定要不要接。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *