你有没有想过,让大模型帮你拿个主意,其实挺浪费的?
这几个月我拿智能Agent与大模型实战全栈课程干活干得挺密,有个坎儿一直绕不过去。它写东西是真行,可一旦让它在几个答案里挑一个,就开始飘。
比如说客服那边进来一张工单,得判急不急、派给哪个组、严重到什么程度。你把这活儿丢给大模型,它会回你一大段话,你还得自己从里头把答案抠出来。
抠出来还不一定对。

所以前几天看到 Cloudflare 开源的东西,我愣了一下。
他们发了一对叫 Clef 的模型,这两个模型不写字。
你给它一段内容,再给它一串备选答案,它直接给你每个答案的概率。哪个高,你就选哪个。
发布就在 10 月 1 号,Apache 2.0 协议,权重挂在 Hugging Face 上,能自己部署。
它到底是个什么东西
官方的说法是把这类模型放在两个极端中间。
一头是大模型,什么都能干,但输出飘、还慢。另一头是传统分类器,快,但每加一个新类别就要重新训练一轮。
Clef 想卡的位置是:又快,又能随时加新选项。
它接受三种问法:
- 是或否(布尔判断):这段内容算不算紧急?要不要人工介入?只给一个概率。
- 选一个(多选一):这份工单该给计费组、技术组还是销售组,每组一个概率。
- 打分(分级评估):影响程度从无到轻微到严重到危急,在有序档次里给一个分。
一次请求最多能带 64 个问题,一起过一遍,分别给结果。
那点“不写字”的讲究
这是我觉得最值得说的一个点。
大模型给概率的方式,是先把答案写成一句话,再从它下一个词会是什么的分布里,把“信心”估出来。这个估法本身就不太准。
Clef 换了个做法:不动底座模型的权重,只在它外面接一套额外组件,直接从模型内部的运算结果里,把每个选项的概率推出来。

它凭什么敢这么做?因为它压根不用一个字一个字往外蹦。走完一遍底座,所有选项一次性并行算完,随时可以停。
快,就是因为它不写字。
听起来像是一个很细的工程差别,但对智能体来说,这个差别决定了一件事:拿到的结论是不是可信的。
你知道它说 90%,是不是真的十次里对九次。这个叫校准。它训练的时候专门冲着这个词去的。
和对手比一比
- 对这个赛道的头部——快一个量级:这类模型最早是 TypeSafe AI 的 Jev 做的,9 月中旬。Cloudflare 报的中位延迟,Jev 是 524 毫秒,Clef 209 毫秒,轻量版 39 毫秒。
- 对闭源 API——能自己部署:Jev 只给 API,权重不开。Clef 是 Apache 2.0,权重在 Hugging Face,想自己跑也行。
- 大模型与Agent开发全栈实战课程提到的那些大模型——输出是结构化的:让 27B 模型写一段 JSON,等于你在为一个它用不到的写话能力付钱。Clef 直接给选项和概率,下一段代码拿到就能用。
归到一处,它把“这一步该往哪走”从一段话,变成了一个数。
那它强在哪、弱在哪
得罪人的那半句我先撂下:它不是什么活都能接。
Cloudflare 自己公布了 43 个基准的成绩。工单分类这类“归类”的活,它领先明显;可要是考“模型本身知不知道这件事”,Jev 照样赢它,比如 GPQA Diamond 和 MMLU-Pro 这两个测试。
这么讲吧,它擅长把到手的东西分好类,不擅长凭记忆回答知识问题。
- 自己跑门槛不低——要看显卡:轻量版自己部署要 85GB 显存,标准版要 41GB 起步。要么上多卡,要么大内存的 Mac。
- 价格没明说——得等:官方公告里没写价格,网上流传的数字都是二手来源,别急着当准数。
- 微调还不是自助的——得排队:配套的强化学习微调服务,前期是 Cloudflare 的工程师带着做,自助平台说以后才上。
- 你还得会写提示——不是装上就好:每个选项的说明文字怎么写,直接决定它判断准不准,得拿真实数据小样本调。

它解决的是“这一步选哪个”的问题,解决不了“下一步该干什么”的问题。这两件事,别混。
怎么开始用
最简单的路子是在 Cloudflare 自己的 Workers AI 上调用,模型名就一个 ID,把内容和一个问题清单丢过去,拿回一组带类型的概率。
因为它跟 Jev 的接口是兼容的,如果你手上已经有调 Jev 的代码,换个地址和模型名,大概率就能跑。如果你平时也折腾各类模型 API 的接入,RouteFast.ai 这种中转站也能帮你快速对比不同模型的调用体验,不过 Clef 本身还是得走 Cloudflare 或自部署路线。
想自己部署,权重在 Hugging Face 上,模型卡里写了测试用的是单张 H200、BF16 精度。这个只是它的测试环境说明,不是硬性要求。
我为什么觉得这件事值得盯
我盯这个,不是因为它模型有多强,是它踩在了一个我觉得会越来越大的方向上。
智能体干活,拆开看就两种动作:写,和选。写这件事,现在模型已经很能打了。选这件事,一直被含糊地塞在“写”里头凑合。
而现在有人把它拎出来,单独做成了一个东西。
这件事发生得很密:9 月 30 号 Liquid AI 发了 d1,10 月 1 号 Cloudflare 和亚马逊同一天都发了。八天之内三家进场,全都指向同一个判断。
Cloudflare 这次最狠的一手是把权重开源了。这个赛道以前是闭源 API 的地盘,第一次有了能自己抱回家的一份。
名字也起得有意思。Clef 是五线谱上那个“谱号”,跟对手 Jev 的发音还挺像,大概不是巧合。
这类决策模型的开源,对做智能体的人来说是个值得持续关注的信号。如果你也在折腾 Agent 相关的技术选型,云栈社区上有不少同好在聊大模型落地的实际踩坑经验,比一个人闷头试要省时间得多。