找回密码
立即注册
搜索
发回帖 发新帖

6219

积分

0

好友

787

主题
发表于 16 小时前 | 查看: 5| 回复: 0

你有没有想过,让大模型帮你拿个主意,其实挺浪费的?

这几个月我拿智能Agent与大模型实战全栈课程干活干得挺密,有个坎儿一直绕不过去。它写东西是真行,可一旦让它在几个答案里挑一个,就开始飘。

比如说客服那边进来一张工单,得判急不急、派给哪个组、严重到什么程度。你把这活儿丢给大模型,它会回你一大段话,你还得自己从里头把答案抠出来。

抠出来还不一定对。

Cloudflare Clef 决策模型对比传统大模型输出方式:一个写长文需要人工提取,一个直接给概率可用代码消费

所以前几天看到 Cloudflare 开源的东西,我愣了一下。

他们发了一对叫 Clef 的模型,这两个模型不写字。

你给它一段内容,再给它一串备选答案,它直接给你每个答案的概率。哪个高,你就选哪个。

发布就在 10 月 1 号,Apache 2.0 协议,权重挂在 Hugging Face 上,能自己部署。

它到底是个什么东西

官方的说法是把这类模型放在两个极端中间。

一头是大模型,什么都能干,但输出飘、还慢。另一头是传统分类器,快,但每加一个新类别就要重新训练一轮。

Clef 想卡的位置是:又快,又能随时加新选项。

它接受三种问法:

  • 是或否(布尔判断):这段内容算不算紧急?要不要人工介入?只给一个概率。
  • 选一个(多选一):这份工单该给计费组、技术组还是销售组,每组一个概率。
  • 打分(分级评估):影响程度从无到轻微到严重到危急,在有序档次里给一个分。

一次请求最多能带 64 个问题,一起过一遍,分别给结果。

那点“不写字”的讲究

这是我觉得最值得说的一个点。

大模型给概率的方式,是先把答案写成一句话,再从它下一个词会是什么的分布里,把“信心”估出来。这个估法本身就不太准。

Clef 换了个做法:不动底座模型的权重,只在它外面接一套额外组件,直接从模型内部的运算结果里,把每个选项的概率推出来。

Clef 模型四步推理流程:内容状态、底座单程、选项并行打分、输出校准概率

它凭什么敢这么做?因为它压根不用一个字一个字往外蹦。走完一遍底座,所有选项一次性并行算完,随时可以停。

快,就是因为它不写字。

听起来像是一个很细的工程差别,但对智能体来说,这个差别决定了一件事:拿到的结论是不是可信的。

你知道它说 90%,是不是真的十次里对九次。这个叫校准。它训练的时候专门冲着这个词去的。

和对手比一比

  • 对这个赛道的头部——快一个量级:这类模型最早是 TypeSafe AI 的 Jev 做的,9 月中旬。Cloudflare 报的中位延迟,Jev 是 524 毫秒,Clef 209 毫秒,轻量版 39 毫秒。
  • 对闭源 API——能自己部署:Jev 只给 API,权重不开。Clef 是 Apache 2.0,权重在 Hugging Face,想自己跑也行。
  • 大模型与Agent开发全栈实战课程提到的那些大模型——输出是结构化的:让 27B 模型写一段 JSON,等于你在为一个它用不到的写话能力付钱。Clef 直接给选项和概率,下一段代码拿到就能用。

归到一处,它把“这一步该往哪走”从一段话,变成了一个数。

那它强在哪、弱在哪

得罪人的那半句我先撂下:它不是什么活都能接。

Cloudflare 自己公布了 43 个基准的成绩。工单分类这类“归类”的活,它领先明显;可要是考“模型本身知不知道这件事”,Jev 照样赢它,比如 GPQA Diamond 和 MMLU-Pro 这两个测试。

这么讲吧,它擅长把到手的东西分好类,不擅长凭记忆回答知识问题。

  • 自己跑门槛不低——要看显卡:轻量版自己部署要 85GB 显存,标准版要 41GB 起步。要么上多卡,要么大内存的 Mac。
  • 价格没明说——得等:官方公告里没写价格,网上流传的数字都是二手来源,别急着当准数。
  • 微调还不是自助的——得排队:配套的强化学习微调服务,前期是 Cloudflare 的工程师带着做,自助平台说以后才上。
  • 你还得会写提示——不是装上就好:每个选项的说明文字怎么写,直接决定它判断准不准,得拿真实数据小样本调。

Cloudflare Clef 模型 43 项基准测试成绩分类:分类任务领先、知识问答落后、部署门槛看显卡

它解决的是“这一步选哪个”的问题,解决不了“下一步该干什么”的问题。这两件事,别混。

怎么开始用

最简单的路子是在 Cloudflare 自己的 Workers AI 上调用,模型名就一个 ID,把内容和一个问题清单丢过去,拿回一组带类型的概率。

因为它跟 Jev 的接口是兼容的,如果你手上已经有调 Jev 的代码,换个地址和模型名,大概率就能跑。如果你平时也折腾各类模型 API 的接入,RouteFast.ai 这种中转站也能帮你快速对比不同模型的调用体验,不过 Clef 本身还是得走 Cloudflare 或自部署路线。

想自己部署,权重在 Hugging Face 上,模型卡里写了测试用的是单张 H200、BF16 精度。这个只是它的测试环境说明,不是硬性要求。

我为什么觉得这件事值得盯

我盯这个,不是因为它模型有多强,是它踩在了一个我觉得会越来越大的方向上。

智能体干活,拆开看就两种动作:写,和选。写这件事,现在模型已经很能打了。选这件事,一直被含糊地塞在“写”里头凑合。

而现在有人把它拎出来,单独做成了一个东西。

这件事发生得很密:9 月 30 号 Liquid AI 发了 d1,10 月 1 号 Cloudflare 和亚马逊同一天都发了。八天之内三家进场,全都指向同一个判断。

Cloudflare 这次最狠的一手是把权重开源了。这个赛道以前是闭源 API 的地盘,第一次有了能自己抱回家的一份。

名字也起得有意思。Clef 是五线谱上那个“谱号”,跟对手 Jev 的发音还挺像,大概不是巧合。

这类决策模型的开源,对做智能体的人来说是个值得持续关注的信号。如果你也在折腾 Agent 相关的技术选型,云栈社区上有不少同好在聊大模型落地的实际踩坑经验,比一个人闷头试要省时间得多。




上一篇:订单结算系统同步改异步实践:从字节年薪60万的薪酬结构说起
下一篇:15万星的ponytail:用"七级台阶"让AI智能体少写54%的代码
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-5 22:55 , Processed in 0.068167 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表