找回密码
立即注册
搜索
发回帖 发新帖

6493

积分

0

好友

815

主题
发表于 10 小时前 | 查看: 2| 回复: 0

一条客服消息该交给哪个部门,一张发票是否需要复核,网页上应该选择哪个目标——这些都是软件自动化中的决策问题。

Jev 把这类判断做成可直接调用的模型接口,开源社区也提供了多种实现。对于希望私有化部署的团队,问题随之变成:哪些模型适合自己的业务,接口相近的模型能否互相替代?

本文比较模型的判断质量、概率表现与视觉能力,给出不同业务场景下的私有化首选建议。本地模型运行在昇腾 910B3,Jev API 作为同题托管参照。

01 什么是决策模型

2026 年 9 月 15 日,TypeSafe 发布 Jev,将 System One 模型定位为供软件调用的判断能力:输入文本或程序状态,返回结构化答案与概率。Jev 发布介绍

例如处理工作群消息,程序先定义“紧急处理、我的待办、有用资料、无需处理”四个出口。模型结合消息内容和职责判断属于哪一类,程序再根据结果创建待办、保存资料,或继续等待。

这类接口主要提供三种判断:

判断类型 回答什么 软件怎样使用
Choice:选项选择 这条消息应归入哪一类 路由到相应处理分支
Noul:是非判断 是否需要人工复核 按概率决定复核或继续
Score:评分 风险、紧急程度属于哪个档位 排序或设置处理优先级

工作流仍由程序控制,模型负责其中需要语义理解的判断。已知规则和精确计算可以继续交给代码;模型的价值在于处理“任务指向谁”“请求是否已取消”这类难以穷举的含义。

围绕这一方向,开源社区已经形成多种路线,包括 decider、Laya、JEV-27B-VL 等。它们可以提供相似的决策接口,但基础模型、训练方式、参数规模和图像能力并不相同。接口能接上,只是比较的起点。decider 模型卡、Laya 模型卡

Hugging Face 上的 Jev Decision Index 汇集了多种实现,提供文本与视觉榜单。视觉榜单展示了不同规模与实现路线的候选,完整列表见榜单链接。

Hugging Face Jev Decision Index 视觉榜单,展示不同参数规模与实现路线的决策模型

数据来源:Jev Decision Index 视觉榜,图为 2026 年 10 月 9 日的 0.3.1 版快照。榜单会更新,选型时应核对对应版本。

榜单将公开视觉基准与同能力私有测试各占一半,并修正随机猜测水平。它适合帮助发现候选;这个综合分不能直接当作准确率,也不能代替自己的业务测试。

02 决策模型用在哪里

决策模型适合嵌入判断目标明确、候选范围可定义的软件流程。不同场景关心的错误,也不相同。

使用场景 模型负责的判断 验收重点
消息与客服分流 是否需要处理、属于哪个意图、交给谁 误派、漏派与语言理解
发票与安全审核 是否异常、是否复核、风险等级 多项判断的一致性
Agent 监控 继续、停止、观察还是人工接管 约束与上下文理解
规则与政策判断 多个条件同时成立时应选哪个分支 复杂条件、高置信度错误
图表与网页理解 从图像中读数或选择目标元素 图片是否提供有效信息

以客服为例,一次请求可能既要选部门,又要判断紧急程度和是否人工介入。三个结果都会影响后续流程,单项准确率高不代表整组判断都可靠。

再看工作群:把无需处理的消息派成待办,会制造额外任务;漏掉真正紧急的消息,又会延误处理。因此验收不能只看总体准确率,还要看错误发生在哪个分支。

模型返回概率,也为自动处理与人工复核的分工提供了信号。但“概率高”并不保证答对,阈值需要在独立业务数据上验证。高置信度错误和处理覆盖率,是后文横评的两个关注点。

03 私有化选型:为什么比较这些模型

私有化首先需要明确三个条件:处理文本还是图像,输入包含多长的上下文,需要完成哪些类型的判断。随后才是权重、接口和运行资源能否满足部署要求。

开源决策模型数量很多,本文选择的候选覆盖了几种有代表性的取舍:较小的编码器、多个尺寸的语言模型、专项训练,以及多模态决策。Jev API 则作为托管方案的同题参照。

候选 纳入比较的理由 参评范围
Jev API 比较托管服务与本地模型的实际判断差异 固定 1.13.0
decider 多个参数规模与基础模型,便于观察能力和资源的取舍 七个文本版本、2B 视觉版
Laya 较小编码器路线,并有语言版与专项版 English、Multilingual、Typed
JEV-27B-VL 图像与文本决策,覆盖图表和网页输入 基于 Qwen3.8-27B 的固定权重

Laya 采用编码器与决策头,其三个版本为语言与专项训练提供了对照。JEV-27B-VL 采用多模态基础模型与决策适配器,支持图像输入;它与托管 Jev 是分别测试的对象,名称相近不代表权重相同。

decider 参评版本为 0.8B、2B、4B、12B、chat Qwen 27B、chat Gemma 31B、35B-A3B 与 2B vision。B 表示十亿参数,两个 chat 版本使用聊天模型权重与决策读出。它们的架构、训练和配置同时变化,不能把横评当成只改变参数量的缩放实验。

这组候选均已完成本次昇腾部署与请求验证,也能接收相应的固定决策输入。选择范围覆盖不同实现路线,权重、软件版本与输入限制见复现资料。

部署环境为昇腾 910B3,单卡 64GB;27B、31B、35B 使用两卡,其余一张,无权重 CPU 卸载。decider 与 Laya 使用 SDK,JEV-27B-VL 使用 BF16、TP2、eager 的 vLLM-Ascend 服务。Jev API 通过远程接口调用。

04 不同场景下的实测表现

测试覆盖中文消息、意图与语义理解、结构化工作流、英文复杂规则,以及图像输入。文本任务保持状态、问题与候选顺序一致,参考答案不进入请求。

每种场景单独比较,不合成总分。模型能否替代 Jev,要看它承担的具体判断。

13 个版本在中文判断、工作流与英文困难题上的统一实测对照

4.1 中文消息与用户意图

工作群消息经常同时包含职责、线程上下文和任务变更。例如“取消修复,同时分享排障文档”,行动已经取消,资料仍可能有用。验收时要区分“理解这段话”与“把它派到正确出口”:把资料丢弃、把无需行动的消息派成待办,都会影响后续自动化。

意图分类与语义推断要求的判断也不同。前者从预设类别中选择用户目的,后者判断一句话是否支持、反驳或无法推出另一句话。私有化选型应分别准备这些样本,避免用一个中文任务代替全部中文能力。

图中中文意图来自 MASSIVE 的候选子集,每题包含参考意图与干扰项,不能解释为完整意图空间的分类效果。工作群为社区合成数据;真实业务还应加入自己的职责、消息习惯与线程上下文。

4.2 英文工作流:客服、发票、安全与 Agent

工作流中的一次请求,往往要回答多个问题。以 Agent 轨迹为例,输入包含任务、约束、工具错误和不可逆操作,模型分别判断后续动作、是否人工复核、执行结果、风险与紧急程度。

五个代表版本在客服、发票、安全事件与 Agent 轨迹上的参考标签一致率

本组状态与问题使用英文,比较的是与合成教师参考标签的一致性。Laya Typed 使用过对应数据集的训练集,专项训练的效果需要在独立业务样本上确认。通用版本与专项版本的取舍,应从任务范围和训练接触出发判断。

验收多项判断时,先定义整例通过条件。例如“部门选对”却“漏掉人工复核”,仍可能让流程进入错误分支。逐项一致率不能代替整例可靠性,也不能解释为真实业务执行成功率。

如果程序要按概率设置复核阈值,还要看概率分布。下图的 Brier 衡量预测分布与教师参考分布的平方误差,越低越接近参考;它与“最大概率的类别是否选对”衡量不同方面。

原生接口 12 个版本的工作流软标签 Brier

JEV-27B-VL 的评分题通过选择评分档位适配,能够比较最终档位,却不等同于原生 Score 接口,因此不参与这张概率指标图。接近教师分布,也不代表真实业务的概率已经校准。

4.3 长规则与复杂条件

长规则判断需要同时处理条件优先级、时间数值、例外与冲突。业务中常见于资格审核、政策适用和权限判断:关键词相同,条件组合不同,处理分支就可能不同。

13 个版本在英文困难题上的准确率及高置信度保留数量与错误数量

这组题来自第三方 JevBench 的公开合成题库,与 TypeSafe 官方评测不同。公开题可能存在训练接触,适合发现候选;正式验收应使用未公开的业务规则与边界案例。

用于自动执行时,需要把覆盖率与高置信度错误一起看。提高阈值会减少自动处理量;保留下来的请求仍可能答错。只看错误数,容易把“几乎不处理任何请求”误认为可靠。

上图的高置信度列用于固定条件下诊断。部署前,应按误判代价与人工复核容量,在独立样本上选择阈值;涉及不可逆操作时,还应保留程序约束与人工接管路径。

4.4 图片问答、图表与网页选择

视觉测试采用同题有图 / 无图对照,保留文字条件,只改变是否提供图片,用来检查图像是否提供额外信息。

图片问答、图表判断和网页选择的有图无图对照

图片问答要求结合图中内容选择答案;图表判断还要区分“需要读数”与“答案不适用”,否则无需读图的题会掩盖数值理解能力。图中因此单列数值题。

网页测试预先给出目标与可见干扰元素,模型结合元素文本、历史动作和首屏截图选择候选。它检验的是已有候选下的目标判断,完整网页任务还需要滚动、定位、执行与失败恢复。

两个视觉模型使用不同题库,图中只能作各自内部的图片增益比较。选视觉模型时,应让候选处理同一批业务图片,再评估图像分辨率、文本与图像的配合,以及实际动作结果。

4.5 多模态应用:照片、图表与网页

图片进入决策流程后,模型需要把可见内容与当前问题对应起来。下面三个案例来自本次测试的原始图片与真实响应,分别展示文字识别、图表结构理解和网页目标选择。

照片中的文字识别

输入照片与候选名称,让模型判断车身标牌写的是什么。这样的判断可嵌入标签核验、商品分类等流程;程序先定义候选,模型根据图像选择,再由程序处理对应分支。

decider vision 2B 根据真实公交车照片识别标牌文字,展示原始输入与实际选择概率

图表中的结构理解

图表不仅包含数值,还包含坐标轴、图例与多个系列。这里的问题是数图例标签,需要先理解问题指向哪一部分,再读取图中信息。用于报告审核时,也应把需要核验的对象明确写进问题。

JEV-27B-VL 根据原始科研图表识别图例标签,展示问题与实际响应

网页中的目标选择

租车流程已经进入选车页面,任务要求选择最低租金的车辆。多个按钮都写着“Select Truck”,仅凭按钮文字难以区分;截图提供了车辆、价格与按钮的对应关系,模型结合已有操作选择目标元素。

JEV-27B-VL 根据租车网页截图与任务状态选择目标按钮,展示真实候选与实际返回概率

这类应用的流程是:程序提供图片、任务状态与候选,模型返回选择,程序执行动作并检查结果。网页案例只测试其中的目标选择步骤。三个案例用于展示输入和输出的关系,整体能力仍应结合前面的完整测试结果判断。

4.6 候选顺序与调用稳定性

选项的显示顺序通常不应改变语义判断。下图保持消息与问题不变,只反转候选顺序,观察最终类别是否变化。

12 个版本在工作群候选换序后的类别变化数

相同输入重复调用,检查的是重复稳定性;改变候选顺序,检查的是判断是否依赖排列。两种检查都应该纳入上线验收,不能互相替代。JEV-27B-VL 未运行这组换序协议,不能据此评价其表现。

验收前还应核对候选编码与输入截断,确保程序传入的内容完整、换序前后的选项含义一致。

05 私有化部署:具体选哪个

中文文本业务,默认从 decider 4B 开始;复杂英文规则优先试 chat Gemma 31B;图表和网页截图判断优先试 JEV-27B-VL。固定英文结构化工作流,可优先验证 Laya Typed。

这是结合本次任务表现与部署规模给出的试用优先级。先选一个最符合业务的版本,用自己的样本验收判断质量,再决定是否接入自动处理。

5.1 首选模型与切换条件

业务需求 首选 什么时候换
中文意图、语义判断与一般消息分流 decider 4B 工作群路由验收不通过,优先对照 12B
职责、任务取消、上下文较复杂的工作群路由 decider 12B 资源有限时先试 4B,按误派与漏派决定
英文长规则、例外与冲突条件 chat Gemma 31B 两卡部署资源不足时,先验证 12B 能否满足要求
图表与网页截图判断 JEV-27B-VL 只做较简单的图片问答、资源有限时,先试 decider vision 2B
固定英文客服、发票、安全与 Agent 状态判断 Laya Typed 独立业务样本不通过,改试 chat Gemma 31B 或 12B

为什么默认从 4B 开始?它在本次中文意图与语义判断中具有竞争力,模型规模也便于作为第一套本地服务落地。选择它是为了先验证最常见的中文文本需求。工作群路由更看重职责与上下文时,12B 是更值得优先对照的版本;从 4B 升到 12B 应由这些业务错误驱动。

复杂规则与视觉分别选。chat Gemma 31B 的优先级来自本次英文困难题与工作流表现,中文复杂规则仍需另行验收。JEV-27B-VL 则已有图表和网页同题视觉对照,适合作为这两类任务的首选;decider vision 2B 可以作为轻量图片问答起点,其图表与网页能力尚未取得同题对照结果。

Laya Typed 适合任务固定的英文专用流程。本次工作流与其专项训练范围接近,需要在独立的同类业务样本上验收。中文工作群分流优先用 decider 验证;语言版与专项版承担的任务范围不同,应分别选用。

资源方面,本次 4B、12B、Laya 与 vision 2B 均使用单张 64GB 昇腾卡,chat Gemma 31B 与 JEV-27B-VL 使用两张。这些是本次跑通的配置;实际显存需求还取决于精度与输入长度。

已有 Jev API 且没有私有化要求的团队,可以继续使用托管服务。需要数据留在本地或定制处理流程时,再按上述场景选择本地模型。

5.2 从试用到上线

先用真实样本确定模型能否理解任务,再检查误派、漏派和高置信度错误;对多个判断组合的流程,验收整例结果。随后核对输入长度、候选顺序、概率与失败行为,明确哪些分支可以自动处理、哪些需要人工复核。

实践中可以先将选定模型接入影子流量:保留原处理结果,只记录模型的选择与概率,检查误派、漏派和整例失败。验收通过后,再开放低风险分支的自动处理;高风险或不确定请求保留人工复核。这样能把上面的首选建议逐步变成部署方案。

数据来源与复现

工作群来自 Laya 社区 feishu_zh,由 AI 辅助编写;工作流使用 typed-decisions 的完整 test;困难题采用第三方 JevBench。这些合成数据的结果需要独立业务验证。

中文意图与语义推断分别取自 MASSIVE、XNLI 的中文公开子集;视觉案例取自 Visual7W、CharXiv 与 Multimodal-Mind2Web。图表与网页任务适配为固定候选选择,具体抽样与问题适配见复现资料。

SDK 本地版本与 Jev 的工作群任务重复三次,质量取第一次;其余质量测试各一遍。Jev API 一次 HTTP 529 留在准确率分母,不补测挑答案;概率误差只统计有效响应。各任务的样本量见图,完整调用记录与评分协议见复现资料。

冻结请求、原始响应、权重版本与计分脚本见 decider / Laya / Jev 复现 和 JEV-27B-VL 昇腾适配。

结果仅适用于所列模型、配置与样本,不代表通用能力或生产可靠性。更多部署细节与复现讨论可访问云栈社区。




上一篇:Minecraft运营17年销量4.25亿,新维度The Sift如何撑起长线生命力
下一篇:GPUStack 决策路由实战:Jev 如何分流 Qwen3 与 DeepSeek
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-11 19:10 , Processed in 0.062330 second(s), 40 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表