找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

6031

积分

1

好友

762

主题
发表于 3 天前 | 查看: 3| 回复: 0

模型圈热闹,评测圈最近也不消停。前段时间 HarnessEval 发布,AI 工程圈讨论了好一阵子。它的主张说出来挺有意思——评测本身,也应该是一个会推理的智能体。

仔细研究下来,这套系统的路子是:用一条四步推理链(Plan → Route → Decompose → Verify)替代传统的固定规则打分,最后输出的不是一个分数,而是一棵证据树(Evidence Tree)。每一个判定都能往回追到具体证据,而不是黑箱里蹦出来的一个数字。

Agentic Evaluation流程图:模型输出经技能库分发至评估工具并生成技能证据

为什么这个方向值得关注?回想以前,我们评测模型基本就是固定规则跑分:出题、答题、对答案、算分。

这套逻辑在被测对象还是「问答机器」的时候没什么问题。但如今情况不一样了,被评测的对象自己都会推理、规划了,你还拿固定规则去套,就像用小学试卷考大学生——不是不能考,是考不出真实水平。

所以火,是有道理的。但我越琢磨越觉得,这事它只解决了一半。

Benchmark 高分的智能体,到了真实业务里照样翻车

HarnessEval 走的是学术路线:让评测系统本身变得更聪明。它回答的问题是「这个模型够不够强?推理对不对?」。但在企业生产环境里,问题完全是另一个维度。

一个在 Benchmark 上分数很好看的 智能体,放到真实业务里,会犯两种让人措手不及的错误。

第一种,答案看着没毛病,过程已经失真了。举个例子,一个 AI 用户研究系统,招募了 8 位背景迥异的受访者,跑完访谈一看,8 个人给出的答案几乎一模一样——连理由和用词都可以互换。你说模型答错了吗?没有。但它模拟的人类行为已经失真了,这份研究报告等于白做。

第二种,最终结果里混进了不存在的东西。比如报告里引用了一句「受访者说过的话」,你翻遍所有访谈记录,没有一个人说过这句话。这不是模型能力不行,而是执行链路中间某个环节产生了幻觉,然后一路传导到了最终交付物里。

这两类翻车有个共同点:它们不会出现在任何公开 Benchmark 上。只有智能体跑完一个真实项目、人类专家坐下来审查结果之后,才会暴露出来。

所以企业级评测真正的难题是:不能只看最后输出对不对,还要能把问题追溯到最早出错的那一步。

国内有个团队的做法,我觉得挺有意思

在这方面,国内已经有团队在做系统性的探索了。仔细看了下特赞科技 GEA 的评测方案,它有几个地方跟主流做法不太一样,值得拆开聊聊。

特赞智能体可靠性与评测产品页面

第一个反直觉的点:它不先定指标,先收专家的吐槽。

传统思路是先设计 评测指标——准确率、召回率、相关性分数——然后让模型去跑。洞察研究 GEA 反过来:在智能体的每个执行步骤旁边加一个反馈入口,让人类专家用自己的话描述「这里出了什么问题」,而不是打一个分。

当相似的吐槽反复出现,就把它归纳成一个失败模式(Failure Mode)——一类可以被反复识别的系统性缺陷,配上精确定义:什么算失败,什么不算,需要什么证据来判定。

AI用户研究各环节可能出现的失真问题表格

这个过程有个很实用的特点:它是收敛的。专家密集审查的第一天,往往能发现十几种新模式,之后每天递减,到某个节点,几乎所有新反馈都能归进已有类别里。这个时候就是信号:可以交给自动化检测了。

进入自动化阶段后,分工也划得很清楚:人只负责发现和定义新问题,大模型负责大规模检测已知问题。而且每个评测判定都必须留下支撑证据——结论是什么、触发判定的具体引用在哪、哪些边界情况需要人工再确认。

这个「可追溯才可信」的思路,其实和 Evidence Tree 精神上是一致的,只是场景从「模型能力评测」换成了「业务执行质量评测」。(这个视角在特赞确实是第一次看到,其他公司应该没有在做的。)

最有意思的是 Game Lab:拉真人下场当基准

如果说失败模式驱动是方法论层面的选择,那 Game Lab 这个设计,算是整套方案里最有工程独特性的一环。

它的逻辑很简单:语言任务的输出很难验证,但行为决策是可以量化对比的。

具体做法是,让真人用户和 AI 智能体(AI Persona)玩同样的经济学博弈游戏——最后通牒博弈、公共品博弈这些——然后对比两边的决策数据分布。如果 AI 在某类博弈场景下的决策分布和真人样本出现了系统性偏差,就能精确定位出 AI Persona 在哪类判断上失真了,再用真人产生的真实行为数据持续调优。

这个设计的价值在哪?现在主流的评测方案,大多还停留在「用 AI 评 AI」的自指循环里——模型打分靠模型,校准还是靠模型。Game Lab 相当于往这个循环里引入了一个外部锚点:真实的人类行为数据。这种做法在目前的 AI 评测方案里确实不太常见。

游戏实验中有无讨论对决策行为的影响对比

AI模型与参与者的博弈实验表现排名

两条路线的横向对比

HarnessEval学术路线与GEA企业路线的评测维度对比

Game Lab 入口:https://game.atypica.ai/

从这张表可以看出来,这两条路线其实不冲突,回答的根本不是同一个问题。选型阶段看能力,用学术路线的思路没问题;但智能体一旦进了生产环境,光有能力分数是不够的,你需要的是持续捕捉失败、持续校准的机制。

如果你在企业里落地 Agent,下面几种情况建议重点关注企业路线的做法:

  • 智能体的输出会直接变成交付物,交给客户或者业务方
  • 任务链路长、步骤多,出了问题需要定位到具体环节
  • 输出质量靠人肉抽查,专家看不过来了
  • 需要模拟人类行为(用户研究、Persona 类场景),怕模拟失真

最后总结

AI 评测正在从「跑分排名」走向「持续可信」。HarnessEval 让我们看到了评测者智能化的可能性,而企业一线的实践提醒我们:真正的可信,从来不是一次测出来的,而是在一轮又一轮真实执行中,持续校准出来的。

这不是一项可以一劳永逸的工程,而是一套需要跟着智能体一起生长的运营机制。

你们公司的 Agent 上线前是怎么评测的?靠 Benchmark 跑分,还是靠专家人肉盯?有没有遇到过「分数很高、一上线就翻车」的情况?欢迎在 云栈社区 分享你的案例。




上一篇:TypePHP 原生编译器源码正式开放:Swoole 作者确认,9 月上线 GitHub
下一篇:Oracle RAC锁冲突排查:enq: TX与gc current block busy等待事件处理
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-26 01:20 , Processed in 1.071574 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表