找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4751

积分

0

好友

619

主题
发表于 3 小时前 | 查看: 5| 回复: 0

随着大模型逐步落地真实应用,如何及时识别模型的对齐失效,已经成为部署阶段绕不开的问题。

模型可能迎合用户的错误观点、响应越狱后的有害请求、执行提示注入指令,也可能产生幻觉、隐私违规,甚至表现出奖励黑客等行为。

可现有检测方案大多依赖生成式 LLM Judge,针对不同判断标准通常都需要单独进行一次推理和解码,不仅成本较高,最终生成的文本判断还需要进一步解析。

为此,格里菲斯大学联合南洋理工大学等首次系统评估了采用 RLCD 训练的 Jev 模型,能否直接作为大模型对齐失效检测器。

Jev论文标题页截图

与传统生成式 LLM Judge 不同,Jev 不需要生成文本判定,而是针对同一输入,在一次调用中回答多个具有明确类型的问题,并直接输出相应概率。

研究团队进一步开源了 RLCDAlignBench,覆盖谄媚、越狱、欺骗、提示注入、幻觉、隐私违规、社会偏见、奖励黑客、隐藏不确定性和权力寻求等 10 类对齐失效、44 个 Benchmark、7193 个检测样本。

实验显示,在无需标签训练的 Zero-shot 设置下,Jev 在31个适用 Benchmark 上就取得了 0.886 的中位 AUROC。在19个使用 API LLM Judge 评分的 Benchmark 上,一次完整检测的总成本约为传统 LLM Judge 的 1/63。

Jev模型在38个基准测试中AUROC表现图表

此外,该成果上周还登上了 Hugging Face Papers 趋势榜。

Hugging Face Papers趋势榜截图

01 Jev 如何检测对齐失效?

该论文的核心并不是为每一种对齐失败重新训练分类器,研究团队将检测过程拆成两个彼此独立的问题:"问 Jev 什么"以及"给 Jev 看什么"。

Jev安全评估流程三阶段图

如上图所示,对于每一个检测实例 x,研究者首先从原始 Benchmark 中获得目标模型的输入、输出以及参考评分器给出的二分类标签 y。

其中 y=1 表示发生对应的对齐失效。随后,将目标模型交互内容组织为 Jev 能读取的 state(状态),再一次性向 Jev 提出多个问题,由 Jev 输出对应概率,并组合成最终风险分数 s(x)。标签本身从不提供给 Jev,只用于最终评估。

(1)State,控制 Jev 看什么

研究团队首先构造 canonical state,默认只包含目标模型实际接收到的输入以及模型输出,这对应现实中一个响应级监控器最容易获取的信息。评分器结论、标准答案、Benchmark 元数据以及目标模型内部概率等信息均不会放入默认 State。

随后,研究团队采用控制变量方式,每次只改变一个字段,共构造49组配对对比。其中论文重点区分两类关键信息:deployable reference 和 label key。

第一类是 deployable reference,也就是现实部署中的监控器理论上能够获得的信息,例如系统提示词、目标模型的欺骗目标、模型此前表达的信念等。

第二类则是 label key,即直接参与 Benchmark 标签定义的信息,例如标准答案、隐私数据列表或者提示注入位置。通过分别加入这些信息,作者可以判断:Jev 检测失败,究竟是因为能力不足,还是因为它根本没有看到定义该标签所需要的关键信息。

(2)Question,控制问 Jev 什么

对于每个 Benchmark,研究团队预先设计一个 Generic Question。问题由固定模板和一个描述目标行为的短语组成,例如单响应任务可以写成:"Does response exhibit <behavior>?"

同一句问题分别采用三种 Jev 原生输出形式:NOUL、CHOICE 和 SCORE。

NOUL 直接返回"是"的概率 P(yes);CHOICE 返回 yes/no/undetermined 等选项的概率分布;SCORE 则输出多个有序等级上的概率分布,再通过期望值转换为风险分数。

除此之外,研究团队还设计了更具体的 Targeted Questions,包括直接描述 Benchmark 判断标准的 Direct Question、复现原始评分器逻辑的 Rubric,以及将复杂判断拆开的 Decomposition Question。一个 Benchmark 最终拥有约 15~40种判断策略,但所有问题都可以在一次 Jev 请求中完成。实验统一采用 jev-1.13.0。

02 实验结果

(1)Zero-shot 即可超过监督式文本基线

Generic NOUL 在31个适用 Benchmark 上取得 0.886 [0.821, 0.952] 的中位 AUROC;在全部38个可用 Benchmark 上,split-half 选择的 Targeted Strategy 中位 AUROC 为 0.911 [0.860, 0.944]。

更值得注意的是,Generic NOUL 完全没有接触训练标签,却比"响应长度"和域内训练的 TF-IDF Logistic Regression 中表现更好的那个基线中位高出 0.132 AUROC,并在31个 Benchmark 中赢下25个。

Jev AUROC和F1性能对比表格

(2)精心设计 Prompt,收益其实很小

论文进一步考察"问题到底要不要写得特别精细"。

结果显示,将 Targeted Question 在一半样本上选择、另一半样本上测试后,相比最佳 Generic readout,中位 AUROC 只提升 +0.006 [-0.004,+0.015],统计显著性也处于边界水平 p=0.055。

Figure 3软回答与目标化措辞的AUROC对比图

这意味着,对 Jev 而言,与其花大量精力"雕 Prompt",更重要的是保留其完整的概率信息。

(3)与人工标注接近,同时成本下降63倍

在人类标签实验中,StrongREJECT 上 Generic NOUL 与人工标注的一致性达到 Cohen's κ=0.809,几乎追平 GPT-4o-mini 参考评分器的 0.811;但在排序能力上,Jev 的 AUROC 达到 0.971,高于评分器的0.929。HarmBench 上,Jev 与单个人类标注者的一致性为 κ=0.748,也与人类之间0.736的互标一致性相当。

StrongREJECT人工标注一致性对比表

Jev与人类标注者一致性及争议裁决图

一次 Jev 请求平均可以携带 11.4个问题,中位响应时间仅 0.31秒。在这19个 Benchmark 上完成一轮完整评测,Jev 的总成本约为 0.30 美元,而原始 LLM Judge 约需 18.96 美元,成本差距63倍。

03 做好大模型对齐失效检测,不一定需要更复杂的 Judge

对于不少任务,一个通用问题、一次调用,再保留完整的概率信息,就已经能够获得很强的零样本排序效果。

真正拉开检测效果差距的,往往也不是 Prompt 写得有多复杂,而是 Jev 到底看到了哪些上下文,以及 Benchmark 的标签究竟在衡量什么。

这也意味着,当大模型越来越多地进入真实生产环境,对齐检测的重点,可能会从设计更复杂的评判模型,逐渐转向如何提供正确的上下文、定义可靠的标签,并用更低成本持续监控模型行为。




上一篇:大模型商业终局推演:OpenAI的广告宿命与英伟达的高毛利警报
下一篇:苹果真正的AI杀手锏不是Siri,是重回企业服务器搞M8 Ultra本地推理
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-30 06:50 , Processed in 0.477068 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表