找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4281

积分

0

好友

557

主题
发表于 3 小时前 | 查看: 3| 回复: 0

2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。

与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。

它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。

在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。这项工作的技术思路,对于 人工智能 领域的Fine-tuning和安全实践有不少启发。本文将从任务建模、训练数据构造、视觉能力扩展和模型融合等方面,拆解这套方案的技术逻辑。

Shieldstral评测数据概览截图

动态点阵环形图案与技术分隔

图文审核,只需一道判断题

传统安全模型通常采用固定分类方式:开发者预先设定暴力、色情、仇恨等风险类别,再使用相应的标注数据训练模型。模型上线后,主要负责判断待审内容是否命中这些预设类别。

但企业真正需要判断的往往不是这个内容属于什么类别,而是按照当前业务规则,这段内容是否应当受到限制:同样是暴力内容,新闻平台可能允许正常报道战争,儿童类产品则连轻微打斗画面都需要拦截。

这就导致,企业每次调整审核规则或进入新的业务场景时,原有分类标准可能不再适用,需要重新设计标签或者补充训练数据,必要时甚至要再次 微调模型

此外,文本和图片通常由两套独立模型分别审核,由此导致了不同模型判断尺度不一致,让企业需要同时维护多套审核系统,承担更高的部署与运维成本。

Shieldstral 的核心解法,是把不同来源的安全数据统一成相同的格式:自然语言审核规则+待审内容→是否命中规则(yes/no),以此训练模型学习规则与内容之间的语义匹配关系。

▎这个审核公式由三个可配置字段组成:

  • <Instruct> :规定审核场景和判断尺度;
  • <Query> :提出本次需要检查的具体问题;
  • <Document> :提供待审核的文本、图片或图文混合内容。

模型根据这三部分信息,判断待审内容是否符合当前规则,最终在 yes 和 no 之间作答。系统还可以提取两个 token 的输出概率,经过归一化得到 0 — 1 之间的连续分数,再结合业务阈值决定放行、拦截或人工复核。

Shieldstral审核框架原理截图

例如, <Instruct> 为:面向新闻平台,仅拦截直接呈现伤亡、血腥细节的内容,正常战事报道无需限制;

  • <Query> 为:这段内容是否包含需要拦截的血腥暴力细节?
  • <Document> :如果内容仅描述坦克、炮弹等武器装备,模型会输出 no;当内容出现明确的伤亡、血腥细节时,才会输出 yes。

这种设计带来的好处是,规则灵活可调,企业可以直接在推理阶段用自然语言修改审核问题和判定尺度,并不需要为每次规则变更重新训练分类器;

而多模态的统一,则让同一套模型、同一套规则覆盖文本和图像内容,保证判定尺度一致。单 token 输出的设计也可以让推理链路更简洁,提升审核系统的响应速度与吞吐效率。

动态点阵环形图案与技术分隔

让模型识规则,而非贴标签

只把审核任务统一成 Yes / No 判断题,并不足以让模型真正学会按规则判断。

因为如果训练数据始终只是危险内容回答 yes,安全内容回答 no,模型可能会形成简单的判断捷径:只要发现内容整体上存在风险,就直接回答 yes,不去分析它具体命中了哪一条具体规则。

关于模型训练应侧重辨别能力而非记忆标签的英文论述截图

因此,Shieldstral 改变了训练数据的构造方式,重点训练模型区分内容与规则之间匹配关系的能力。

其中一个关键环节是对比式训练:通过内容不变,问题改变的形式,让模型在不同规则下给出不同答案。

▎例如,对于一段描述非法拘禁的内容:

  • 面对“是否涉及非法拘禁?”时,模型需回答 yes;
  • 面对“是否包含种族仇恨?”或“是否提供制造武器的方法?”时,答案则是 no。

通过这种训练,模型就不能只根据“这段内容看起来危险”来作答,必须理解当前问题要求检查的风险类型,并判断内容是否真正符合这条规则。

为了进一步强化模型对相近规则的区分能力,训练数据还会加入许多语义相近、但实际属于不同类别的样本。

比如,非法拘禁、身体伤害、威胁和骚扰都属于“暴力”相关的风险领域,但它们对应的行为并不相同。模型需要根据问题判断内容究竟命中了哪一类规则,以及没有命中哪些相近规则。

打个比方。如果输入的内容为:把某人锁在房间里,不让其离开。

  • 问题 A:这是否涉及非法拘禁? 答案输出为:yes
  • 问题 B:是否描述了造成身体伤害? 答案输出为:no

在此基础上,团队建立了一个包含 11 个上层类别和 73 个叶子类别的训练分类体系,并据此生成约 440 万条合成对比文本样本,用于补充公开数据中细分类别不足、相近规则边界不清的问题。

据 Shieldstral 官方论文的消融实验显示,在细粒度规则验证集上仅使用公开安全数据时,F1 为 61.1%;加入合成对比数据后,F1 提升到 84.4%,提高了 23.3 个百分点。

训练阶段消融实验结果表格

也就是说,Shieldstral 通过训练得到的不单单是识别内容风险的能力,更重要的是掌握判断内容与当前规则是否匹配的语义理解能力。

动态点阵环形图案与技术分隔

视觉训练:让模型看懂图片

文本审核场景的问题解决了。但在真实业务中,广告图片、用户上传的实拍照片、海报以及表情包等视觉内容,同样需要纳入安全管控。

然而,视觉训练有其天然难点:违规图像样本非常稀缺,同时人工标注成本高昂,图片也无法像文本那样通过大模型低成本批量生成违规内容。因此,Shieldstral 需要同时解决两个问题:

第一,如何让图片和图文内容参与到训练当中,并做到“规则—内容”精准匹配。

第二,如何让模型看到足够多、足够丰富的图片,弥补违规图片数据不足的问题;

针对第一个问题, 团队没有主要依靠改图来扩充样本进行训练,而是重点增加规则问题的多样性。

Shieldstral 团队围绕暴力、仇恨和违法内容等视觉风险类别,生成了约 2000 种不同措辞的审核问题。同一类规则可以用不同方式表达,其中约 30% 的问题采用反向问法:例如“这张图片是否不包含暴力内容?”。

这种做法的目的是减少模型对固定句式和关键词的依赖,使它更关注规则本身的语义。

在数据来源上 ,团队同时使用了三类图片:违规图片、干净图片,以及通用图像分类和目标检测数据。

违规图片用于提供正样本;干净图片和通用图像数据则提供大量安全的负样本。比如输入一张普通街景图片,可以与“这张图片是否包含暴力内容?” 组成一个 no 的样本。

对比训练样本示意:左侧为正向样本,右侧为负向样本

为了让模型进一步区分相近的视觉风险,数据管线还会构造困难负样本。

▎例如,一张图片可能呈现激烈争执,却没有明确展示身体伤害,模型面对下面的问题时,应当回答 no:

  • <Query> :这张图片是否包含身体伤害?
  • <Answer> :no

这样,即使图片数量有限,模型仍然能通过学习具体的样本来接触到大量不同场景、不同构图和不同视觉内容的图片。

不过,自动整合视觉数据也可能引入新的错误,例如原始标签不准确、生成的问题与图片不匹配,或者图片本身不足以支持明确的 yes / no 判断。

因此,Shieldstral 使用视觉语言重排序模型,对每组“图片—规则问题”进行复核,过滤标签错误、图文不一致以及生成质量不可靠的样本。

对于困难负样本,团队也会再次进行筛选,以确保它们确实属于“语义相近但规则不匹配”的案例。经过这些处理,Shieldstral 最终构建了约 450 万条多模态训练样本。它们与文本数据共同纳入同一审核框架,使模型能够统一处理三类输入:纯文本、纯图片,以及图文混合内容。

动态点阵环形图案与技术分隔

HarmBench 99.4%!

从主流安全评测基准的结果来看,Shieldstral 的规则自适应范式已经得到了效果层面的验证,小参数量模型实现了对标大模型的审核精度。

官方发布的 Hugging Face 页面显示,文本安全场景中,模型在提示词分类与回复分类两大核心赛道均名列前茅。提示词审核维度,HarmBench 测试 F1 值达到 99.4%,显著优于 GPT-OSS-Safeguard-20B、LlamaGuard-4-12B 等参数量数倍于自身的方案;

WildGuardTest 基准 F1 值达 88.1%,与体量接近 7 倍的 GPT-OSS-Safeguard-20B 基本持平。

提示词分类基准测试得分表格

拒识检测场景下,模型在 XSTest 基准 F1 值达 94.6%,对越狱类风险内容具备可靠的识别能力。

拒识检测F1分数百分比表格

多模态安全场景中,Shieldstral 的性能优势更为突出。VLGuard 基准 F1 值达到 97.7%,位列榜单第一,大幅领先 OmniGuard-7B、LlavaGuard-7B 等所有参数量更大的对比模型;UnsafeBench 基准 F1 值达 81.8%,领先第二名接近 10 个百分点。

多模态安全F1分数百分比表格

动态点阵环形图案与技术分隔

小模型也能实现高精度

总的来说,Shieldstral 承担的是审核流程中最核心也最难标准化的一步:理解当前规则,并判断待审核内容是否符合这条规则。

这种设计让模型保持了相对稳定的能力边界。无论审核对象是文字、图片,还是图文组合,模型都采用统一的判断逻辑;当审核规则发生变化时,也不必立即将每项变化写入模型参数。

当然,Shieldstral 并不负责完成整个内容治理流程。由于它定位于轻量级规则判断模型,风险分数如何解释、阈值如何设置,以及最终采取放行、拦截还是人工复核,仍然需要由具体业务系统根据实际场景决定。

但客观来说,Shieldstral 通过将内容审核转化为自然语言规则与待审核内容之间的匹配问题,展示了其在垂直场景中的潜力。它代表的是小参数专业模型用更轻量灵活的设计思路,实现媲美大模型的细粒度、多模态安全判别能力。

这种“小模型办大事”的实践路径,在 开源实战 中越来越受关注,因为更小的模型意味着更低的部署成本和更快的推理速度。

参考链接:




上一篇:2026上半年手机SoC出货量猛跌15%:存储暴涨致联发科高通承压
下一篇:UFS 5.0 性能翻倍但价格更贵,下代旗舰手机存储有猫腻
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-7 05:07 , Processed in 1.075213 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表