2026 年 8 月 4 日,法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。
与依赖固定风险标签的传统安全模型不同,Shieldstral 支持在推理阶段通过自然语言输入自定义审核规则,从而根据不同业务场景调整审核标准。
它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。
在多个文本和多模态安全基准上,Shieldstral 甚至取得了接近甚至超过部分参数量更大模型的结果,同时保持较低的部署门槛。这项工作的技术思路,对于 人工智能 领域的Fine-tuning和安全实践有不少启发。本文将从任务建模、训练数据构造、视觉能力扩展和模型融合等方面,拆解这套方案的技术逻辑。


图文审核,只需一道判断题
传统安全模型通常采用固定分类方式:开发者预先设定暴力、色情、仇恨等风险类别,再使用相应的标注数据训练模型。模型上线后,主要负责判断待审内容是否命中这些预设类别。
但企业真正需要判断的往往不是这个内容属于什么类别,而是按照当前业务规则,这段内容是否应当受到限制:同样是暴力内容,新闻平台可能允许正常报道战争,儿童类产品则连轻微打斗画面都需要拦截。
这就导致,企业每次调整审核规则或进入新的业务场景时,原有分类标准可能不再适用,需要重新设计标签或者补充训练数据,必要时甚至要再次 微调模型。
此外,文本和图片通常由两套独立模型分别审核,由此导致了不同模型判断尺度不一致,让企业需要同时维护多套审核系统,承担更高的部署与运维成本。
Shieldstral 的核心解法,是把不同来源的安全数据统一成相同的格式:自然语言审核规则+待审内容→是否命中规则(yes/no),以此训练模型学习规则与内容之间的语义匹配关系。
▎这个审核公式由三个可配置字段组成:
<Instruct> :规定审核场景和判断尺度;
<Query> :提出本次需要检查的具体问题;
<Document> :提供待审核的文本、图片或图文混合内容。
模型根据这三部分信息,判断待审内容是否符合当前规则,最终在 yes 和 no 之间作答。系统还可以提取两个 token 的输出概率,经过归一化得到 0 — 1 之间的连续分数,再结合业务阈值决定放行、拦截或人工复核。

例如, <Instruct> 为:面向新闻平台,仅拦截直接呈现伤亡、血腥细节的内容,正常战事报道无需限制;
<Query> 为:这段内容是否包含需要拦截的血腥暴力细节?
<Document> :如果内容仅描述坦克、炮弹等武器装备,模型会输出 no;当内容出现明确的伤亡、血腥细节时,才会输出 yes。
这种设计带来的好处是,规则灵活可调,企业可以直接在推理阶段用自然语言修改审核问题和判定尺度,并不需要为每次规则变更重新训练分类器;
而多模态的统一,则让同一套模型、同一套规则覆盖文本和图像内容,保证判定尺度一致。单 token 输出的设计也可以让推理链路更简洁,提升审核系统的响应速度与吞吐效率。

让模型识规则,而非贴标签
只把审核任务统一成 Yes / No 判断题,并不足以让模型真正学会按规则判断。
因为如果训练数据始终只是危险内容回答 yes,安全内容回答 no,模型可能会形成简单的判断捷径:只要发现内容整体上存在风险,就直接回答 yes,不去分析它具体命中了哪一条具体规则。

因此,Shieldstral 改变了训练数据的构造方式,重点训练模型区分内容与规则之间匹配关系的能力。
其中一个关键环节是对比式训练:通过内容不变,问题改变的形式,让模型在不同规则下给出不同答案。
▎例如,对于一段描述非法拘禁的内容:
- 面对“是否涉及非法拘禁?”时,模型需回答 yes;
- 面对“是否包含种族仇恨?”或“是否提供制造武器的方法?”时,答案则是 no。
通过这种训练,模型就不能只根据“这段内容看起来危险”来作答,必须理解当前问题要求检查的风险类型,并判断内容是否真正符合这条规则。
为了进一步强化模型对相近规则的区分能力,训练数据还会加入许多语义相近、但实际属于不同类别的样本。
比如,非法拘禁、身体伤害、威胁和骚扰都属于“暴力”相关的风险领域,但它们对应的行为并不相同。模型需要根据问题判断内容究竟命中了哪一类规则,以及没有命中哪些相近规则。
打个比方。如果输入的内容为:把某人锁在房间里,不让其离开。
- 问题 A:这是否涉及非法拘禁? 答案输出为:yes
- 问题 B:是否描述了造成身体伤害? 答案输出为:no
在此基础上,团队建立了一个包含 11 个上层类别和 73 个叶子类别的训练分类体系,并据此生成约 440 万条合成对比文本样本,用于补充公开数据中细分类别不足、相近规则边界不清的问题。
据 Shieldstral 官方论文的消融实验显示,在细粒度规则验证集上仅使用公开安全数据时,F1 为 61.1%;加入合成对比数据后,F1 提升到 84.4%,提高了 23.3 个百分点。

也就是说,Shieldstral 通过训练得到的不单单是识别内容风险的能力,更重要的是掌握判断内容与当前规则是否匹配的语义理解能力。

视觉训练:让模型看懂图片
文本审核场景的问题解决了。但在真实业务中,广告图片、用户上传的实拍照片、海报以及表情包等视觉内容,同样需要纳入安全管控。
然而,视觉训练有其天然难点:违规图像样本非常稀缺,同时人工标注成本高昂,图片也无法像文本那样通过大模型低成本批量生成违规内容。因此,Shieldstral 需要同时解决两个问题:
第一,如何让图片和图文内容参与到训练当中,并做到“规则—内容”精准匹配。
第二,如何让模型看到足够多、足够丰富的图片,弥补违规图片数据不足的问题;
针对第一个问题, 团队没有主要依靠改图来扩充样本进行训练,而是重点增加规则问题的多样性。
Shieldstral 团队围绕暴力、仇恨和违法内容等视觉风险类别,生成了约 2000 种不同措辞的审核问题。同一类规则可以用不同方式表达,其中约 30% 的问题采用反向问法:例如“这张图片是否不包含暴力内容?”。
这种做法的目的是减少模型对固定句式和关键词的依赖,使它更关注规则本身的语义。
在数据来源上 ,团队同时使用了三类图片:违规图片、干净图片,以及通用图像分类和目标检测数据。
违规图片用于提供正样本;干净图片和通用图像数据则提供大量安全的负样本。比如输入一张普通街景图片,可以与“这张图片是否包含暴力内容?” 组成一个 no 的样本。

为了让模型进一步区分相近的视觉风险,数据管线还会构造困难负样本。
▎例如,一张图片可能呈现激烈争执,却没有明确展示身体伤害,模型面对下面的问题时,应当回答 no:
<Query> :这张图片是否包含身体伤害?
<Answer> :no
这样,即使图片数量有限,模型仍然能通过学习具体的样本来接触到大量不同场景、不同构图和不同视觉内容的图片。
不过,自动整合视觉数据也可能引入新的错误,例如原始标签不准确、生成的问题与图片不匹配,或者图片本身不足以支持明确的 yes / no 判断。
因此,Shieldstral 使用视觉语言重排序模型,对每组“图片—规则问题”进行复核,过滤标签错误、图文不一致以及生成质量不可靠的样本。
对于困难负样本,团队也会再次进行筛选,以确保它们确实属于“语义相近但规则不匹配”的案例。经过这些处理,Shieldstral 最终构建了约 450 万条多模态训练样本。它们与文本数据共同纳入同一审核框架,使模型能够统一处理三类输入:纯文本、纯图片,以及图文混合内容。

HarmBench 99.4%!
从主流安全评测基准的结果来看,Shieldstral 的规则自适应范式已经得到了效果层面的验证,小参数量模型实现了对标大模型的审核精度。
官方发布的 Hugging Face 页面显示,文本安全场景中,模型在提示词分类与回复分类两大核心赛道均名列前茅。提示词审核维度,HarmBench 测试 F1 值达到 99.4%,显著优于 GPT-OSS-Safeguard-20B、LlamaGuard-4-12B 等参数量数倍于自身的方案;
WildGuardTest 基准 F1 值达 88.1%,与体量接近 7 倍的 GPT-OSS-Safeguard-20B 基本持平。

拒识检测场景下,模型在 XSTest 基准 F1 值达 94.6%,对越狱类风险内容具备可靠的识别能力。

多模态安全场景中,Shieldstral 的性能优势更为突出。VLGuard 基准 F1 值达到 97.7%,位列榜单第一,大幅领先 OmniGuard-7B、LlavaGuard-7B 等所有参数量更大的对比模型;UnsafeBench 基准 F1 值达 81.8%,领先第二名接近 10 个百分点。


小模型也能实现高精度
总的来说,Shieldstral 承担的是审核流程中最核心也最难标准化的一步:理解当前规则,并判断待审核内容是否符合这条规则。
这种设计让模型保持了相对稳定的能力边界。无论审核对象是文字、图片,还是图文组合,模型都采用统一的判断逻辑;当审核规则发生变化时,也不必立即将每项变化写入模型参数。
当然,Shieldstral 并不负责完成整个内容治理流程。由于它定位于轻量级规则判断模型,风险分数如何解释、阈值如何设置,以及最终采取放行、拦截还是人工复核,仍然需要由具体业务系统根据实际场景决定。
但客观来说,Shieldstral 通过将内容审核转化为自然语言规则与待审核内容之间的匹配问题,展示了其在垂直场景中的潜力。它代表的是小参数专业模型用更轻量灵活的设计思路,实现媲美大模型的细粒度、多模态安全判别能力。
这种“小模型办大事”的实践路径,在 开源实战 中越来越受关注,因为更小的模型意味着更低的部署成本和更快的推理速度。
参考链接: