Mistral 的 Shieldstral 将安全过滤缩小到 30 亿参数

The Decoder··作者 Jonathan Kemper

关键信息

该系统允许运营方用自然语言编写检查项,例如“这段内容是否鼓励暴力?”,然后把模型回答“是/否”的概率转换为 0 到 1 的安全分数。Mistral 表示,合成数据对训练模型区分高度相近的规则至关重要,而且该模型以 Apache 2.0 许可证开放发布。

资讯摘要

Mistral 发布了 Shieldstral,这是一款 30 亿参数的开源安全模型,用于判断 AI 输入和输出是否违反策略。论文称,它在标准文本安全基准上的表现可与体量大约三倍的模型相当,并且在图文联合分类任务上取得了新的高分。该模型的核心思路,是用运行时可定义的是/否问题替代固定的安全类别。运营方无需重新训练分类器,就能根据自己的应用场景定制检查规则。

模型只回答“是”或“否”,再把对应概率换算成 0 到 1 之间的安全分数。Mistral 认为这种方式更灵活,因为网络安全工具和心理健康平台需要的过滤规则并不相同。为了训练这种适应能力,团队整合了约 5410 万条样本,并通过合成改写把安全文本转换成不安全变体。论文表示,这种做法帮助 Shieldstral 更好地适应新的或更细粒度的规则,而且该开源权重模型以 Apache 2.0 许可证发布。

Mistral 的 Shieldstral 将安全过滤缩小到 30 亿参数

资讯正文

Mistral 的开源模型 Shieldstral 以远小于其体量的规模,达到了与更大型安全模型相当的表现

一篇新论文提出,用运行时可由操作者定义的是否问题,取代固定的安全类别,而无需重新训练分类器。

据论文称,来自法国 AI 公司 Mistral 的 30 亿参数模型 Shieldstral,在标准文本安全基准上的表现与其三倍规模的模型相当。Mistral 还表示,该模型在文本与图像联合分类方面创下了新的最高分。

运行时规则让操作者能够定制安全检查

许多护栏模型会使用固定的分类体系对内容进行分类。论文作者之一、Mistral 联合创始人 Guillaume Lample 指出,这种方法有两个问题:公开安全数据集对风险的分组方式差异太大,无法支持一套通用分类;而且同一套规则并不适用于所有使用场景。适合网络安全工具的内容,可能对心理健康平台来说却是有害的。

操作者通过自然语言问题告诉 Shieldstral 需要检查什么,例如“这段内容是否宣扬暴力?”模型只回答“是”或“否”,系统再根据两种回答各自的概率,计算出一个介于 0 到 1 之间的安全分数。

合成数据帮助模型应对新规则

研究人员将大约 5410 万个覆盖安全、有害内容和操纵尝试的样本整合成一种统一格式。他们对针对性的操纵内容采用严格标准,对通用安全数据采用中等标准,对响应质量则采用宽松标准。

为了让 Shieldstral 学会更细致的区分,团队使用另一款语言模型把安全文本改写成不安全变体。每个样本还包含一个相似但不同的类别,模型必须拒绝它,从而训练模型区分彼此接近的规则,而不是只做笼统的安全或不安全判断。

作者将适应性测试类别与训练集分开创建,使用了不同的名称和不同的细化程度。他们表示,细粒度测试类别中没有任何一个能与训练类别直接对应,尽管 12 个较宽泛的大类中有 10 个能找到大致对应项。

这款 30 亿参数模型与一款几乎大七倍的模型打成平手

在适应性基准测试中,GPT-OSS-Safeguard-20B 以 94.1% 领先,而 Shieldstral 为 91.3%。这项测试使用的是与训练类别不同、或完全全新的规则。作者仍然认为,Shieldstral 比 GPT-OSS-Safeguard-20B 和 Nemotron-3.5-Safety 更实用,因为后两者会生成很长的中间推理序列,增加计算成本,而 Shieldstral 只返回一个词。

Shieldstral 基于 Mistral 的 Ministral-3B,并结合了 Pixtral 视觉编码器。在一次包含细粒度类别的验证测试中,合成类别数据使 F1 分数提高了 23.3 个百分点,研究人员称这也是该模型能够适应新规则的主要驱动力。

Shieldstral 作为开源权重模型提供,采用 Apache 2.0 许可证。

自定义规则或许能减少代价高昂的过滤误判

安全分类器位于主语言模型的两侧,在请求进入处理之前筛查提示词,并在回复到达用户之前进行拦截。运营者可以在不重新训练主模型的情况下更新这些规则。但由于每一次请求都要经过分类器,其规模、速度和成本会迅速累积。

Anthropic 的 Claude Fable 5 展示了调校不佳的过滤器会如何影响真实使用。Artificial Analysis 发现,该系统会自动把 8% 到 9% 的任务路由到一个较弱的模型。一位医学物理学家称 Fable 5 无法使用,因为他的工作中经常出现“nuclear”这个词。其他用户报告说,该系统把 MRI 分析标记成了生物恐怖主义。

Anthropic 在定位到一个安全问题后收紧了过滤器,并表示此后它更频繁地阻止了无害的编码任务。Shieldstral 让运营者对这种权衡拥有更多控制权。他们可以在运行时编写筛查标准,并针对特定应用定制过滤器,而不是采用别人的分类。

这类分类器已经在整个行业中扮演越来越重要的角色。OpenAI 将它们用于 ChatGPT 的自动年龄检测,并把带有情绪色彩的请求通过安全过滤器路由到更严格的模型。Claude Code 使用分类器来阻止外部脚本、生产环境部署以及强制推送。Anthropic 的 Fable 5 审查还要求公司将输入和输出最多保存 30 天,或者在发生规则违规后最多保存两年。

来源与参考

  1. 原始链接
  2. Mistral's open model Shieldstral matches much larger safety models at a fraction of the size

收录于 2026-08-06