ESC
AI 1 分钟阅读

Mistral 发布 Shieldstral:面向多模态审核的 3B 开放权重模型

Mistral 发布 Shieldstral,一款 3B 开放权重多模态安全分类器,将内容审核建模为策略自适应问答任务,推理时接受自然语言策略,无需重训即可统一审核文本和图像。性能媲美高达其 7 倍规模的模型,Apache 2.0 协议开放,可在单张 16GB GPU 上运行。

来源:Hacker News

前沿级训练与推理基础设施。

思考

Shieldstral 推出了一款 3B 开放权重多模态安全分类器,通过将内容审核建模为策略自适应问答任务,性能超越了最高达其 7 倍规模的模型。与传统护栏模型不同,它在推理时接受自然语言策略,无需重新训练即可统一文本和图像安全评估。该模型以 Apache 2.0 协议发布,在多样基准上提供校准后的安全分数,并可在单张 16GB NVIDIA GPU 上高效运行。

一款 3B 开放权重、策略自适应的多模态安全分类器,在文本安全上可媲美最高达其 7 倍规模的模型,并在多模态审核上树立了新的 SOTA。

“这段内容是否煽动针对受保护群体的暴力?这张图片适合未成年人观看吗?助手是否拒绝了请求?”

每个发布模型的产品都需要回答这类问题——但正确答案取决于产品、受众和具体场景。同一内容,对网络安全研究工具可能是合适的,在心理健康平台上却可能有害。大多数护栏模型将固定的危害类别分类法固化在权重中,因此要将其重新定向到新的部署场景,就需要重新训练。而由于安全定义因应用和领域而异,从一开始就不存在唯一“正确”的类别集合。

Shieldstral 采用了一种不同的方法:你在推理时用自然语言将策略写成问题,模型返回一个校准后的安全分数。无需重新训练,一个接口处理文本和图像,并只用一个 token 给出判定。相关技术报告请参阅此处。

作为与 NVIDIA 等机构共同创立的 Open Secure AI Alliance 的首批成员,我们今天以 Apache 2.0 协议开放 Shieldstral 的权重,可在此下载。

Shieldstral 将内容审核建模为二元问答任务。每个请求包含三部分:

<Instruct> — 评估上下文、严格程度,以及(可选)不安全内容的定义。

<Query> — 一个是/否问题,例如“这段内容是否宣扬身体暴力?”

<Document> — 待判断的内容:提示词、回复、提示词-回复对,或带可选文本的图像。

推理时,模型只读取 yes 和 no 的 logits,并通过 softmax 归一化为连续的安全分数。这一个简单公式完成了大量工作:它将提示词分类、回复审核、拒答检测和有害性检测统一为单一问题;它让策略完全存在于提示词中,因此一个检查点就能在部署时适应新策略。

强大性能——在文本安全、拒答检测、策略适应性和多模态基准上,达到或超越高达其 7 倍规模的开源护栏模型。

自适应且灵活——单一自然语言接口覆盖文本、图像及文本+图像内容,可处理提示词、回复和提示词-回复对。策略以自由形式查询提供,并在推理时重新定向,无需重新训练。

小模型,异构数据训练——3B 模型可在单张 16GB GPU 上运行,使用具有多样标注格式和分类法的真实与合成数据训练,并整合到一个框架中。

连续安全分数——通过单次前向传播返回校准的 yes/no 概率,因此可以按置信度设置阈值或排序,而不是依赖离散标签。

我们从四个维度对 Shieldstral 与高达其 7 倍规模的开源护栏模型进行评估。所有评估样本均未参与训练。

核心思想是:如果数据得当,小模型可以击败大得多的模型。要做到数据得当,需要解决四个问题:

统一异构数据。 公开安全数据集在分类法、标签和标注约定上并不一致——从二元的 safe/unsafe 标记到细粒度的多标签分类法都有。我们通过每个数据集对应的处理器,将每个数据集转换为相同的 指令-查询-文档 格式,并改变指令、查询和 提示词-回复 分隔符的措辞,让模型在多样表达中学会泛化,而不是过拟合于单一风格。我们还按数据源校准严格程度——对对抗性越狱严格,对回复质量数据宽松——使模型学习到校准过的决策边界。这样我们就能整合原本彼此不兼容的数据源。