前沿级训练与推理基础设施。
思考
Shieldstral 推出了一款 3B 开放权重多模态安全分类器,通过将内容审核建模为策略自适应问答任务,性能超越了最高达其 7 倍规模的模型。与传统护栏模型不同,它在推理时接受自然语言策略,无需重新训练即可统一文本和图像安全评估。该模型以 Apache 2.0 协议发布,在多样基准上提供校准后的安全分数,并可在单张 16GB NVIDIA GPU 上高效运行。
一款 3B 开放权重、策略自适应的多模态安全分类器,在文本安全上可媲美最高达其 7 倍规模的模型,并在多模态审核上树立了新的 SOTA。
“这段内容是否煽动针对受保护群体的暴力?这张图片适合未成年人观看吗?助手是否拒绝了请求?”
每个发布模型的产品都需要回答这类问题——但正确答案取决于产品、受众和具体场景。同一内容,对网络安全研究工具可能是合适的,在心理健康平台上却可能有害。大多数护栏模型将固定的危害类别分类法固化在权重中,因此要将其重新定向到新的部署场景,就需要重新训练。而由于安全定义因应用和领域而异,从一开始就不存在唯一“正确”的类别集合。
Shieldstral 采用了一种不同的方法:你在推理时用自然语言将策略写成问题,模型返回一个校准后的安全分数。无需重新训练,一个接口处理文本和图像,并只用一个 token 给出判定。相关技术报告请参阅此处。
作为与 NVIDIA 等机构共同创立的 Open Secure AI Alliance 的首批成员,我们今天以 Apache 2.0 协议开放 Shieldstral 的权重,可在此下载。
Shieldstral 将内容审核建模为二元问答任务。每个请求包含三部分:
<Instruct> — 评估上下文、严格程度,以及(可选)不安全内容的定义。
<Query> — 一个是/否问题,例如“这段内容是否宣扬身体暴力?”
<Document> — 待判断的内容:提示词、回复、提示词-回复对,或带可选文本的图像。
推理时,模型只读取 yes 和 no 的 logits,并通过 softmax 归一化为连续的安全分数。这一个简单公式完成了大量工作:它将提示词分类、回复审核、拒答检测和有害性检测统一为单一问题;它让策略完全存在于提示词中,因此一个检查点就能在部署时适应新策略。
强大性能——在文本安全、拒答检测、策略适应性和多模态基准上,达到或超越高达其 7 倍规模的开源护栏模型。
自适应且灵活——单一自然语言接口覆盖文本、图像及文本+图像内容,可处理提示词、回复和提示词-回复对。策略以自由形式查询提供,并在推理时重新定向,无需重新训练。
小模型,异构数据训练——3B 模型可在单张 16GB GPU 上运行,使用具有多样标注格式和分类法的真实与合成数据训练,并整合到一个框架中。
连续安全分数——通过单次前向传播返回校准的 yes/no 概率,因此可以按置信度设置阈值或排序,而不是依赖离散标签。
我们从四个维度对 Shieldstral 与高达其 7 倍规模的开源护栏模型进行评估。所有评估样本均未参与训练。
核心思想是:如果数据得当,小模型可以击败大得多的模型。要做到数据得当,需要解决四个问题:
统一异构数据。 公开安全数据集在分类法、标签和标注约定上并不一致——从二元的 safe/unsafe 标记到细粒度的多标签分类法都有。我们通过每个数据集对应的处理器,将每个数据集转换为相同的 指令-查询-文档 格式,并改变指令、查询和 提示词-回复 分隔符的措辞,让模型在多样表达中学会泛化,而不是过拟合于单一风格。我们还按数据源校准严格程度——对对抗性越狱严格,对回复质量数据宽松——使模型学习到校准过的决策边界。这样我们就能整合原本彼此不兼容的数据源。