project
Shieldstral - Mistral AI 开源的多模态内容安全分类模型
Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支...
Shieldstral是什么
Shieldstral 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。模型在文本安全基准上平均 F1 达 84.9%,多模态安全 F1 达 83.8% 均为 SOTA,且仅需单张 16GB GPU 可部署,支持 12 种语言。
Shieldstral的主要功能
- 策略自适应审核:将安全政策以自然语言问题形式输入,实现不同场景下的实时定制化审核。
- 多模态统一检测:单一接口同时处理纯文本、图像及图文混合内容的安全评估。
- 细粒度违规识别:支持从粗粒度二元判断到 73 个叶类别的精细安全分类。
- 校准安全评分:通过 softmax 归一化输出 0–1 区间的连续安全分数,以 0.5 阈值判定违规。
- 轻量端侧部署:3B 参数规模可在单张 16GB NVIDIA GPU 上高效推理,降低硬件门槛。
Shieldstral的技术原理
- 二元问答架构:将审核任务转化为对 “yes” 与 “no” 两个输出词元的逻辑值预测,经 softmax 归一化得到连续安全分数。
- 三字段结构化输入:采用
<Instruct>(评估场景与严格度)、<Query>(是/否安全问题)、<Document>(待审核内容)的标准化提示格式。 - 大规模对比训练:基于 5410 万样本(4520 万开源文本、440 万合成对比文本、450 万多模态),通过同内容异查询的对比配对训练模型区分相似类别的能力。
- 合成数据增强:利用 LLM 将安全文本改写为违规变体,并自动生成目标类别与兄弟类别的对比查询对,强化细粒度判别。
- LoRA 微调 + SLERP 合并:对 Ministral-3B 进行 LoRA 高效微调,并通过球面线性插值合并公共数据集与合成数据训练的两个互补检查点。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Shieldstral
- 环境准备:在单张 16GB NVIDIA GPU 上部署 Shieldstral 模型及推理框架。
- 定义审核策略:编写
<Instruct>字段说明评估场景、领域背景与严格程度标准。 - 编写安全查询:构造
<Query>字段中的二元是/否问题,例如”内容是否宣扬身体暴力?”。 - 输入待审内容:将文本、图像或图文组合填入
<Document>字段提交模型。 - 获取安全判定:读取模型输出的 softmax 归一化连续分数,按业务需求设定阈值进行二元违规判定。
Shieldstral的核心优势
- 策略灵活:审核标准通过自然语言实时定义,无需针对新场景重新训练模型。
- 性能领先:3B 参数在文本和多模态安全基准上均达到 SOTA,媲美 7 倍规模模型。
- 硬件友好:单张 16GB GPU 即可运行,显著降低企业私有化部署门槛。
- 数据统一:通过指令-查询-文档格式整合 54.1M 异构数据,覆盖 12 种语言与多元场景。
- 决策可解释:输出校准后的连续分数而非黑盒分类标签,便于运营人员按需调整阈值。
Shieldstral的项目地址
- 项目官网:https://mistral.ai/news/shieldstral/
- HuggingFace模型库:https://huggingface.co/mistralai/Shieldstral-1.0-3B
- arXiv技术论文:https://arxiv.org/pdf/2607.25857
Shieldstral的同类竞品对比
| 维度 | Shieldstral (3B) | OmniGuard (7B) |
|---|---|---|
| 参数规模 | 30 亿 | 70 亿 |
| 开源许可 | Apache 2.0 | 偏商业 |
| 策略自适应 | 支持自然语言查询实时定义 | 固定分类体系 |
| 多模态 F1 | 83.8% | 77.6% |
| 部署门槛 | 单张 16GB GPU | 更高算力需求 |
| 核心差异 | 审核政策外置为可配置查询 | 类别固化于模型权重 |
Shieldstral的应用场景
- 社交平台内容风控:实时审核用户发布的图文帖子,动态适配不同社区的合规规范。
- AI 对话安全防护:检测用户提示词中的越狱攻击与模型输出的有害、偏见回复。
- 广告与营销合规:自动筛查广告素材中的违规图文元素,确保跨平台投放内容合法。
- 在线教育内容过滤:识别课程资料与互动中的不当信息,保护未成年人的学习环境。
- 企业文档安全审计:对内部共享的多语言文件进行自动化敏感信息与违规内容检测。