project
Shieldstral - Mistral AIのオープンソースのマルチモーダルコンテンツセキュリティ分類モデル
Shieldstralは、Mistral AIが開発し、Ministral-3Bを基盤とした、3Bパラメータを持つオープンソースのマルチモーダルコンテンツセキュリティ分類モデルです。このモデルは、従来の固定カテゴリのコンテンツモデレーションを、二値的な質問応答タスクとして再定義します。
シールドストラルとは何ですか?
Shieldstralは、Mistral AIが開発し、Ministral-3Bをベースとした、3Bパラメータを持つオープンソースのマルチモーダルコンテンツセキュリティ分類モデルです。このモデルは、従来の固定カテゴリのコンテンツモデレーションを二値質問応答タスクとして再定義し、自然言語クエリによるモデレーションポリシーのリアルタイム定義をサポートし、再学習なしでさまざまなシナリオに適応します。テキストセキュリティベンチマークでは平均F1スコア84.9%、マルチモーダルセキュリティベンチマークでは平均F1スコア83.8%を達成しており、いずれも最先端(SOTA)のパフォーマンスです。デプロイに必要なのは16GBのGPU1基のみで、12言語をサポートしています。
シールドストラルの主な機能
- 適応型監査戦略セキュリティポリシーを自然言語による質問形式で入力することで、さまざまなシナリオにおけるリアルタイムのカスタマイズされたレビューを実現します。
- マルチモーダル統合検出プレーンテキスト、画像、およびテキストと画像が混在するコンテンツを同時に処理する単一インターフェースのセキュリティ評価。
- 詳細な違反識別粗い二値判定から73の末端カテゴリまで、きめ細かな安全性の分類をサポートします。
- 校正安全スコアこのシステムは、ソフトマックス正規化によって0~1の範囲の連続的な安全スコアを出力し、0.5の閾値で違反を判定します。
- 軽量エッジ展開3Bパラメータスケールにより、単一の16GB NVIDIA GPU上で効率的な推論が可能になり、ハードウェアの制約が軽減されます。
シールドストラルの技術原理
- 二値質問応答アーキテクチャレビュータスクは、「yes」と「no」という2つの出力トークンの論理値を予測するタスクに変換され、ソフトマックス正規化後に連続的なセキュリティスコアが得られます。
- 3フィールド構造化入力:使用
<Instruct>(評価シナリオと厳密性)<Query>(セキュリティに関する質問:はい/いいえ)<Document>(内容審査中の)標準化されたプロンプト形式。 - 大規模な対照訓練5410万件のサンプル(オープンソーステキスト4520万件、合成比較テキスト440万件、マルチモーダルテキスト450万件)に基づいて、このモデルは、同じコンテンツを持つ異なるクエリを比較およびペアリングすることによって、類似のカテゴリを区別するように訓練されています。
- 合成データ拡張LLMは、安全なテキストを違反するバリアントに書き換え、対象カテゴリとその関連カテゴリ間の比較クエリペアを自動的に生成することで、よりきめ細かな識別能力を向上させます。
- LoRAの微調整とSLERPの統合Ministral-3BのLoRAファインチューニングを効率的に実行し、公開データセットと合成データで学習された2つの補完的なチェックポイントを球面線形補間によって統合します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
シールドストラルの使い方
- 環境準備Shieldstralモデルと推論フレームワークを、単一の16GB NVIDIA GPUにデプロイします。
- 監査戦略を定義する:書く
<Instruct>これらの項目には、評価シナリオ、分野の背景、および厳密性の基準が記載されています。 - セキュリティクエリを記述する:構造
<Query>この項目には、「このコンテンツは身体的暴力を助長しますか?」といった、はい/いいえの二択式の質問が含まれています。 - レビュー対象コンテンツを入力してください空欄にテキスト、画像、またはテキストと画像の組み合わせを入力してください。
<Document>現場提出モデル。 - セキュリティ判定を取得するモデルが出力するソフトマックス正規化連続スコアを読み取り、ビジネスニーズに応じて閾値を設定して、バイナリ違反を判定します。
シールドストラルの主な利点
- 柔軟な戦略レビュー基準は自然言語を用いてリアルタイムで定義されるため、新しいシナリオに合わせてモデルを再学習させる必要がなくなります。
- 優れた業績3Bパラメータは、テキストとマルチモーダル安全ベンチマークの両方において最先端の性能を達成し、7倍の規模のモデルに匹敵する。
- ハードウェアに優しい16GBのGPU1基で動作するため、企業におけるプライベート導入の障壁を大幅に低減できる。
- データ統合コマンド、クエリ、ドキュメント形式を通じて5410万件の異種データを統合し、12言語と多様なシナリオに対応します。
- 決定は説明できる出力は、ブラックボックス型の分類ラベルではなく、較正済みの連続スコアとなるため、オペレーターは必要に応じて閾値を調整しやすくなる。
シールドストラル・プロジェクトの住所
- プロジェクト公式サイト:https://mistral.ai/news/shieldstral/
- ハギングフェイスモデルライブラリ:https://huggingface.co/mistralai/Shieldstral-1.0-3B
- arXiv技術論文:https://arxiv.org/pdf/2607.25857
シールドストラルの類似製品との比較
| 寸法 | Shieldstral (3B) | OmniGuard (7B) |
|---|---|---|
| パラメータサイズ | 30億 | 70億 |
| オープンソースライセンス | Apache 2.0 | ビジネス志向 |
| 戦略の適応 | 自然言語クエリのリアルタイム定義をサポートします | 固定分類システム |
| マルチモーダルF1 | 83.8% | 77.6% |
| 展開しきい値 | 16GB GPU 1基 | より高いコンピューティング能力要件 |
| 根本的な違い | レビューポリシーは外部化されており、クエリ用に構成変更が可能です。 | カテゴリーはモデルの重みで固定されています |
シールドストラルの応用シナリオ
- ソーシャルメディアコンテンツのリスク管理ユーザーが投稿した画像やテキストをリアルタイムで審査し、様々なコミュニティのコンプライアンスガイドラインに動的に対応します。
- AI会話セキュリティ保護ユーザープロンプトにおける脱獄攻撃、およびモデル出力における有害で偏った応答を検出します。
- 広告およびマーケティングのコンプライアンス広告素材に含まれる違法な画像やテキスト要素を自動的にスクリーニングし、プラットフォーム全体で配信されるコンテンツの合法性を確保します。
- オンライン教育コンテンツのフィルタリング授業教材や生徒間のやり取りにおける不適切な情報を特定し、未成年者の学習環境を保護する。
- 企業文書セキュリティ監査社内で共有される多言語ファイル内の機密情報および違法コンテンツを自動的に検出します。