project
Qwen-Scope - アリババ同義氏による大規模モデル解釈のためのオープンソースツールキット
Qwen-Scopeは、アリババ同義千文チームが開発した、解釈可能な大規模モデルのためのオープンソースツールキットです。スパースオートエンコーダー(SAE)技術に基づき、Qwen3/Qwen3.5シリーズモデルの隠れ層から解釈可能な特徴量を抽出します。
Qwen-Scopeとは何ですか?
Qwen-Scopeは、アリババ同義千文チームが開発した、解釈可能な大規模モデルのためのオープンソースツールキットです。スパースオートエンコーダー(SAE)技術に基づき、Qwen3/Qwen3.5シリーズモデルの隠れ層から解釈可能な特徴量を抽出します。このモデルは、複雑なパラメータ計算を人間が理解できる概念やルールに変換し、事後分析に利用できます。特徴量レベルでの介入により、推論制御、データ処理、モデル最適化が可能になり、モデルの内部構造と下流開発を繋ぐ実用的なインターフェースとなります。
Qwen-Scopeの主な機能
-
操舵明示的な自然言語コマンドがなくても、特定のSAE機能を有効または無効にすることで、言語、エンティティ、スタイルへの的を絞った変更や、異常なケースの修復を実現できます。
-
データ分類と統合少量のシードデータに基づいて、毒性/安全性に関連する特徴が発見され、追加のトレーナーなしで分類が可能になります。また、不活性な特徴が特定され、ロングテール機能をカバーするために、対象を絞った方法で補足サンプルが合成されます。
-
モデル学習の最適化言語混合や繰り返し生成などの異常な活性化特徴を特定し、教師あり微調整(SFT)および強化学習(RL)段階におけるモデルの動作最適化を支援します。
-
評価冗長性分析異なる評価セット間における機能活性化パターンを計算し、評価セットの冗長性と機能カバレッジを決定し、カバレッジが高く低コストのテストサンプルの選択を支援する。
Qwen-Scopeの技術原則
-
スパースオートエンコーダー(SAE)Qwenの各Transformer層の残差フローにSAEを挿入し、スパース性制約を課すことで、高次元の活性化ベクトルをスパースで解釈可能な特徴辞書に分解します。
-
トップk活性化と再構築SAEでは各層が個別に学習されます。エンコーダーは活性化を過剰に完全な潜在表現にマッピングし、再構成のために上位k個の活性化(k=50/100)のみを保持することで、特徴が高度に分離されることを保証します。
-
コントラスト特徴認識陽性サンプルセットと陰性サンプルセットを作成し、それらのSAE平均活性化の差を比較し、対象属性(毒性、中国語、古典的な文体など)に最も関連性の高い特徴の方向性を特定します。
-
機能介入式推論中、残差フローは h′ ← h + αd によって変更されます。ここで、d は SAE 特徴の方向であり、α は介入強度を制御します。正の値は特徴を強調し、負の値はそれを抑制します。
Qwen-Scopeの使い方
-
アクセスエクスペリエンスプラットフォームハギングフェイスのオンラインスペースをご覧ください。
-
モデルの重量を選択してください対象モデル(例:Qwen3-8B、Qwen3.5-27B)に基づいて、対応するSAEウェイトを読み込みます。
-
活性化を観察するための入力プロンプトSAE機能の有効化ヒートマップとランキングを表示するには、プロンプトワードを入力してください。
-
対象の特徴を特定する異常箇所またはターゲットフィーチャID(中国語フィーチャ6159、古典中国語フィーチャ36398など)を特定します。
-
介入の強度を調整する特徴介入係数αを設定することで、特定の特徴を正に強化したり、負に抑制したりすることができます。
-
制御効果を検証する介入前後のモデル出力を比較して、不良ケースが修復されたか、スタイル変換が成功したかを確認します。
-
統合トレーニングプロセスSAE信号をSFT/RL損失関数に組み込むことで、方向性モデルの最適化を実現できる。
Qwen-Scopeの主要情報と使用要件
-
出版社アリババ / 同義前文チーム
-
カバレッジモデル:Qwen3-1.7B/8B、Qwen3-30B-A3B、Qwen3.5-2B/9B/27B/35B-A3B(計7種)
-
モデルタイプ高密度モデル+ハイブリッドエキスパート(MoE)アーキテクチャ
-
SAE規格重量Transformerのすべてのレイヤーを網羅する14のグループ。
-
トレーニングデータ各モデルの事前学習データは、0.5Bユニットをサンプリングした。
-
特徴寸法:32K / 64K / 80K / 128K
-
再構築された特徴の数を表します50または100
-
オンライン体験Hugging FaceとModelScopeはどちらもオンラインで利用できます。
Qwen-Scopeの主な利点
-
「理解」から「改善」へ従来の事後分析を超え、解釈可能性がモデル進化を推進する中核的な原動力へと変貌を遂げる。
-
重み付けなしの変更介入推論段階では、特徴の方向を直接操作することができ、モデルパラメータの微調整や更新を行わずに、出力挙動を変更することが可能です。
-
データ効率と低依存度少量のシードデータ(約200ペア)だけでも非常に識別力の高い特徴を発見でき、分類F1スコアは0.90以上に達するため、ラベル付けコストを大幅に削減できます。
-
的を絞った精密な最適化言語の混在や繰り返し生成といった低頻度の不良事例については、SFT段階によって異常な特徴を正確に特定し、中国語の混在率を0.81%から0.22%に低減できる。
-
評価コスト最適化特徴量カバレッジ分析は、評価セット内の冗長性を特定し、カバレッジの高いサンプルを選択して評価のオーバーヘッドを削減するのに役立ちます。
Qwen-Scopeプロジェクトの住所
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Qwen/qwen-scope
- 技術論文:https://qianwen-res.oss-accelerate.aliyuncs.com/qwen-scope/Qwen_Scope.pdf
Qwen-Scopeの類似競合製品の比較
| 比較対象寸法 | Qwen-Scope | Gemma Scope |
|---|---|---|
| 出版社 | アリババ/同義千問 | Google DeepMind |
| カバレッジモデル | Qwen3 / Qwen3.5シリーズ(7モデル) | ジェマ2/3シリーズ |
| アーキテクチャサポート | 高密度モデル + MoE | 高密度モデル |
| SAEアーキテクチャ | Top-k SAE | JumpReLU SAE |
| オープンソースの規模 | SAE規格の分銅14セット | 400以上のSAE、3000万以上のフィーチャー |
| コアアプリケーション | 推論制御、評価分析、データ合成、トレーニング最適化 | メカニズムの説明、セキュリティ分析、回路追跡 |
| データ合成 | 特徴量駆動型合成により、データエネルギー効率が約15倍向上する。 | 主に従来型の合成手法に依存している |
| 評価と分析 | ベンチマークの冗長性とカバレッジ分析をサポートします | 機能の視覚化とインタラクティブな探索に重点を置く |
| 中国からの支援 | 古典中国語などの独特なスタイル機能を含む、ネイティブサポート。 | 主に英語圏のシナリオを想定している |
| インタラクティブプラットフォーム | ハグフェイス / マジックダッシュコミュニティ | Neuronpedia |
Qwen-Scopeの応用シナリオ
-
推論制御と修復英語のプロンプトで中国語と他の言語が予期せず混在する問題を修正しました。現代語から古典語へのテキスト変換などのスタイル変換を可能にしました。
-
安全なデータガバナンス特徴発見に基づく多言語有害コンテンツ分類。安全なトレーニングデータのターゲット合成により、わずか4kの合成データを使用して12万件の実データとほぼ同等の安全なアライメント結果を実現。
-
モデル研修支援SFT段階では、SAE支援損失を用いて異常な活性化を抑制し、RL段階では、反復相関特性を操作することで異常応答のサンプリング周波数を増加させ、収束を加速させる。
-
評価セットの最適化GSM8K、MATH、MMLU-Proなどのベンチマーク間の特徴重複マトリックスを分析し、冗長な評価セットを排除して、評価効率を向上させます。
-
モデル解釈可能性研究これは、学術界と産業界向けにオープンソースのSAE基盤を提供し、錯覚やバイアスのメカニズムの説明、回路追跡、根本原因分析をサポートします。