project
AxBench - スタンフォード大学は、言語モデル制御手法を評価するためのベンチマークフレームワークを発表しました。
AxBenchは、スタンフォード大学が開発した言語モデル(LM)制御手法を評価するためのベンチマークフレームワークです。合成データで生成された学習データと評価データに基づいて、概念検出とモデル制御におけるさまざまなモデル制御手法を比較します。
AxBenchとは何ですか?
スタンフォード大学が開発したAxBenchは、言語モデル(LM)の解釈可能性を評価するためのベンチマークフレームワークです。合成データを用いて学習データと評価データを生成することで、概念検出とモデルステアリングにおける様々なモデル制御手法の性能を比較します。概念検出タスクでは、ラベル付き合成データを用いて特定の概念を認識するモデルの能力を評価します。モデルステアリングタスクでは、長文生成タスクを用いて介入後のモデル性能を評価し、別の言語モデルを「審査員」としてスコアリングを行います。AxBenchは、様々な言語モデル制御手法の有効性を体系的に評価・比較するための統一プラットフォームを研究者に提供し、言語モデルの安全性と信頼性に関する研究を促進します。
AxBenchの主な機能
- 言語モデル制御手法の評価:
- 概念検出(C)ラベル付けされた合成データに基づいて、モデルが特定の概念を認識する能力を評価する。
- モデルステアリング(S)介入後のモデルの性能は、長文生成タスクに基づいて評価された。
- 統一された評価フレームワークを提供する本プラットフォームは、ヒント、ファインチューニング、スパースオートエンコーダーなど、さまざまな言語モデル制御手法に対応した統一的な評価プラットフォームを提供し、各手法の長所と短所の比較を容易にします。複数のモデルとタスク設定をサポートし、異なる言語モデルや概念記述にも拡張可能です。
- 合成データを生成するAxBenchは、自然言語による概念記述に基づいてトレーニングデータと評価データを生成し、大規模な実験やベンチマークをサポートします。データ生成プロセスには、正例(対象概念を含むテキスト)と負例(対象概念を含まないテキスト)の生成が含まれ、「ハード負例」(対象概念と意味的に関連しているが、その概念を活性化しないテキスト)の生成もサポートしています。
- 複数の評価指標に対応:
- コンセプトテストモデルが概念を分類する能力は、ROC AUC(受信者操作特性曲線下面積)を用いて評価される。
- モデルターン言語モデル「judge」は、生成されたテキストを3つの側面(概念的関連性、指示との関連性、流暢さ)で評価し、シフト効果を包括的に評価します。
AxBenchの技術原則
- 合成データ生成:
- 肯定的な例:プロンプト言語モデルに基づいて、目標概念を含むテキストを生成する。
- 否定的な例:プロンプト言語モデルに基づいて、目標概念を含まないテキストを生成する。
- 難易度の例:対象概念と意味的に関連しているが、その概念を活性化しないテキストを生成することに基づいて、評価の難易度と識別力が向上します。
- コンセプトテストと評価ラベル付き合成データを訓練セットとして使用し、概念検出器(線形プローブ、差分平均など)を訓練します。ROC AUC、つまり正例と負例を区別するモデルの性能に基づいて、検出器の概念分類能力を評価します。
- モデル指向評価:
- 介入モデルの内部表現(例えば、特定の方向にベクトルを追加するなど)を活用することで、モデルによって生成されるテキストは、対象となる概念により合致したものとなる。
- 言語モデル「judge」は、生成されたテキストを3つの側面(概念的関連性、指示との関連性、流暢さ)で評価し、シフト効果を包括的に評価します。
- 複数のメソッドをサポート:
- AXBENCHは、プロンプト、ファインチューニング、スパースオートエンコーダー(SAE)、リニアプローブなど、さまざまな言語モデル制御方法をサポートしています。
- 本システムは、モデルの内部表現に介入するために特定の方向のベクトルを学習することに基づく、さまざまな表現介入手法(ReFT-r1など)の実装を提供し、それによってモデルの出力の制御を可能にします。
AxBenchプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/stanfordnlp/axbench
- arXiv技術論文:https://arxiv.org/pdf/2501.17148
AxBenchの応用シナリオ
- ソーシャルメディアコンテンツのモデレーションソーシャルメディアプラットフォームは、プラットフォームの安全性と健全性を維持するために、ヘイトスピーチ、誤情報、不適切なコンテンツなどの有害なコンテンツを自動的に検出し、フィルタリングします。
- 教育コンテンツの生成オンライン教育プラットフォームは、カリキュラムや価値観に沿った質の高い教育コンテンツ、例えばコース紹介、演習問題、解説文などを作成する必要がある。
- 健康管理医療分野においては、AIが生成するテキストは、医療倫理と事実の正確性を厳守しなければならない。例えば、医療アドバイス、健康教育記事、医療記録などを生成する場合などがこれに該当する。
- 多言語コンテンツのローカライズ多国籍企業やコンテンツプラットフォームは、一貫性と正確性を維持しながら、コンテンツをさまざまな言語や文化環境に合わせてローカライズする。
- AIの整合性と倫理的研究自動運転、金融意思決定、法律相談といった分野では、AIの出力は倫理的および法的要件を遵守する必要がある。