project
自己学習型評価者 - Metaが提唱する新しいモデル評価方法
自己学習型評価器は、自己学習によって大規模言語モデル(LLM)の評価能力を向上させ、手動でラベル付けされたデータの必要性を排除する、新しいモデル評価手法です。ラベル付けされていない指示から始めて、反復的に...
独学で評価者になるにはどうすればよいですか?
自己学習型評価器は、手動でラベル付けされたデータを必要とせず、自己学習によって大規模言語モデル(LLM)の評価能力を向上させる新しいモデル評価手法です。ラベル付けされていない指示から開始し、反復的な自己改善によって比較可能なモデル出力を生成します。LLMは審査員として機能し、推論軌跡と最終的な判断を生成します。このプロセスは各反復で繰り返され、改善された予測でモデルがトレーニングされます。実験では、自己学習型評価器はLlama3-70B-Instructベースのモデルの評価精度を75.4から88.3に向上させ、多数決では88.7に達し、GPT-4などの一般的に使用されているLLM審査員を上回り、手動でラベル付けされたデータでトレーニングされた最高性能の報酬モデルと同等の性能を発揮しました。
独学評価者の主な機能
- 比較モデルの出力を生成するラベルのない指示から始めて、プロンプトに基づいて品質の異なるモデル応答ペアを生成します。
- 法学修士号取得者を審判員として育成するLLMを使用して推論経路と最終決定を生成し、どちらの応答が優れているかを評価する。
- 反復的な自己改善各反復処理において、訓練データには現在のモデルの判断結果がラベル付けされ、モデルが微調整され、自己改善が達成される。
- モデルのパフォーマンスを評価するモデルの精度は、RewardBenchなどの標準的な評価プロトコルに基づいて評価され、人間の評価結果と比較されます。
独学評価者の技術的原理
- 初期化多数の人間が作成したユーザー向け説明書と、初期シードとなるLLMにアクセスできることを前提とする。
- コマンド選択指示はLLMに基づいて分類され、難易度とバランスの取れた分布を持つ指示のサブセットが選択される。
- 建設への対応選択された各指示に対して、プロンプトに基づいて生成された2つの応答(好ましい応答と好ましくない応答)を含む設定データを生成します。この際、好ましくない応答の品質が好ましい応答の品質よりも低くなるようにします。
- 反復トレーニングこのプロセスは、アノテーション評価とモデルの微調整という2つのステップで構成されます。まず、現在のモデルを使用して推論軌跡と判断を生成します。判断が正しければ、その例がトレーニングセットに追加されます。次に、データを使用してモデルを微調整し、次の反復処理のために更新されたモデルを提供します。
独学で評価者を育成するプロジェクト
- GitHubリポジトリ:https://github.com/facebookresearch/RAM/tree/main/projects/self_taught_evaluator
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/facebook/Self-taught-evaluator-DPO-data
- arXiv技術論文:https://arxiv.org/pdf/2408.02666
独学で評価者を育成する事例
- 言語モデル開発新しい大規模言語モデル(LLM)を開発する際、独学で評価を行う評価者は、モデルによって生成されるテキストが期待される基準を満たしていることを確認するために、モデルの出力品質を評価および最適化します。
- 自動コンテンツ評価ニュース組織、出版業界、ソーシャルメディアプラットフォームなどのコンテンツ制作分野では、コンテンツの品質と正確性の評価を自動化し、コンテンツレビューの効率を向上させるために利用されています。
- 教育と学術研究教育分野において、独学で評価を行う人は、学生の作文課題や研究論文を評価するための補助ツールとして機能し、フィードバックや改善のための提案を提供する。
- カスタマーサービスおよびテクニカルサポート顧客サービスにおいては、自動応答システムの品質を評価するために使用され、応答が正確かつ有益であることを保証することで、顧客満足度の向上につながる。
- プログラミングとコード生成コード生成と評価が必要なシナリオでは、自己学習型評価ツールが生成されたコードスニペットの品質を評価し、開発者がコードを改善するのに役立ちます。