project
Skywork-VL報酬 - Skywork AIのオープンソースマルチモーダル報酬モデル
Skywork-VL Rewardは、Skywork AIが開発したオープンソースのマルチモーダル報酬モデルであり、マルチモーダルな理解と推論タスクのための信頼性の高い報酬シグナルを提供します。このモデルはQwen2.5-VL-7B-Instructアーキテクチャに基づいており、報酬ヘッド構造を組み込んでいます。
Skywork-VL報酬とは何ですか?
Skywork-VL Rewardは、Skywork AIが開発したオープンソースのマルチモーダル報酬モデルで、マルチモーダルな理解と推論タスクに信頼性の高い報酬シグナルを提供します。Qwen2.5-VL-7B-Instructアーキテクチャをベースとしたこのモデルは、報酬ヘッド構造を採用し、ペアワイズ選好データで学習され、人間の選好に合わせたスカラー報酬スコアを出力します。VL-RewardBenchでは最先端(SOTA)スコア73.1を達成し、RewardBenchでは90.1という高スコアを記録するなど、非常に優れたパフォーマンスを発揮します。Skywork-VL Rewardは、ハイブリッド選好最適化(MPO)に基づくマルチモーダル推論能力を大幅に向上させ、マルチモーダル強化学習の分野に新たなブレークスルーをもたらします。
Skywork-VL Rewardの主な機能
- マルチモーダル出力の評価視覚言語モデル(VLM)によって生成された出力の品質を評価し、それが人間の好みに合致しているかどうかを判断する。
- 報酬シグナルを提供する生成されたコンテンツの品質、または人間の好みとの一致度を反映した、スカラー値の報酬スコアを出力します。
- マルチモーダルなタスクをサポートする画像記述や複雑な推論など、さまざまなマルチモーダルタスクに適用可能であり、幅広い応用性を持つ。
- モデルのパフォーマンスを向上させる高品質な選好データを生成することに基づき、ハイブリッド選好最適化(MPO)をサポートし、マルチモーダル推論能力を大幅に向上させる。
Skywork-VL Rewardの技術原理
- モデルアーキテクチャQwen2.5-VL-7B-Instructアーキテクチャをベースとしたこのアーキテクチャは、ビジュアルエンコーダ(Vision Transformer)、ビジョン言語アダプタ、および言語モデルデコーダで構成されています。基本モデルには、スカラー報酬スコアを出力するための報酬ヘッド構造が追加されています。報酬ヘッドは、全結合層に基づいて最終隠れ状態を処理し、報酬スコアを生成します。
- データセットの構築このアプローチでは、複数のオープンソースの選好データセット(LLaVA-Critic-113k、Skywork-Reward-Preference-80K-v0.2、RLAIF-V-Datasetなど)と、内部でラベル付けされた複雑な推論タスクデータを統合します。重複排除、類似性フィルタリング、選好判断フィルタリングなどの手順を通じて、高いデータ品質と一貫性を確保します。高度なVLM推論エンジンを使用して高品質の選好データが生成され、モデルの汎化能力が向上します。
- トレーニング方法ペアワイズ選好損失関数に基づき、モデルは2つの候補応答の長所を比較することで学習され、相対的な順位付けが可能になります。2段階のファインチューニングが採用されており、第1段階ではマルチモーダルな選好データを使用して学習を行い、第2段階ではプレーンテキストの選好データを取り入れることで、プレーンテキストシナリオにおけるモデルのパフォーマンスをさらに向上させます。
Skywork-VL報酬プロジェクトの住所
- ハギングフェイスモデルライブラリ:https://huggingface.co/Skywork/Skywork-VL-Reward
- arXiv技術論文:https://arxiv.org/pdf/2505.07263
Skywork-VL報酬の適用シナリオ
- コンテンツ生成評価画像の説明や動画のキャプションなど、マルチモーダルコンテンツ生成の品質を評価し、生成されたコンテンツが正確で人間の好みに合致しているかどうかを判断する。
- 推論タスクの最適化視覚的な質問応答や幾何学的問題といった複雑なマルチモーダル推論タスクにおいて、推論プロセスと結果の合理性を評価し、推論モデルの最適化を支援します。
- モデルアライメントマルチモーダルモデルの出力が人間の価値観や倫理基準に合致していることを確認し、有害または誤解を招くようなコンテンツが生成されないようにしてください。
- 混合選好最適化(MPO)MPOトレーニングの重要な構成要素として、高品質な選好データを提供し、マルチモーダルモデルの推論能力と汎化性能を向上させます。
- ベンチマークマルチモーダルタスクのベンチマークツールとして、さまざまなモデルの性能を評価・比較し、マルチモーダル技術の発展を促進します。