AB
AiBoss
project

Skywork-Reward-V2 - 崑崙万威によるオープンソースの第2世代報酬モデルシリーズ

Skywork-Reward-V2は、Kunlun Wanweiの第2世代オープンソース報酬モデルシリーズで、異なる基本モデルとサイズに基づいた8つのモデルで構成され、パラメータスケールは6億から80億までです。Skywork-Reward-V2シリーズのモデルは、7つの主要な形式で利用可能です。

Skywork-Reward-V2とは何ですか?

Skywork-Reward-V2は、Kunlun Wanweiが開発した第2世代のオープンソース報酬モデルシリーズで、異なる台座モデルとサイズに基づいた8つのモデルから構成され、パラメータスケールは6億から80億に及びます。Skywork-Reward-V2シリーズのモデルは、主要な7つの報酬モデルベンチマークすべてでトップの成績を収め、卓越したパフォーマンスを発揮しています。このモデルの成功は、Skywork-SynPref-40Mデータセットによるものです。このデータセットは、4,000万組の選好サンプルを含む混合データセットで、人間と機械による2段階の協働プロセスを通じて綿密に選択・フィルタリングされています。Skywork-Reward-V2は、一般的な選好の整合性、客観性、セキュリティに優れ、Best-of-Nスケーラビリティとスタイルバイアス耐性において強力な汎化能力を発揮します。

Skywork-Reward-V2の主な機能

  • 一般的な嗜好の一致複数の回答の中から、人間の一般的な好みをよりよく反映しているものを正確に判断することで、モデルの出力が人間の主観的な判断により近いものになるようにします。例えば、チャットの場面でより自然で適切な応答を選択するといったことが可能です。
  • 客観的な精度評価回答の客観性と正確性を効果的に識別します。明確な事実に基づいた質問に対しては、数学的計算や事実調査などの課題における回答の正確性を判断するなど、正解を絞り込むことができます。
  • セキュリティ評価このシステムは、回答が安全かどうかを識別し、有害または不適切な内容を含む回答の生成を回避し、暴力、差別、その他の不適切な内容を含む回答を除外するなど、モデルの出力が倫理的および安全基準を満たしていることを保証する能力を備えています。
  • ベストオブNのスケーラビリティ複数の候補回答がある場合、効率的に最適な回答を選択することができ、複数選択シナリオにおけるモデルの意思決定能力を向上させます。例えば、複数ターンの対話においてユーザーに最適な解決策を提供するなどです。
  • スタイル逸脱耐性本モデルは、様々なスタイルの応答に対して高い適応性と公平性を示し、応答スタイルの違いによって偏りが生じることはありません。そのため、文学作品や専門的な議論など、様々なスタイルのテキストにおいて、合理的な判断を下すなど、多様な表現における客観的な評価を維持することができます。

Skywork-Reward-V2の技術原理

  • Skywork-SynPref-40Mは、大規模かつ高品質なデータセットです。本データセットには4,000万組の嗜好サンプルが含まれており、モデル学習のための豊富なデータ基盤を提供します。人間と機械が協働する2段階のプロセスに基づき、手動アノテーションの高い品質とモデルのスケーラブルな処理能力を組み合わせることで、膨大なデータの中から2,600万点の高品質な嗜好データポイントを選択し、データの多様性と精度を確保しました。
  • ブラッドリー・テリーモデルに基づくトレーニング報酬モデルは、古典的なブラッドリー・テリーモデルに基づき、異なる回答間の相対的な選好スコアを計算することで学習されます。学習過程において、モデルは人間の選好に基づいて回答をランク付けする方法を継続的に学習し、報酬シグナルを最適化し、人間の選好特性をより的確に捉えることができるようになります。
  • 複数ラウンドの反復トレーニングと最適化複数ラウンドの反復学習に基づき、モデルは各ラウンドにおける現在のパフォーマンスに基づいて弱点を特定し、類似サンプルを取得してマルチモデルコンセンサスメカニズムを用いて自動的にラベル付けすることで、学習データをさらに拡張・強化します。この反復最適化プロセスにより、モデルの嗜好理解力と識別能力が継続的に向上し、様々なベンチマークにおいて優れたパフォーマンスを実現します。
  • モデルアーキテクチャとパラメータチューニングQwen3およびLLaMA3シリーズモデルをベースにした本システムは、様々なシナリオのニーズに対応するため、異なるパラメータスケールを持つモデルを提供します。学習率やバッチサイズなどのモデルパラメータと学習戦略を調整することで、モデルのパフォーマンスを最適化し、大規模データ学習においても効率的な収束と安定したパフォーマンスを実現します。

Skywork-Reward-V2プロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/SkyworkAI/Skywork-Reward-V2
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Skywork/skywork-reward-v2-685cc86ce5d9c9e4be500c84
  • arXiv技術論文:https://arxiv.org/pdf/2507.01352

Skywork-Reward-V2の応用シナリオ

  • 対話システムの最適化対話システムによって生成された応答を評価し、人間の言語習慣や好みに合致する回答を選択することで、インテリジェントな顧客サービスやチャットボットなどのシステムのインタラクション品質とユーザーエクスペリエンスを向上させる。
  • コンテンツ推薦の最適化コンテンツ推薦システムでは、さまざまなコンテンツアイテムの魅力と関連性が評価され、ユーザーの過去の行動や嗜好に基づいて、より正確でパーソナライズされた推薦が提供される。これにより、推薦システムの精度とユーザー満足度が向上する。
  • 教育指導と支援教育分野においては、学生が提出した解答を評価し、その正確性と完全性を判断し、的を絞ったフィードバックと指導を提供し、教師が授業評価を実施するのを支援することが含まれる。
  • コンテンツモデレーション暴力、ポルノ、差別などの有害、不適切、または違法なコンテンツを検知・フィルタリングすることで、ソーシャルメディア、フォーラム、その他のプラットフォームの安全かつ法令遵守に基づいた運営を保証します。
  • ゲーム最適化ゲーム開発においては、ゲームの没入感と楽しさを高めるために、ゲームのストーリー、キャラクターのセリフ、クエストデザインといったテキストコンテンツを評価・最適化します。