AB
AiBoss
project

DanceGRPO - ByteDance Seedと香港大学が共同開発した、統一された視覚生成型強化学習フレームワーク。

DanceGRPOは、ByteDance Seedと香港大学が共同で開発した、初の統合型ビジュアル生成強化学習フレームワークです。視覚生成の分野に強化学習を応用し、2つの主要な生成パラダイム(拡散生成と整流生成)を網羅しています。

DanceGRPOとは何ですか?

DanceGRPOは、ByteDance Seedと香港大学が共同で開発した、ビジュアル生成のための初の統一強化学習フレームワークです。ビジュアル生成の分野に強化学習を適用し、2つの主要な生成パラダイム(拡散と整流)、3つのタスク(テキストから画像、テキストから動画、画像から動画)、4つの基本モデル(SD、HunyuanVideo、FLUX、SkyReels-I2V)、および5つの報酬モデル(画像と動画の美学、画像とテキストのアライメント、動画の動的品質、バイナリ報酬)を網羅しています。DanceGRPOは、ビジュアル生成タスクにおける既存のRLHFソリューションの限界に対処し、複数の生成パラダイム、タスク、基本モデル、報酬モデル間でシームレスな適応を実現します。モデルのパフォーマンスを大幅に向上させ、メモリ負荷を軽減し、大規模なプロンプトデータセットでのトレーニングに対応し、整流および動画生成モデルにも適用可能です。

DanceGRPOの主な機能

  • ビジュアル生成品質を向上させる生成される画像や動画を、より美しく、リアルで、自然なものにするため。
  • 複数の世代のパラダイムとタスクを統合するテキストから画像への変換、テキストから動画への変換、画像から動画への変換など、様々なタスクに適しています。
  • 複数のモデルと報酬体系に対応可能多様なニーズに対応するため、複数の基本モデルと報酬モデルに対応しています。
  • トレーニングの効率と安定性を向上させる記憶への負担を軽減し、トレーニング効率を向上させ、トレーニングの安定性を高めます。
  • 人間のフィードバック学習能力の向上モデルが人間のフィードバックからより良く学習し、人間の期待をよりよく満たすコンテンツを生成できるようにするため。

DanceGRPOの技術的原則

  • ノイズ除去プロセスは、マルコフ決定過程としてモデル化される。拡散モデルと整流流のノイズ除去プロセスは、マルコフ決定過程(MDP)としてモデル化され、プロンプトは状態の一部、ノイズ除去プロセスの各ステップはアクションとして扱われ、強化学習を適用するための基本的なフレームワークを提供する。
  • に基づく SDEサンプリング方程式GRPOの確率的探索の要件を満たすため、拡散モデルと整流フローのサンプリングプロセスは、確率微分方程式(SDE)の形式で統一的に表現されます。拡散モデルの場合、順方向SDEはデータに徐々にノイズを加えるプロセスを記述し、対応する逆方向SDEはデータを生成します。整流フローの場合、逆プロセスのランダム性はSDEを導入することで実現され、強化学習に必要な確率的探索メカニズムを提供します。
  • GRPO目的関数を用いた最適化このアプローチは、Deepseek-R1のGRPO戦略を借用しています。プロンプトが与えられると、一連の出力サンプルを生成し、GRPOを最大化する目的関数に基づいてポリシーモデルを最適化します。目的関数は、報酬シグナルと異なるサンプル間の優位性関数を考慮します。トレーニング中、モデルは報酬シグナルに応じて生成戦略を調整する方法をより良く学習し、生成される結果の品質と人間の好みとの一貫性を向上させることができます。
  • 初期化ノイズと時間ステップ選択戦略DanceGRPOフレームワークでは、初期化ノイズが重要な要素となります。報酬ハッキングを防ぐため、DanceGRPOは同じテキストプロンプトからのサンプルに共通の初期化ノイズを割り当てます。DanceGRPOは、適切な最適化タイムステップを選択することで、計算量を削減し、パフォーマンスを犠牲にすることなくトレーニング効率を向上させるタイムステップ選択戦略を採用しています。
  • 複数報酬モデルの統合と優位性関数の集約DanceGRPOは、トレーニングの安定性と高品質な生成結果を確保するため、実際には複数の報酬モデルを使用しています。異なる報酬モデルは次元や分布が異なる可能性があるため、DanceGRPOは優位関数集約法を用いて、異なる報酬モデルの寄与をより適切にバランスさせています。これにより、モデルは最適化の際に複数の評価指標を総合的に考慮することができ、人間の期待をより満たす視覚コンテンツを生成できます。

DanceGRPOのプロジェクト住所

DanceGRPOの応用事例

  • テキストから画像への生成テキストの説明に基づいて高品質な画像を生成し、広告デザイン、ゲーム開発などの分野で活用することで、クリエイティブな効率性を向上させることができます。
  • テキストからビデオへの変換テキストに基づいて滑らかで一貫性のある動画を生成するため、動画広告や教育動画制作に適しており、人件費を削減できます。
  • 画像から動画への変換静止画像を動的な動画に変換する機能があり、アニメーション制作やバーチャルリアリティにおいて、視覚体験を豊かにするために活用できます。
  • マルチモーダルコンテンツの作成テキスト、画像、動画を組み合わせて多様なコンテンツを生成し、マルチメディア教育、インタラクティブエンターテインメント、その他の分野で応用することで、没入感を高めることができる。
  • クリエイティブなデザインと芸術的な創造これは、アーティストやデザイナーが創造的なインスピレーションや作品を素早く生み出すのに役立ち、創造性を刺激し、創造効率を向上させます。