project
OmniHuman - ByteDanceが開発した、一枚の写真から全身の動的な動画を生成するためのフレームワーク。
OmniHumanは、ByteDanceが開発したエンドツーエンドのマルチモーダル条件付き人間動画生成フレームワークです。単一の人間画像とモーション信号(音声、映像、またはその両方の組み合わせなど)に基づいて、リアルな人間動画を生成できます。OmniHumanは…
OmniHumanとは何ですか?
OmniHumanは、ByteDanceが開発したエンドツーエンドのマルチモーダル条件付き人間動画生成フレームワークです。単一の人物画像とモーション信号(音声、映像、またはその両方の組み合わせなど)に基づいて、リアルな人間動画を生成できます。OmniHumanは、マルチモーダルモーション条件付きハイブリッド学習戦略を採用することで、従来の手法における高品質データの不足によるパフォーマンスのボトルネックを克服しています。縦横比が任意の画像入力(縦長、上半身、全身など)に対応し、様々なシナリオに適応できます。OmniHumanは、歌唱、会話、ジェスチャー処理に優れ、複数のビジュアルスタイルとオーディオスタイルをサポートし、オーディオ、ビデオ、および複合駆動技術と互換性があり、高品質な動画コンテンツを生成できます。
OmniHumanの主な機能
- マルチモーダル駆動型ビデオ生成:
- 音声駆動型(会話や歌唱など)とジェスチャー駆動型(ジェスチャーや動きなど)のアプローチをサポートしており、両者を組み合わせることで、自然で滑らかな人間の動きの動画を生成できます。
- 顔のクローズアップ、上半身のポートレート、全身のポートレートなど、複数の入力フォーマットに対応しており、さまざまな比率やスタイルの画像と互換性があります。
- 高い写実性と多様な動き:
- 生成された動画は、自然な表情、体の動き、滑らかな動的効果など、視覚的に非常にリアルです。
- 楽器を演奏しながら歌うといった複雑な動作やオブジェクトとの相互作用、ジェスチャーとオブジェクト間の自然な相互作用などを処理できます。
- 柔軟なビデオ生成:
- 任意のアスペクト比と再生時間での動画生成をサポートし、入力信号に基づいて様々な長さの動画クリップを生成します。
- 写実的なキャラクター、漫画風のキャラクター、様式化されたキャラクターなど、さまざまな画像スタイルに対応しています。
- 複数のシナリオへの適応性さまざまな背景、照明条件、カメラアングルなど、多様なシナリオで高品質な動画を生成します。
OmniHuman の技術原則
- 複合条件トレーニング戦略:
- マルチコンディション融合このアプローチでは、テキスト、音声、姿勢など、動作に関連するさまざまな条件をトレーニングプロセスに統合することで、データフィルタリングによる無駄を削減し、異なる条件間の相補性を活用します。
- 段階的訓練3段階のトレーニング戦略に基づき、異なる条件(テキスト、音声、姿勢)を段階的に導入し、条件の強さに応じてトレーニング比率を調整することで、モデルの汎化能力を最適化します。
- トレーニングの原則条件が厳しいタスクについては、条件が弱いタスクとその対応するデータを使用してデータ規模を拡大します。条件が厳しいほど、モデルが強い条件に過度に依存しないように、トレーニング比率を低くする必要があります。
- 拡散変換器アーキテクチャ:
- DiTベースのモデルOmniHumanは、高度なビデオ生成モデルアーキテクチャであるDiTに基づいており、因果的3DVAEを使用してビデオを潜在空間に投影し、フローマッチングをトレーニング目標として使用します。
- 条件付き注入:
- 音声条件音声特徴はwav2vecモデルを使用して抽出され、ビデオフレームの特徴と組み合わせて音声トークンが生成され、その後、クロスアテンションメカニズムに基づいてモデルに注入されます。
- 姿勢の状態姿勢条件は、姿勢ガイドを使用して処理されます。姿勢ガイドは、姿勢ヒートマップの特徴とビデオフレームの特徴を組み合わせて姿勢トークンを生成し、生成されたトークンはノイズを含む潜在表現とともにモデルに入力されます。
- テキスト条件生成されたビデオの内容を記述するために、DiTアーキテクチャ内のテキストブランチを保持します。
- 参照条件処理本システムは、追加のネットワークモジュールを必要とせずに、参照画像の特徴とビデオの特徴を融合するために、修正回転位置埋め込み(RoPE)に基づく革新的な参照条件戦略を採用しています。
- 推論戦略:
- 無料分類器ガイダンス(CFG)推論処理中、音声およびテキスト条件に対してCFG戦略が適用されます。これは、表現力と計算効率のバランスを取り、生成されるビデオの不完全性(しわなど)を軽減するために、CFGの強度を徐々に下げていくことに基づいています。
- 長尺動画の生成長尺動画を生成する際に、時間的な連続性と人物の同一性の一貫性を確保するために、前の動画クリップの最後の数フレームをモーションフレームとして使用します。
OmniHumanのプロジェクトアドレス
- プロジェクト公式サイト:https://omnihuman-lab.github.io/
- arXiv技術論文:https://arxiv.org/pdf/2502.01061
OmniHuman の適用シナリオ
- 映画とエンターテイメント仮想キャラクターアニメーション、仮想アンカー、ミュージックビデオなどを生成し、コンテンツ制作の効率と視覚効果を向上させます。
- ゲーム開発ゲームキャラクターやNPCの自然な動きを生成し、ゲームへの没入感とインタラクティブ性を向上させます。
- 教育と訓練言語学習や職業技能訓練を支援するために、仮想教師や模擬訓練ビデオを作成する。
- 広告とマーケティングユーザーエンゲージメントとコンテンツの魅力を高めるために、パーソナライズされた広告やブランドプロモーション動画を作成する。
- ソーシャルメディアとコンテンツ制作クリエイターが高品質なショートビデオを素早く作成できるよう支援し、インタラクティブなビデオ制作をサポートし、コンテンツの楽しさを高めます。