project
OmniSync - 人民大学、快手、清華大学が共同で開発した、汎用的なリップシンクフレームワーク。
OmniSyncは、中国人民大学、快手科技、清華大学が共同開発した汎用リップシンクフレームワークです。拡散トランスフォーマーを使用して、動画内の唇の動きと音声の正確な同期を実現します。OmniSyncは…
OmniSyncとは何ですか?
OmniSyncは、中国人民大学、快手科技、清華大学が共同開発した汎用リップシンクフレームワークです。拡散トランスフォーマーをベースとし、動画内の唇の動きと音声の正確な同期を実現します。OmniSyncは、マスクレス学習パラダイムを使用して動画フレームを直接編集するため、参照フレームや明示的なマスクは不要です。自然な顔の動きと人物の一貫性を維持しながら、推論期間に制限はありません。OmniSyncは、ストリームマッチングに基づくプログレッシブノイズ初期化と動的時空間分類器フリーガイダンス(DS-CFG)メカニズムを導入し、弱い音声信号の問題を解決して正確なリップシンクを保証します。OmniSyncは、AI生成動画のリップシンク性能を評価するためのベンチマークであるAIGC-LipSyncを確立しました。
OmniSyncの主な機能
- マスクなしトレーニング参照フレームやマスクを使用せずにビデオフレームを直接編集でき、無制限の期間推論をサポートします。
- 身元保護頭部の姿勢と人物像の一貫性を確保しつつ、口元を正確に修正する。
- 音声条件を改善する動的な時空間誘導機構に基づいて、微弱な音声信号の問題を解決する。
- 一般的な互換性様式化されたキャラクター、人間以外の存在、およびAI生成コンテンツに適しています。
- 無限期間控除時間の経過とともに、自然な表情の動きと一貫性を維持する。
- オクルージョンの堅牢性顔が隠れるなどの複雑な状況下でも、高品質なリップシンクを維持する。
OmniSyncの技術原理
- マスクなしのトレーニングパラダイム拡散変換器に基づく直接的なフレーム間編集を可能にし、明示的なマスクや参照フレームの必要性を排除します。反復的なノイズ除去学習マッピング関数を採用し、時間ステップ依存のサンプリング戦略を導入することで、ノイズ除去の各段階で異なるデータセットを使用し、安定した学習を保証します。
- 漸近ノイズ初期化フローマッチングに基づいて、制御ノイズを元のフレームに注入し、空間的な一貫性を維持するために最終的なノイズ除去ステップのみを実行します。これにより、口領域の正確な修正が可能になり、姿勢の不整合や同一性ドリフトの問題を効果的に解決できます。
- 動的時空間分類器フリーガイダンス(DS-CFG)これにより、時空間的に適応したガイダンスに基づいて音声条件の強度をバランスさせることで、音声の影響をきめ細かく制御できます。空間適応型ガイダンスは、ガウス重み付けされた空間ガイダンスマトリックスを使用して、ガイダンス強度を口の領域に集中させます。時間適応型ガイダンスは、ノイズ除去処理の進行に伴ってガイダンス強度を徐々に低減し、拡散の初期および中期段階では強力なガイダンスを確保し、後期の詳細化段階では干渉を低減します。
OmniSyncプロジェクトのアドレス
- プロジェクト公式サイト:https://ziqiaopeng.github.io/OmniSync/
- arXiv技術論文:https://arxiv.org/pdf/2505.21448
OmniSyncの応用シナリオ
- 映画やテレビ番組の吹き替えキャラクターの口の動きと声優の演技を正確に一致させるため。
- バーチャルリアリティ仮想キャラクターのリアルな口パクを実現し、没入感を高めます。
- AIによるコンテンツ生成AI生成動画におけるリップシンクの自然さを向上させる。
- ビデオ会議遠隔通信におけるリップシンク性能を向上させる。
- ゲーム開発ゲームキャラクターの口パクの精度を高め、インタラクティブ性を向上させる。