project
KeySync - インペリアル・カレッジ・ロンドンとヴロツワフ大学が共同開発したリップシンク・フレームワーク
KeySyncは、インペリアル・カレッジ・ロンドンとヴロツワフ大学が開発した高解像度リップシンクフレームワークで、ビデオ内の入力音声と唇の動きを同期させることをサポートします。KeySyncは2段階のフレームワークに基づいており、まずキーを生成します...
KeySyncとは何ですか?
KeySyncは、インペリアル・カレッジ・ロンドンとヴロツワフ大学が共同開発した高解像度リップシンクフレームワークで、入力音声と動画内の唇の動きを同期させます。KeySyncは2段階のフレームワークに基づいており、まず音声内の重要な唇の動きを捉えるキーフレームを生成し、次に補間を用いて滑らかな遷移フレームを生成します。KeySyncは、入力動画における表情の漏れを効果的に低減する斬新なマスキング戦略を採用し、動画セグメンテーションモデルを用いてオクルージョン問題を自動的に処理します。KeySyncは、視覚的な品質、時間的な一貫性、リップシンク精度において既存の手法を凌駕しており、自動吹き替えなどの実用的なアプリケーションに適しています。
KeySyncの主な機能
- 高解像度リップシンク入力音声と正確に同期した高解像度(512×512)ビデオを生成し、実用的な用途に適しています。
- 表情を減らす入力動画における表情の減少と同期性の向上。
- 隠す推論処理中、手や物体などの障害物を自動的に識別して除去し、生成される動画の自然さを確保します。
- 視覚品質を向上させる複数の定量的指標およびユーザー調査において優れた性能を発揮し、より鮮明で一貫性のある動画を制作します。
KeySyncの技術原理
- 2段階生成フレームワーク:
- キーフレーム生成まず、音声中の主要な唇の動きを捉えるために、疎なキーフレームのセットが生成されます。これにより、各キーフレームが音声の音声内容を正確に反映しつつ、人物の識別情報が保持されます。
- 補間生成キーフレーム間で補間処理を行うことで、滑らかで時間的に一貫性のある中間フレームが生成され、流れるような唇の動きの遷移が可能になります。
- 潜在拡散モデル潜在拡散モデルは、圧縮された低次元の潜在空間でノイズ除去処理を実行することで、計算効率を向上させます。ノイズは段階的に除去され、ランダムノイズが構造化されたビデオデータに変換されます。
- マスキング戦略計算された顔のキーポイントに基づいて、顔の表情の漏れを防ぐために必要なコンテキスト情報を保持しつつ、顔の下部領域を覆うマスクが設計されます。推論時には、事前学習済みのビデオセグメンテーションモデル(SAM²など)を使用して、遮蔽物を自動的に識別して除去し、生成された唇領域が遮蔽されたオブジェクトと自然に融合するようにします。
- 音声と映像の調整生の音声データは、HuBERTオーディオエンコーダを使用して特徴表現に変換され、生成された唇の動きが音声と正確に一致するように、アテンションメカニズムに基づいてビデオ生成モデルに組み込まれます。
- 損失関数潜在空間損失と画素空間損失(L2損失)を組み合わせることで、生成される唇の領域が音声と一致するように、ビデオ生成の品質が最適化されます。
KeySyncプロジェクトのアドレス
- プロジェクト公式サイト:https://antonibigata.github.io/KeySync/
- GitHubリポジトリ:https://github.com/antonibigata/keysync
- ハギングフェイスモデルライブラリ:https://huggingface.co/toninio19/keysync
- arXiv技術論文:https://arxiv.org/pdf/2505.00497
- オンラインでデモを体験してください:https://huggingface.co/spaces/toninio19/keysync-demo
KeySyncのアプリケーションシナリオ
- 自動音声映画、テレビ、広告などの多言語コンテンツ制作に使用され、ナレーションと口の動きの同期性を向上させます。
- バーチャルアバター仮想キャラクターの唇の動きを同期させることで、仮想アバターのリアリティを高める。
- ビデオ会議遠隔通信におけるリップシンクを最適化し、ユーザーエクスペリエンスを向上させる。
- アクセシブルなコンテンツ聴覚障害のある方が動画コンテンツをよりよく理解できるように支援するため。
- コンテンツ修復動画内の口の動きを修正または差し替えて、コンテンツの品質を向上させます。