project
ReSyncer - 清華大学と百度が共同開発したAI動画編集ツール
ReSyncerは、清華大学と百度が共同開発したAI動画編集ツールです。音声処理によって、音声と同期した高品質なリップモーション動画を生成します。ReSyncerはStyle-SyncFormerを用いて音声を分析し、3D顔モデルを作成します。
ReSyncerとは何ですか?
ReSyncerは、清華大学と百度が共同開発したAI動画編集ツールです。音声を駆動力として、音声と同期した高品質なリップシンク動画を生成します。ReSyncerはStyle-SyncFormerを用いて音声を分析し、3D顔モデルを作成し、それを対象動画と組み合わせることで、同期のとれた表情豊かな仮想キャラクターを生成します。ReSyncerは、パーソナライズされた微調整、話し方の切り替え、顔の入れ替え機能をサポートしており、仮想ホストやパフォーマーの作成、ライブ配信などのシナリオに適しています。特に、音声と顔情報の同期に優れています。
ReSyncerの主な機能
- リップシンク指定された音声に合わせて唇の動きを生成します。
- スタイル転送特定の話し方や表情を対象動画に反映させる。
- パーソナライズされた微調整生成された顔のアニメーションを、特定の人物の顔の特徴に合わせて素早く調整します。
- 動画主導のリップシンク対象動画から抽出した顔画像を使用して、リップシンクアニメーションを生成します。
- 顔交換技術別人の顔の特徴と入れ替えることで、人物の変装や特殊効果を行う。
ReSyncerの技術原理
- 3D顔面モデル生成深層学習モデルであるStyle-SyncFormerを用いて、音声の特徴に基づいて3D顔面ダイナミクスを予測する。
- 様式化された顔のアニメーションTransformerアーキテクチャを通じて様式化された3D顔の動きを学習し、顔の表情と唇の動きを正確に同期させる。
- スタイルベースのジェネレーター予測された3D顔面ダイナミクスは、対象動画内の顔画像と組み合わされ、高精細な顔画像を生成する。
- 顔の特徴の融合生成プロセスにおいて、シンプルな挿入メカニズムを用いて3D顔面メッシュ情報を様式化された特徴と融合させることで、唇の同期の品質と安定性を向上させる。
ReSyncerプロジェクトのアドレス
-
arXiv技術論文:https://arxiv.org/pdf/2408.03284v1
ReSyncerの応用シナリオ
- 映画およびビデオ制作映画やビデオ制作において、ReSyncerは顔の入れ替えやリップシンクといった複雑な特殊効果を実現し、視覚的な魅力を高めるために使用できます。
- 広告業界広告制作において、スタイル転送機能は、独自の視覚効果を生み出し、視聴者の注意を引くために活用できる。
- ソーシャルメディアとコンテンツ制作コンテンツ制作者はReSyncerを使って、顔交換技術を用いた面白いパロディ動画を作成するなど、動画コンテンツをより魅力的にすることができます。
- 教育と訓練語学学習や職業訓練において、口パクは学習者が発音をよりよく理解し、模倣するのに役立つ。