project
EDTalk - 上海交通大学とNetEaseが共同で、高効率かつ独立した感情表現型アバター合成モデルを発表。
EDTalkは、上海交通大学とNetEaseが共同開発した音声駆動型リップシンクモデルで、唇の動き、頭の姿勢、感情表現を個別に制御できます。画像、音声クリップ、参考動画をアップロードするだけで、EDTalkが動作します。
EDTalkとは何ですか?
EDTalkは、上海交通大学とNetEaseが共同開発した音声駆動型リップシンクモデルで、唇の動き、頭の姿勢、感情表現を個別に制御できます。画像、音声クリップ、参照動画をアップロードするだけで、画像内の人物に話させることができ、喜び、怒り、悲しみなどのカスタム感情表現にも対応しています。EDTalkは、3つの軽量モジュールを通して、顔の動きを唇の動き、姿勢、表情を表す3つの独立した潜在空間に分解します。各空間は、学習可能な基底ベクトルのセットで表され、それらの線形結合によって特定のアクションが定義されます。この効率的な分離型トレーニングメカニズムにより、トレーニング効率が向上し、リソース消費が削減されるため、初心者でもすぐに使い始めて革新的なアプリケーションを探索できます。
EDTalkの主な機能
- 音声連動型リップシンクロEDTalkは、アップロードされた画像や音声に映っている人物に発話させ、口パクを実現できます。
- カスタマイズされた感情表現EDTalkは、喜び、怒り、悲しみといった独自の感情表現をサポートしており、合成された動画に登場するキャラクターの表情は、音声に含まれる感情と非常に高い一致度を示します。
- 音声から動きへの変換モジュールEDTalkのオーディオ・トゥ・モーションモジュールは、音声入力に基づいて、音声のリズムと同期した唇の動きや文脈に応じた表情を自動的に生成できます。
- 映像と音声の入力に対応EDTalkは、動画と音声の両方の入力に基づいて、感情を正確に表現する話し方のアバターを生成できます。
EDTalkの技術原則
- 高効率なデカップリングフレームワークEDTalkは、口の形、頭の姿勢、感情表現を表す3つの軽量モジュールを用いて、顔の動きを3つの異なる潜在空間に分解します。この分離技術により、これらの顔の動きを干渉なく独立して制御することが可能になります。
- 学習可能な基底ベクトル表現各潜在空間は、学習可能な基底ベクトルの集合によって表現され、これらの基底ベクトルの線形結合によって特定の動作が定義されます。この設計により、EDTalkは、特定の唇の形状、頭の姿勢、表情を持つ話者の顔写真動画を柔軟に合成することができます。
- 直交性と効率的なトレーニング戦略EDTalkは、独立性を確保し、トレーニングを加速するために、基底ベクトル間の直交性を確保し、外部の知識に頼ることなく各空間にアクションの責任を割り当てる効率的なトレーニング戦略を設計しています。
EDTalkプロジェクトのアドレス
- プロジェクト公式サイト:https://tanshuai0219.github.io/EDTalk/
- GitHubリポジトリ:https://github.com/tanshuai0219/EDTalk
- arXiv技術論文:https://arxiv.org/pdf/2404.01647
EDTalkの応用事例
- パーソナルデジタルアシスタントのパーソナライズされたカスタマイズEDTalkは、ユーザーの声に合わせた動的な顔の動画を合成することで、パーソナライズされたデジタルアシスタントを作成するために使用でき、インタラクティブな体験を向上させます。
- 映画・テレビのポストプロダクション映画やテレビ制作において、EDTalkはキャラクターのセリフ合成に利用でき、音声駆動型の手法を用いてキャラクターの感情に合わせた口の動きや表情を生成することで、キャラクターの表現力を高めることができる。
- 教育ソフトウェア向けインタラクティブ教育アシスタントの開発EDTalkは教育ソフトウェアに適用することで、インタラクティブな教育アシスタントを作成し、感情表現を通して学習体験を向上させることができる。
- 遠隔通信遠隔コミュニケーションの分野において、EDTalkはよりリアルで感情に訴えかけるビデオコミュニケーション体験を提供し、コミュニケーション効果を高めることができます。
- バーチャルリアリティインタラクション仮想現実環境において、EDTalkは感情表現豊かな仮想キャラクターを生成するために使用でき、ユーザーの没入感を高めることができる。