project
PersonaTalk - ByteDanceが開発した、高精細でパーソナライズされたビジュアル吹き替えフレームワーク。
PersonaTalkは、ByteDanceが開発した、高忠実度でパーソナライズされたビジュアルボイスオーバーを実現するための2段階のアテンションベースのフレームワークです。PersonaTalkは、ターゲットオーディオに正確にリップシンクしたビデオを合成できます。
PersonaTalkとは何ですか?
ByteDanceが開発したPersonaTalkは、高忠実度でパーソナライズされたビジュアルボイスオーバーを実現する2段階のアテンションベースのフレームワークです。PersonaTalkは、話者の独特な話し方や顔の特徴を保持しながら、ターゲットオーディオに正確にリップシンクしたビデオを合成します。第1段階では、スタイルを考慮したオーディオエンコーディングとリップシンクジオメトリの生成を行い、第2段階では、デュアルアテンションのフェイスレンダラーを使用してターゲットジオメトリのテクスチャをレンダリングします。PersonaTalkは、ビジュアル品質、リップシンク精度、パーソナリティ保持の点で、既存の技術(Wav2Lip、VideoReTalking、DINet、IP_LAPなど)と比較して優れたパフォーマンスを発揮します。汎用フレームワークとして、個人固有の手法に匹敵する結果を達成します。
PersonaTalkの主な機能
- 口の動きが同期する動画に映っている人物の口の動きが、入力音声と正確に一致していることを確認してください。
- 個性の保持映像合成の過程で、話者の独特な話し方や顔の特徴が保持されます。
- スタイルの認識話者の3D顔面形状の分析に基づき、話者の話し方を学習し、音声特徴量に組み込む。
- 二重注意による顔面レンダリング唇と顔の他の領域のテクスチャレンダリングをそれぞれ処理するために、リップアテンションとフェイスアテンションという2つの並列アテンションメカニズムを使用し、ディテールが豊富な顔画像を生成します。
PersonaTalkの技術的原則
- 幾何学的構成:
- スタイルを考慮した音声コーディング我々は、HuberTなどの事前学習済みモデルを使用して音声信号を豊富な文脈的音声表現に変換し、クロスアテンション層に基づいて音声特徴に話し方のスタイルを注入します。
- 唇状の同期幾何学生成: 様式化された音声機能を使用して話者のテンプレート形状を制御し、複数の相互注意層と自己注意層に基づいて音声と同期した唇の形状を生成します。
- 顔の描写:
- ジオメトリとテクスチャのコーディング参照ビデオの形状とテクスチャは、後続の処理を容易にするために潜在空間にエンコードされる。
- デュアルアテンションテクスチャサンプリング2つの並列クロスアテンション層(唇アテンションと顔アテンション)に基づいて、唇と顔のテクスチャは異なる参照フレームからサンプリングされます。
- 参照フレーム選択戦略唇と顔の質感に対して異なる参照フレームを選択することで、質感サンプリングの多様性と全体的な一貫性を高めることができます。
- テクスチャデコードサンプリングされたテクスチャは、潜在空間からピクセル空間へとデコードされ、顔の形状が保持された上で最終的な顔画像が生成される。
PersonaTalkプロジェクトのアドレス
- プロジェクト公式サイト:grisoon.github.io/PersonaTalk
- arXiv技術論文:https://arxiv.org/pdf/2409.05379
PersonaTalkの応用シナリオ
- 映画およびビデオ制作映画のポストプロダクションにおいて、PersonaTalkはキャラクターの音声演技を提供します。特に、元の録音が不十分な場合や言語の変更が必要な場合に有効で、キャラクターの口の動きに同期したナレーションビデオを生成します。
- ビデオゲームゲーム開発においては、ノンプレイヤーキャラクター(NPC)のリアルな会話を生成するために使用され、より没入感のあるゲーム体験を提供する。
- バーチャルアシスタントとデジタルヒューマンこれにより、仮想アシスタントやデジタルヒューマンの音声と表情の同期がより自然でリアルになり、ユーザーとのインタラクション体験が向上します。
- 言語学習アプリ語学学習ソフトウェアにおいて、Pは教師や仮想キャラクターの口の動きを同期させた動画を生成し、学習者が発音をより効果的に学習し、模倣できるように支援する。
- ニュースおよびメディア放送ニュースキャスターの発言を、元の表情や口の動きを維持しながら様々な言語に翻訳するために使用され、多言語放送の自然さと正確性を向上させます。