AB
AiBoss
project

JoyGen - JD.comと香港大学が音声駆動型3D音声顔動画生成フレームワークを発表

JD Technologyと香港大学が開発したJoyGenは、音声駆動型の3D音声顔動画生成フレームワークであり、正確な口の動きと音声の同期、そして高品質な視覚効果の実現に重点を置いています。JoyGenは、音声機能と顔の深度を組み合わせています。

JoyGenとは何ですか?

JD Technologyと香港大学が共同開発したJoyGenは、音声駆動型の3D発話顔動画生成フレームワークであり、正確なリップオーディオ同期と高品質な視覚効果の実現に重点を置いています。JoyGenは、音声特徴量と顔深度マップを組み合わせてリップモーション生成を行い、効率的な動画編集のためにシングルステップのUNetアーキテクチャを採用しています。トレーニング中、JoyGenは130時間分の中国語動画を含む高品質なデータセットであるオープンソースのHDTFデータセットでテストされ、その優れた性能が検証されました。実験結果は、JoyGenがリップオーディオ同期と視覚品質の両方において業界最高水準を達成し、発話顔動画編集のための新たな技術ソリューションを提供することを示しています。

JoyGenの主な機能

  • 口の動きと音声が同期している音声連動型リップモーション生成技術により、動画内の人物の唇の動きが音声コンテンツに正確に対応することが保証されます。
  • 高品質な視覚効果生成された動画は、自然な表情や鮮明な唇のディテールなど、リアルな映像を実現している。
  • 動画編集と最適化これにより、既存の動画を基に唇の動きを編集・最適化することが可能になり、動画全体を再生成する必要がなくなります。
  • 多言語対応中国語や英語など、さまざまな言語での動画生成をサポートしており、多様なアプリケーションシナリオに対応できます。

JoyGenの技術原理

  • フェーズ1
    • 音声駆動型唇の動き生成3D再構築モデル3D再構成モデルは、入力された顔画像から識別係数を抽出し、それを用いて人物の顔の特徴を記述します。
    • 音声からモーションへの変換モデル音声信号を動作に変換するモデルに基づき、音声信号は表情係数に変換され、それを用いて唇の動きを制御する。
    • 深度マップ生成このシステムは、アイデンティティ係数と表情係数を組み合わせて顔の3Dメッシュを生成し、微分可能なレンダリング技術を用いて、後続のビデオ合成のための顔の深度マップを生成します。
  • フェーズ2
    • 視覚的外観合成:シングルステップUNetアーキテクチャ本論文では、単一ステップのUNetネットワークを用いて、音声特徴量と深度マップ情報をビデオフレーム生成プロセスに統合する手法について述べる。UNetはエンコーダに基づいて入力画像を低次元の潜在空間にマッピングし、音声特徴量と深度マップ情報を組み合わせて唇の動きを生成する。
    • クロスアテンションメカニズム音声特徴は、相互注意機構に基づいて画像特徴と相互作用し、生成される唇の動きが音声信号と高い一貫性を持つようにする。
    • デコードと最適化生成された潜在表現は、デコーダによって画像空間に再構成され、最終的なビデオフレームが生成されます。高品質で同期のとれたビデオ生成を保証するため、潜在空間とピクセル空間の両方でL1損失関数を用いた最適化が行われます。
  • データセットのサポートJoyGenは、130時間分の中国語動画を含む高品質なデータセットを使用してトレーニングされており、モデルが様々なシナリオや言語環境に適応できるようになっています。

JoyGenのプロジェクトアドレス

JoyGenのアプリケーションシナリオ

  • バーチャルアンカーとライブストリーミングニュース放送やeコマースのライブ配信などを配信する仮想アンカーを作成し、入力音声に基づいてリアルタイムでリアルな口の動きを生成することで、視聴者の体験を向上させます。
  • アニメーション制作アニメーションや映画の分野では、吹き替えと同期したリップアニメーションを迅速に生成できるため、アニメーターの作業負担を軽減し、制作効率を向上させることができます。
  • オンライン教育このシステムは仮想の教師アバターを生成し、教師の声に合わせて口の動きを同期させることで、授業動画をより生き生きとさせ、生徒の学習意欲を高めます。
  • 動画コンテンツ制作これにより、クリエイターは、仮想キャラクターの短編ドラマや面白い動画など、顔を使って話す人々の高品質な動画を素早く作成できるようになり、創造的な表現形式を豊かにします。
  • 多言語ビデオ生成複数の言語に対応しており、ある言語の動画を他の言語に素早く変換できるだけでなく、口の動きが新しい言語の音声と同期されるため、コンテンツの国際的な普及が容易になります。