AB
AiBoss
project

JoyVASA - JD Healthのオープンソース、音声駆動型デジタルヘッドプロジェクト

JoyVASAは、JD Health Internationalが開発したオープンソースの音声駆動型デジタルヘッドプロジェクトです。拡散モデル技術に基づき、音声信号に同期した顔と頭の動きを生成します。JoyVASAは、唇の動きを同期させることができます。

JoyVASAとは何ですか?

JoyVASAは、JD Health Internationalが開発したオープンソースの音声駆動型デジタルヘッドプロジェクトです。拡散モデル技術に基づき、音声信号と同期した顔の動きや頭部の動きを生成します。JoyVASAは人間の口の動きと表情の制御を実現できるだけでなく、動物の頭部のアニメーション生成にも応用されており、多言語対応や異種間アニメーションなど、幅広い分野での活用が期待されています。

JoyVASAの主な機能

  • 音声連動型顔アニメーション入力された音声信号に基づいて、唇の動きや表情の変化などを含む、同期した顔のアニメーションを生成します。
  • 口の動きが同期する音声と口の動きを正確に一致させることで、リアルな会話効果を実現します。
  • 顔の表情制御特定の表情を制御し、生成することで、アニメーションの表現力が向上する。
  • 動物の顔のアニメーションJoyVASAは動物の顔のアニメーションを生成できるため、その応用範囲が広がります。
  • 多言語対応JoyVASAは、中国語と英語のデータを含む混合データセットを用いた学習に基づいて、多言語アニメーションの生成をサポートしています。
  • 高品質なビデオ生成このプロジェクトは、高解像度かつ高品質のアニメーション動画を生成することができ、視聴体験を向上させます。

JoyVASAの技術原則

  • 分離された顔表現JoyVASAは、動的な表情と静的な3D顔表現を分離する分離型顔表現フレームワークを使用し、より長い動画を生成します。
  • 拡散モデルこのプロジェクトでは、拡散モデルを用いて音声キューから直接モーションシーケンスを生成し、生成されるモーションシーケンスはキャラクターの身元とは無関係である。
  • 2段階トレーニング
    • フェーズ1静的な顔の特徴と動的な動きの特徴を分離します。静的な特徴は顔の識別情報を捉え、動的な特徴は表情、拡大縮小、回転、平行移動などの動的な要素を符号化します。
    • フェーズ2音声特徴量から動き特徴量を生成するように、拡散変換器を訓練する。
  • 音声特徴抽出入力音声の音声特徴はwav2vec2エンコーダを使用して抽出され、モーションシーケンスを生成するための条件として使用されます。
  • モーションシーケンス生成拡散モデルに基づき、音声に連動したモーションシーケンスがスライディングウィンドウ内でサンプリングされる。これらのモーションシーケンスには、顔の表情や頭の動きが含まれる。

JoyVASAのプロジェクトアドレス

JoyVASA アプリケーションシナリオ

  • バーチャルアシスタントスマートホーム、カスタマーサービス、テクニカルサポートの分野では、仮想アシスタントにリアルな顔のアニメーションや表情を提供し、ユーザーとのインタラクション体験を向上させます。
  • エンターテインメントとメディアキャラクターの表情や動きを生成または強化するために使用され、従来のモーションキャプチャの必要性を軽減します。ゲームキャラクターに、より自然な表情とアニメーションを提供し、ゲームへの没入感を高めます。
  • ソーシャルメディアユーザーはJoyVASAを使用して、ビデオチャットやソーシャルメディアプラットフォームでのコンテンツ作成に使用する独自の仮想アバターを作成できます。
  • 教育と訓練オンライン教育プラットフォームでは、より魅力的な学習体験を提供するために、仮想教師を作成することができる。医療や軍事などの分野では、人間の反応や表情をシミュレーションすることで、専門的な訓練に活用できる。
  • 広告とマーケティング広告やブランドイメージ向上に役立つ、魅力的なバーチャル広報担当者を制作する。