project
JoyHallo - JD.comの音声駆動型動画生成AIデジタルヒューマンモデル
JoyHalloは、JD.comが開発したオープンソースのAIデジタルヒューマンモデルで、特に中国語(北京語)向けに設計されています。音声データに基づいてリアルな会話動画を生成でき、特に中国語の複雑な唇の動きやイントネーションの処理に優れており、多言語での動画生成も可能です。
JoyHalloとは何ですか?
JoyHalloは、JD.comが開発したオープンソースのAIデジタルヒューマンモデルで、特に中国語(北京語)向けに設計されています。音声に基づいてリアルな話し声の動画を生成できます。特に中国語の複雑な唇の動きやイントネーションの処理に適しており、複数の言語で動画を生成できます。JoyHalloはオープンソースのデータセットとモデル学習方法を提供しており、ユーザーは中国語と英語の両方で話し声の動画を生成できます。このプロジェクトでは、音声特徴の埋め込みに中国語のwav2vec2モデルを使用し、推論速度を向上させるために半分離構造を採用しており、14.3%の改善を実現しています。
JoyHalloの主な機能
- 音声駆動型ビデオ生成JoyHalloは、音声入力に基づいて対応する動画、特に中国語の動画を生成できます。
- 多言語生成機能JoyHalloは中国語に加えて英語の動画も生成でき、多言語対応の動画生成能力を示している。
- 口の動きが同期するこのモデルは音声と映像における唇の動きを正確に同期させることができ、映像のリアリティを向上させる。
- 顔の表情生成音声に含まれる感情や声のトーンに基づいて、それに応じた顔の表情を生成します。
JoyHalloの技術原則
- 半分離構造この技術は、音声駆動型ビデオ生成における唇の動き予測の精度向上に用いられます。唇、表情、頭の姿勢といった顔のアニメーションにおける主要な要素を統合し、その後分離することで、より精密なモデリングを可能にします。
- 特徴埋め込み中国語のwav2vec2モデルを使用して音声特徴量を埋め込むことで、モデルが音声と同期した顔の動きをよりよく理解し、生成できるようになります。
- 相互注意メカニズム半分離構造では、クロスアテンションモジュールが統合された特徴を処理し、相関関係を捉える。
- 畳み込みネットワーク分離段階では、畳み込みネットワークを用いて異なる特徴を分離し、モデルが各特徴の具体的な詳細に焦点を当てられるようにします。
- データセットJoyHalloは、jdh-Halloデータセットで学習されています。このデータセットは、さまざまな年齢層や話し方を含む中国語のビデオデータセットで、日常会話から専門的な医療トピックまでを網羅しています。
JoyHalloのプロジェクトアドレス
- プロジェクト公式サイト:jdh-algo.github.io/JoyHallo
- GitHubリポジトリ:https://github.com/jdh-algo/JoyHallo
- ハギングフェイスモデルライブラリ:https://huggingface.co/jdh-algo/JoyHallo-v1
- arXiv技術論文:https://arxiv.org/pdf/2409.13268
JoyHalloのアプリケーションシナリオ
- バーチャルストリーマーJoyHalloは、ニュース放送、天気予報、スポーツ解説などの分野で、バーチャルアンカーの動画を制作し、24時間365日番組制作を提供している。
- オンライン教育語学学習やオンラインコースなどの分野において、JoyHalloは教師の仮想アバターを生成し、より臨場感のある教育体験を提供している。
- 顧客サービス顧客サービス分野において、JoyHalloは仮想の顧客サービス担当者を育成することで、より親しみやすくプロフェッショナルな顧客サービスを提供しています。
- エンターテインメント業界JoyHalloは、映画、ゲーム、アニメーション制作などの分野におけるキャラクターの顔アニメーションを生成し、制作効率の向上とコスト削減に貢献します。
- ソーシャルメディアユーザーはJoyHalloを使って独自のバーチャルアバターを作成し、ソーシャルメディアに動画コンテンツを投稿することで、インタラクティブ性と楽しさを向上させることができます。
- 広告制作広告業界において、JoyHalloはカスタマイズされた広告動画を制作し、広告の魅力とパーソナライズ性を高めています。