project
EMAGE - 音声に基づいて全身を使ったコミュニケーションジェスチャーを生成するためのフレームワーク。清華大学、東南大学、およびその他の機関が共同開発。
EMAGE(Expressive Masked Audio-condition Gesture Modeling)は、清華大学、東京大学、慶應義塾大学などの研究機関が開発した、全身を使ったコミュニケーションジェスチャーを生成するためのフレームワークです。EMAGEは音声に基づいてジェスチャーを生成することができます。
EMAGEとは何ですか?
EMAGE(Expressive Masked Audio-conditioned Gesture Modeling)は、清華大学、東京大学、慶應義塾大学などの研究機関によって開発された、全身のシンコペーションジェスチャーを生成するためのフレームワークです。EMAGEは、音声と部分的にマスクされたジェスチャー入力に基づいて、顔の表情、体の動き、ジェスチャー、全体的な動きなど、音声と同期した完全な全身ジェスチャーを生成できます。EMAGEは、マスクされた音声ジェスチャー変換器を使用して、音声からジェスチャーへの生成とマスクされたジェスチャーの再構築を共同で学習し、音声と体のジェスチャーの手がかりを効果的にエンコードします。EMAGEは、4つの事前学習済みVQ-VAE(ベクトル量子化変分オートエンコーダ)を使用して局所的な顔と体の動きをデコードし、事前学習済みのグローバルモーション予測器を使用して全体的な移動をデコードします。
EMAGEの主な機能
- 音声と同期したジェスチャーを生成する。入力された音声信号に基づいて、音声のリズムと意味に合致する全身のジェスチャーを生成する。
- あらかじめ定義されたジェスチャー入力を受け付けますユーザーが提供する部分的なジェスチャー(特定の動作や姿勢など)に基づいて、完全で自然なジェスチャーシーケンスを生成します。
- 多様なジェスチャーを生成する複数の事前学習済みVQ-VAE(ベクトル量子化変分オートエンコーダー)を組み合わせることで、単調で反復的な結果を避け、多種多様なジェスチャーを生成できます。
- 全身ジェスチャー生成に対応顔や上肢の動きだけでなく、下肢や全身の動きも生成できるため、より自然で完成度の高い人間アニメーション効果を実現できます。
EMAGEの技術原則
- マスクされたオーディオジェスチャーチェンジャートレーニング中、ジェスチャーデータの一部がランダムに隠蔽され、モデルは音声やその他の隠蔽されていないジェスチャー情報に基づいて隠蔽された部分を予測します。このマスキングメカニズムは、自然言語処理におけるBERTモデルに類似しており、モデルの局所的および全体的な情報理解を強化します。音声からジェスチャーへの生成とマスキングされたジェスチャーの再構築のためのトレーニングにより、モデルは音声とジェスチャー間のマッピング関係をより適切に学習できるようになり、既存のジェスチャー情報(部分的に隠蔽されている場合でも)を利用して、より正確なジェスチャーを生成できます。
- オーディオ機能の融合この手法は、音声のリズム的特徴(ピッチの変化やリズムの強さなど)とコンテンツの特徴(テキストの書き起こしから得られる単語の埋め込みなど)を組み合わせることで、音声のリズムを反映し、かつ意味的に関連性の高いジェスチャーを生成します。例えば、「歩く」という単語が言及された場合、モデルはそれに対応する歩行ジェスチャーを生成できます。
- 事前学習済みVQ-VAEこのアプローチでは、顔、上肢、下肢などの身体の各部位を独立したVQ-VAEを用いてモデル化し、各VQ-VAEが特定の部位の動きを生成する役割を担います。このセグメント化されたモデリング手法は、身体の各部位と音声との間の固有の関係性をより的確に捉え、生成されるジェスチャーの精度と多様性を向上させます。
- 離散表現学習VQ-VAEに基づき、連続的なジェスチャーは離散的な表現に変換され、モデルの学習と生成が容易になります。この離散的な表現は言語における単語に似ており、モデルが複雑なジェスチャーシーケンスをより効率的に処理・生成することを可能にします。
- グローバルモーション予測器局所的な動きを生成することに加えて、事前学習済みのグローバルモーション予測器は、身体の全体的な並進運動(歩行、旋回など)を推定し、生成されるジェスチャーを局所的な動きにおいて自然にし、全体的な動きをより一貫性があり現実的なものにします。
EMAGEのプロジェクトアドレス
- プロジェクト公式サイト:https://pantomatrix.github.io/EMAGE
- GitHubリポジトリ:https://github.com/PantoMatrix/EMAGE
- arXiv技術論文:https://arxiv.org/pdf/2401.00374
- オンラインでデモを体験してください:https://huggingface.co/spaces/H-Liu1997/EMAGE
EMAGEの応用シナリオ
- 仮想現実(VR)と拡張現実(AR)仮想キャラクターに自然なジェスチャーや表情を生成し、仮想ソーシャルインタラクション、仮想会議、仮想ゲームなどのシナリオにおけるインタラクティブな体験を向上させ、仮想キャラクターをより生き生きとリアルにします。
- アニメーション制作このシステムは、セリフの内容に基づいてキャラクターのジェスチャーや表情を自動生成することで、アニメーション映画、テレビシリーズ、動的な広告の制作を支援し、アニメーターの作業負担を軽減し、制作効率を向上させます。
- バーチャルカスタマーサービスとデジタルヒューマンオンラインカスタマーサービスやインテリジェントアシスタントなどに、自然で滑らかなジェスチャーや表情を作成し、ユーザーとのコミュニケーションにおいてより親しみやすくリアルなものにすることで、ユーザーエクスペリエンスを向上させます。
- 教育と訓練教育分野では、仮想教師は説明されている内容に基づいて適切なジェスチャーを生成し、生徒が知識をよりよく理解できるように支援します。また、トレーニングシナリオでは、現実的な操作デモンストレーションジェスチャーを生成して、教育を支援します。
- エンターテインメント業界ゲーム開発において、キャラクターの声に基づいて適切なジェスチャーや表情を生成することは、ゲームの没入感とリアリティを高める。