project
EMO2 - アリババ研究所が発表した音声駆動型アバター動画生成技術
EMO2(End-Effector Guided Audio-Driven Avatar Video Generation)は、アリババインテリジェントコンピューティング研究所が開発した音声駆動型アバター動画生成技術です。正式名称は「End-Effector Guided Audio-Driven Avatar Video Generation...」です。
EMO2とは何ですか?
EMO2(End-Effector Guided Audio-Driven Avatar Video Generation)は、アリババ研究所が開発した音声駆動型アバター動画生成技術です。音声入力と静止画から、表現力豊かでダイナミックな動画を生成します。その核となる革新性は、音声信号と手のジェスチャーや表情を組み合わせ、拡散モデルを通して動画フレームを合成することで、自然で滑らかなアニメーションを生成する点にあります。これにより、高品質な視覚効果、高精度な音声同期、そして多彩なモーションを実現しています。
EMO2の主な機能
- 音声駆動型ダイナミックアバター生成EMO2は、音声入力と静止画のポートレート写真から、表情豊かなアニメーションアバター動画を生成できます。
- 高品質な視覚効果拡散モデルに基づき、ビデオフレームを合成し、手のジェスチャーと組み合わせることで、自然で滑らかな表情や体の動きを生成する。
- 高精度音声同期生成される映像と音声の入力が時間的に高度に同期していることを確認し、全体的な自然さを向上させてください。
- 多様な行動生成複雑で滑らかな手の動きや体の動きをサポートするため、様々な場面に適しています。
EMO2の技術原理
- 音声駆動型モーションモデリングEMO2は、音声エンコーダを使用して入力音声信号を特徴埋め込みに変換し、音声に含まれる感情、リズム、意味情報を捉えます。
- エンドエフェクタの誘導この技術は、手のジェスチャー(エンドエフェクタ)の生成に特に重点を置いています。なぜなら、手のジェスチャーと音声信号の間には強い相関関係があるからです。このモデルはまず手のポーズを生成し、それを全体のビデオ生成プロセスに統合することで、動きの自然さと一貫性を確保します。
- 拡散モデルと特徴融合EMO2は、拡散モデルをコア生成フレームワークとして採用しています。拡散処理において、モデルは参照画像の特徴、音声の特徴、およびマルチフレームノイズを組み合わせ、繰り返しノイズ除去処理を行うことで、高品質のビデオフレームを生成します。
- フレームのエンコードとデコードフレームエンコード段階では、ReferenceNetは入力静止画像から顔の特徴を抽出し、それを音声の特徴と組み合わせて拡散処理に送ります。最終的に、モデルは豊かな表情と自然な動きを持つ動画をデコードして生成します。
EMO2プロジェクトの住所
- プロジェクト公式サイト:https://humanaigc.github.io/emote-portrait-alive-2/
- arXiv技術論文:https://arxiv.org/pdf/2501.10687
EMO2の応用シナリオ
- バーチャルリアリティとアニメーション表現力豊かで自然な話し方をするアバターアニメーションを生成するために使用できます。
- 言語と文化の境界を越えた複数の言語での音声入力に対応しており、様々なスタイルのキャラクターのアニメーションを生成できます。
- ロールプレイングとゲームこの機能を使うと、映画やゲームのシーンに特定のキャラクターを適用できます。