project
EMO - アリババのAIポートレート動画生成フレームワーク
EMO(Emote Portrait Alive)は、アリババグループのインテリジェントコンピューティング研究所の研究者によって開発されたフレームワークです。これは、単一の参照画像と音声入力から画像を生成できる、音声駆動型のAIポートレートビデオ生成システムです。
EMOとは何ですか?
EMO(Emote Portrait Alive)は、アリババグループのインテリジェントコンピューティング研究所の研究者によって開発されたフレームワークです。これは、単一の入力参照画像と音声録音から、表情豊かな顔の表情と様々な頭のポーズを持つ動画を生成できる、音声駆動型のAIポートレート動画生成システムです。このシステムは、人間の表情の微妙な違いや個々の顔のスタイルの多様性を捉え、非常にリアルで表現力豊かなアニメーションを実現します。
EMOの公式サイトへの入り口
- 公式プロジェクトホームページ:https://humanaigc.github.io/emote-portrait-alive/
- arXivの研究論文:https://arxiv.org/abs/2402.17485
- GitHub:https://github.com/HumanAIGC/EMO(モデルとソースコードは後日オープンソース化される予定です)
EMOの主な特徴
- 音声駆動型ビデオ生成EMOは、事前に録画されたビデオクリップや3D顔モデルに頼ることなく、入力された音声(話し声や歌声など)から直接ビデオを生成できます。
- 高い表現力とリアリズムEMOで生成された動画は非常に表現力豊かで、繊細な微表情や音声のリズムに合わせた頭の動きなど、人間の顔の表情の微妙な違いを捉えて再現することができます。
- フレームのシームレスな移行EMOは、ビデオフレーム間のスムーズで自然な遷移を保証し、顔の歪みやフレームのちらつきといった問題を回避することで、ビデオ全体の品質を向上させます。
- 身元保護EMOはFrameEncodingモジュールを通して、ビデオ生成中にキャラクターの同一性を維持することができ、キャラクターの外観が入力参照画像と一貫していることを保証します。
- 安定した制御機構EMOは、速度コントローラーや顔領域コントローラーなどの安定化制御メカニズムを採用することで、動画生成時の安定性を向上させ、動画のクラッシュなどの問題を回避します。
- 動画の長さは柔軟に対応可能EMOは入力音声の長さに基づいて任意の長さの動画を生成できるため、ユーザーに柔軟な創作の場を提供する。
- 言語とスタイルの違いEMOの学習データセットは、中国語や英語を含む様々な言語やスタイル、そして写実的、アニメ風、3Dスタイルを網羅しており、EMOが様々な文化や芸術スタイルに適応することを可能にしています。
EMOの仕組み
- 入力準備ユーザーは、参照画像(通常は対象キャラクターの静止画)と対応する音声入力(話し声や歌声など)を提供します。これらの入力は、ビデオ生成の基礎となります。
- 特徴抽出ReferenceNetは、参照画像から特徴を抽出するために使用されます。ReferenceNetは、バックボーンネットワークと似た構造を持つネットワークですが、入力画像から詳細な特徴を抽出することに重点を置いています。
- 音声処理音声入力は、事前学習済みの音声エンコーダーによって処理され、音声特徴が抽出されます。これらの特徴は、音声のリズム、ピッチ、発音などの情報を捉え、ビデオ内のキャラクターの表情や頭の動きを制御するために使用されます。
- 拡散過程拡散処理中、メインネットワークは複数のノイズフレームを入力として受け取り、各タイムステップでこのノイズを連続するビデオフレームにノイズ除去しようと試みます。この処理には、参照注意と音声注意という2つの主要な注意機構が関与しています。参照注意はキャラクターの同一性を維持するために使用され、音声注意はキャラクターの動作を調整するために使用されます。
- 時間モジュールEMOは、時間軸を処理し、動きの速度を調整するために、時間モジュールを使用します。これらのモジュールは、自己注意機構を介してフレーム内の特徴量を処理し、ビデオの動的なコンテンツを捉え、連続するフレーム間の整合性と一貫性を確保します。
- 顔の位置と速度制御生成されるキャラクターの動きの安定性と制御性を確保するために、EMOは顔検出器と速度レイヤーを使用します。顔検出器は軽量な畳み込み層を通して顔の境界ボックス領域をエンコードし、速度レイヤーは頭の回転速度を生成プロセスに組み込むことで動きの速度と頻度を制御します。
- トレーニング戦略EMOの学習は、画像事前学習、動画学習、速度層アンサンブルの3つの段階に分かれています。画像事前学習段階では、メインネットワークとReferenceNetが単一フレーム画像から学習します。動画学習段階では、連続するフレームを処理するために、時間モジュールと音声層が導入されます。最後に、速度層アンサンブル段階では、音声がキャラクターの動きを駆動できるように、時間モジュールと速度層のみが学習されます。
- ビデオを生成する推論フェーズでは、EMOはDDIMサンプリングアルゴリズムを使用してビデオセグメントを生成します。反復的なノイズ除去処理を経て、入力音声と同期した縦長のビデオが最終的に生成されます。