project
VASA-1 - マイクロソフトが発表した、静止画からリップシンク動画を生成するためのフレームワーク。
VASA-1は、Microsoft Research Asiaが提案したフレームワークで、静止画をリップシンク動画に変換します。1枚の静止画と音声データに基づいて、リアルな3Dの話し顔アニメーションをリアルタイムで生成できます。
VASA-1とは何ですか?
Microsoft Research Asiaが提案したVASA-1は、静止画をリップシンクアニメーション動画に変換するフレームワークです。1枚の静止画と短い音声クリップから、リアルな3Dの話し顔アニメーションをリアルタイムで生成できます。この技術は、正確なリップシンク、豊かな表情、自然な頭の動きを通して、非常にリアルでダイナミックな仮想キャラクターを作り出します。VASA-1の核となるイノベーションは、顔の潜在空間で動作するフルビュー顔ダイナミクスと頭の動き生成モデルにあり、オンライン生成と低遅延をサポートしながら、高解像度動画を効率的に生成します。
VASA-1の特長
- リアルなリップシンクVASA-1は、入力された音声に正確に同期した唇の動きを生成することができ、非常にリアルな発話効果を実現します。
- 豊かな表情VASA-1は、唇の動きに加えて、複雑な顔の表情や微妙な感情表現を捉えて再現することができ、アニメーションのリアリティを高める。
- 自然な頭の動きこのモデルは、頭を回したり傾けたりといった自然な頭の動きをシミュレートできるため、生成される話し顔動画がよりリアルになる。
- 高効率ビデオ生成VASA-1は、最大40FPSの512×512解像度のビデオを極めて低い初期遅延でオンライン生成できるため、リアルタイムアプリケーションに適しています。
- 柔軟で制御可能な発電VASA-1は、視線の方向、頭部の距離、感情の変化といったオプションの信号を条件として受け入れることで、生成プロセスを制御し、出力の多様性と適応性を向上させることができる。
- さまざまな入力を処理するVASA-1は、訓練データに含まれていない写真や音声の入力、例えば芸術的な写真、歌声、英語以外の言語の音声なども処理することができます。
VASA-1公式サイトへの入り口
- 公式プロジェクトホームページ:https://www.microsoft.com/en-us/research/project/vasa-1/
- arXiv研究論文:https://arxiv.org/abs/2404.10667
VASA-1の仕組み
- 入力準備VASA-1は、主に2つの入力を受け付けます。1つは任意の人物の静止した顔画像、もう1つは任意の人物の音声クリップです。
- 顔の特徴抽出顔エンコーダは、入力された静止顔画像から、3D外観ボリューム、識別コード、頭部姿勢、顔面動態コードなどの特徴を抽出するために使用されます。
- 顔面潜在空間モデリング顔の動きやその他の要因(アイデンティティや外見など)から高度に分離され、豊かな顔のディテールや動的なニュアンスを表現できる顔の潜在空間を構築する。
- 拡散モデルのトレーニング音声信号とオプションの制御信号を入力として、顔の潜在空間における包括的な顔の動態と頭部の動きを生成できる拡散ベースのモデル(拡散トランスフォーマー)を訓練する。
- 条件付き信号積分視線方向、頭部の距離、感情の変化は制御信号として使用され、拡散モデルへの入力として顔の動態生成を誘導する。
- 顔面ダイナミクスと頭部運動生成訓練済みの拡散モデルを用いて、入力された音声特徴量と条件付き信号に基づいて、顔の動きや頭部の動きを表す潜在コード系列が生成される。
- ビデオフレーム生成顔デコーダーとエンコーダーから抽出された外見および識別情報を用いて、生成された顔の動きと潜在的な頭部の動きのコードに基づいて、最終的なビデオフレームが生成されます。