project
Champ - 人物画像をビデオアニメーションに変換するための3Dベースのモデル。
Champは、アリババ、復旦大学、南京大学の研究者らが提案した、人間の画像をビデオアニメーションに変換する3Dベースのモデルです。この手法は、3Dパラメトリックモデル(特にSMPLモデル)と潜在的...
Champとは何ですか?
Champは、アリババ、復旦大学、南京大学の研究者らが提案した、人間の画像を動画アニメーションに変換する3Dベースのモデルです。この手法は、3Dパラメトリックモデル(特にSMPLモデル)と潜在拡散モデルを組み合わせることで、人間の体の3D形状とダイナミクスを正確に捉え、再現すると同時に、アニメーションの時間的な一貫性と視覚的なリアリズムを維持し、高品質な人間アニメーション動画を生成します。
チャンプの公式サイト
- 公式プロジェクトホームページ:https://fudan-generative-vision.github.io/champ/#/
- GitHubソースコードリポジトリ:https://github.com/fudan-generative-vision/champ
- arXivの研究論文:https://arxiv.org/abs/2403.14781
チャンプの特徴
- 人物画像を動画やアニメーションに変換するChampは、人物の静止画像を動的なビデオアニメーションに変換することができ、人体の形状と動きを正確に捉えて再現することで、リアルで制御可能な動的なビジュアルコンテンツを作成します。
- 3D形状と姿勢の表現Champは、人体の形状や姿勢を正確に表現・制御することができ、ソース動画から人体の形状や動きの特徴をより正確に抽出することができる。
- クロスアイデンティティアニメーション生成Champは、ある動画から抽出したモーションシーケンスを、別の人物の参照画像に適用することで、異なる人物間でのアニメーション生成を可能にする。
- 高品質なビデオ生成Champは、動画生成時にキャラクターと背景の一貫性を維持するとともに、タイムアライメントモジュールによってフレーム間のスムーズな遷移を確保し、高品質な動画出力を実現します。
- T2Iテキストベースグラフモデルと組み合わせるテキスト記述に基づいて画像を生成するT2Iテキスト・トゥ・イメージモデルと組み合わせることで、ユーザーはテキスト記述を通してアニメーションにおけるキャラクターの外見や動作を指定でき、Champはこれらの記述に基づいてアニメーション動画を生成します。
Champの仕組み
- 3Dパラメトリック人体モデル(SMPL):
- SMPLモデルは、人体の形状と姿勢を表現するために使用されます。SMPLモデルは、人体の形状と姿勢の変化を捉えることができるパラメトリック3D人体モデルです。
- SMPLモデルを基準画像に当てはめることで、人体の形状と姿勢のパラメータを取得できる。
- ソースビデオから動きを抽出する:
- 4D-Humansなどの既存のフレームワークを用いて、ソース動画から人体の動きのシーケンスを抽出します。これらのモーションシーケンスには、動画内の人物の動きを記述するために使用される連続的なSMPLモデルパラメータが含まれています。
- 深度グラフ、法線グラフ、および意味グラフを生成します。:
- SMPLモデルは、深度マップ、法線マップ、およびセマンティックマップにレンダリングされ、これらには3D構造、表面の向き、および人体の各部位に関する詳細な情報が含まれています。
- 動作のアライメントとガイダンス:
- 抽出されたSMPLモデルパラメータは、参照画像内のキャラクターの形状と姿勢を合わせるために使用され、アニメーション内のキャラクターがソースビデオ内のキャラクターに合わせて動くようにします。
- 骨格に基づいた動作誘導を導入することで、顔の表情や指の動きといった複雑な動きの表現力を向上させる。
- マルチレベルモーションフュージョン:
- 自己注意機構を用いることで、深度、法線、意味情報、骨格情報を含む特徴マップを融合し、包括的な動作誘導信号を生成する。
- 潜在拡散モデル:
- 潜在拡散モデル(例えば潜在拡散モデル)を生成フレームワークとして使用し、モーションガイダンス信号と参照画像のエンコードされた特徴を組み合わせてアニメーションフレームを生成します。
- ノイズ除去処理を潜在空間に適用することで、ノイズの多い表現から鮮明なアニメーションフレームを徐々に復元する。
- 訓練と推論:
- トレーニング段階では、モデルは与えられた参照画像と動作指示に基づいて、一貫性のあるアニメーションシーケンスを生成する方法を学習します。
- 推論段階では、モデルは新しい参照画像とモーションシーケンスに基づいてアニメーションを生成し、その汎化能力を実証する。
- ビデオ生成:
- 生成されたフレームシーケンスは、ビデオに組み込まれる際に、ビデオ内の人物が参照画像と視覚的に一致し、動きが滑らかで自然になるように調整されます。