project
MOFA-Video - テンセントのオープンソースで制御可能なAI生成ビデオモデル
MOFA-Videoは、テンセントAIラボと東京大学の研究者によって開発された、画像から動画への制御可能な生成を実現するオープンソースモデルです。この技術は、生成モーションフィールドアダプタを利用して画像をアニメーション化し、動画を生成します。
MOFA-Videoとは何ですか?
MOFA-Videoは、テンセントAIラボと東京大学の研究者によって開発された、画像から動画への制御可能な生成を実現するオープンソースモデルです。この技術は、生成モーションフィールドアダプタを利用して画像をアニメーション化し、動画を生成します。事前学習済みのStable Video Diffusionモデルに基づき、MOFA-Videoは、手の軌跡、顔マーカーシーケンス、音声などの疎な制御信号を用いて、動画生成中の動きをきめ細かく制御します。MOFA-Videoは、これらの制御信号を個別に利用できるだけでなく、それらを組み合わせてゼロショット方式でより複雑なアニメーションを作成することも可能で、画像から動画へのアニメーションにおいて、斬新かつ高度に制御可能なソリューションを提供します。
MOFAビデオ特集
- トラック制御アニメーションユーザーは画像上に軌跡を手動で描画することで、MOFA-Videoが対応するビデオアニメーションを生成する際のガイドとして使用できます。この機能は、オブジェクトやカメラの動きを正確に制御する必要があるシナリオに特に適しています。
- 顔のキーポイントアニメーションこのシステムは、顔認識技術によって取得されたマーカーなどの顔のキーポイントデータを使用して、リアルな表情や頭の動きのアニメーションを生成します。
- ハイブリッドコントロールアニメーションMOFA-Videoは、軌道制御と顔のキーポイント制御を組み合わせることで、顔の表情と体の動きを同期させたアニメーションを実現し、複雑な多部分アニメーション効果を生み出します。
- 音声連動型顔アニメーションMOFA-Videoは音声信号を分析することで、リップシンクのように、音声や音楽に同期した顔のアニメーションを生成することができる。
- 動画駆動型顔アニメーションMOFA-Videoは、参照動画を用いることで、静止画像における顔の動きを動画内の動きに模倣させ、動的な表情の再現を実現する。
- ゼロサンプル多峰性制御MOFA-Videoはゼロショット学習をサポートしており、異なる制御信号を組み合わせて追加のトレーニングなしで使用できるため、アニメーション生成の柔軟性と多様性が大幅に向上します。
- 長尺動画生成機能MOFA-Videoは、周期的なサンプリング戦略を採用することで、従来のモデルよりも長いビデオアニメーションを生成することができ、フレームレートの制限を克服しています。
- ユーザーインターフェース操作MOFA-VideoはGradioをベースにしたシンプルで使いやすいユーザーインターフェースを提供し、専門的なプログラミングスキルを必要とせずに、ユーザーが直感的にアニメーションを生成できるようにします。
MOFA-Video公式サイト入口
- 公式プロジェクトホームページ:https://myniuuu.github.io/MOFA_Video
- GitHubリポジトリ:https://github.com/MyNiuuu/MOFA-Video
- 軌跡ベースの画像アニメーションGradoデモとモデルチェックポイント:https://huggingface.co/MyNiuuu/MOFA-Video-Traj
- Gradioデモとブレンド制御画像アニメーションのチェックポイント:https://huggingface.co/MyNiuuu/MOFA-Video-Hybrid
MOFA-Videoの仕組み
- スパース制御信号生成トレーニング段階では、システムは疎なモーションサンプリング技術を用いて疎な制御信号を生成します。これらの信号は、軌跡に基づくアニメーション制御点、顔のキーポイントシーケンス、またはその他の形式のモーションインジケータである可能性があります。
- MOFAアダプター設計MOFAアダプタはシステムの核となる部分であり、疎な制御信号を密なモーションフィールドに変換するために特別に設計されたネットワーク構造です。このコンポーネントには以下が含まれます。
- S2Dネットワーク疎な動きの手がかりを密な動きの場に変換する。
- 参照画像エンコーダ参照画像からマルチスケール特徴を抽出し、後続の動き場生成に利用する。
- フィーチャーフュージョンエンコーダーS2Dネットワークによって生成されたモーションフィールドは、参照画像エンコーダの特徴と組み合わされる。
- マルチスケール特徴抽出参照画像エンコーダは、入力された参照画像を処理してマルチスケールの特徴表現を抽出します。この特徴表現は、後続のビデオフレーム生成プロセスにおけるガイダンスおよび変形に使用されます。
- スポーツフィールドの造成と利用S2Dネットワークは、疎な制御信号に基づいて密なモーションフィールドを生成します。これらのモーションフィールドは、マルチスケールの特徴を空間的に変形させ、ビデオにおけるモーション効果をシミュレートするために使用されます。
- 事前学習済みSVDモデルMOFAアダプターは、事前学習済みの安定ビデオ拡散(SVD)モデルと組み合わされ、MOFAアダプターから得られた条件付き特徴量を使用してビデオフレームの生成をガイドします。
- 空間変形生成されたモーションフィールドを用いて、システムは参照画像のマルチスケール特徴を空間的に変形させ、ビデオフレーム内のオブジェクトやシーン要素が予め定められたモーション軌跡に従って動くようにする。
- ビデオフレーム生成特徴空間における変形した特徴量を用いて、ビデオフレームを生成する。このプロセスでは、潜在空間からサンプリングを行い、ノイズを段階的に除去することで、鮮明なビデオフレームを再構築する。
- マルチモーダル制御信号統合MOFA-Videoは、さまざまなソースからの制御信号を処理し、それらを統合した統一的な生成プロセスに組み込むことで、複雑なアニメーション効果を実現できます。
- ゼロショット学習一度トレーニングを終えれば、MOFAアダプターは追加のトレーニングなしに異なる制御ドメインで連携して動作することができ、ビデオ生成をきめ細かく制御することが可能になります。
- 長尺動画生成戦略より長い動画を生成するために、MOFA-Videoは周期的なサンプリング戦略を採用しています。これは、潜在空間内でフレームをグループ化して重ね合わせることで、長尺動画生成における一貫性と計算複雑性の問題に対処するものです。