project
Follow Your Poses - オープンソースの、完全にジェスチャー制御可能なビデオ生成フレームワーク
Follow Your Poseは、清華大学、香港科技大学、テンセントAIラボ、中国科学院の研究者らが開発したオープンソースのテキスト動画生成フレームワークです。テキストによる説明と特定のポーズを入力することで、動画を生成できます。
Follow Your Poseとは何ですか?
Follow Your Poseは、清華大学、香港科技大学、テンセントAIラボ、中国科学院の研究者らが開発したオープンソースのテキスト動画生成フレームワークです。テキストによる説明と指定された人物のポーズを用いて動画を生成できます。このフレームワークは2段階の学習戦略を採用し、テキストによる説明とポーズのシーケンスに高い整合性を持ちながら、動画内の人物の動きのリアリティと一貫性を維持する動画を生成します。
Follow Your Pose公式サイトへの入り口
- 公式プロジェクトホームページ:https://follow-your-pose.github.io/
- GitHubリポジトリ:https://github.com/mayuelala/FollowYourPose
- Arxivの研究論文:https://arxiv.org/abs/2304.01186
- Hugging Face ランタイム アドレス:https://huggingface.co/spaces/YueMafighting/FollowYourPose
- OpenXLabランタイムアドレス:https://openxlab.org.cn/apps/detail/houshaowei/FollowYourPose
- Google Colab ランタイムアドレス:https://colab.research.google.com/github/mayuelala/FollowYourPose/blob/main/quick_demo.ipynb
ポーズの特徴をフォロー
- テキストからビデオへの変換ユーザーはテキストによる説明を入力することができ、フレームワークはこれらの説明に基づいて、キャラクターの動き、シーンの背景、全体的なビジュアルスタイルなど、対応するビデオコンテンツを生成します。
- 姿勢制御ユーザーは、一連のポーズを指定することで、動画内のキャラクターの動作を制御でき、動画内のキャラクターの動きのあらゆる細部まで正確に制御することが可能です。
- 時間的コヒーレンスこのフレームワークは、時間的に一貫性のある動画を生成することができ、動画内の動作やシーンの切り替えが、唐突なジャンプやちらつきがなく、自然で滑らかであることを保証します。
- 多様なキャラクターと背景の生成このフレームワークは、写実的、漫画風、サイバーパンク風など、さまざまな外観、スタイル、背景を持つ動画を生成できます。
- マルチロールビデオ生成このフレームワークは、複数のキャラクターを同じ動画に表示し、テキストによる説明に基づいて各キャラクターの身元や行動を指定できる、複数キャラクター動画の生成をサポートしています。
- 様式化されたビデオ生成ユーザーは、スタイル説明(「漫画風」、「サイバーパンク風」など)を追加することで、特定のアートスタイルの動画を生成できます。
Follow Your Poseの仕組み
Follow Your Poseは、テキストによる説明とポーズ情報を組み合わせて動画を生成する2段階のトレーニングプロセスに基づいて動作します。その詳細な手順は以下のとおりです。
- フェーズ1:姿勢制御によるテキストから画像への変換
- 姿勢エンコーダーまず、このフレームワークは、ゼロ初期化された畳み込みエンコーダを使用して姿勢情報を学習します。このエンコーダは、入力された姿勢シーケンスからキーポイント特徴を抽出します。
- 機能注入抽出された姿勢特徴は、異なる解像度にダウンサンプリングされ、残差接続を介して事前学習済みのテキスト・トゥ・イメージ(T2I)モデルのU-Net構造に注入されます。これにより、元のモデルの画像生成機能を維持しながら、姿勢制御を導入することが可能になります。
- 電車この段階では、テキストによる説明とポーズ情報に基づいて画像を生成する方法を学習することを目的として、ポーズ画像ペアのみを使用してモデルをトレーニングします。
- フェーズ2:ビデオ生成
- ビデオデータセット時間的一貫性を学習するために、フレームワークは第2段階で、姿勢注釈のないビデオデータセット(HDVLIAなど)を使用してトレーニングされます。
- 3Dネットワーク構造事前学習済みのU-Netモデルを拡張し、動画入力を処理できる3Dネットワークを構築します。これには、最初の畳み込み層を擬似3D畳み込みに拡張し、時系列をシミュレートするための時間的自己注意モジュールを追加することが含まれます。
- クロスフレーム自己注意動画の一貫性をさらに向上させるため、このフレームワークではクロスフレーム自己注意モジュールを導入しており、これにより動画フレーム間のコンテンツの一貫性を維持することができます。
- 微調整この段階では、時間的コヒーレンスに関連するパラメータ(時間的自己注意やクロスフレーム自己注意など)のみが更新され、その他のパラメータ(擬似3D畳み込み層やフィードフォワードネットワークFFNなど)は変更されません。
- 生成プロセス
- テキストとジェスチャーによる入力推論段階では、ユーザーは対象キャラクターの外見と動作を説明するテキスト、および動作シーケンスを表す一連のポーズを入力します。
- ビデオ生成このモデルは、これらの入力に基づいて動画を生成します。生成プロセス中、事前学習済みの安定拡散モデルのほとんどのパラメータは固定され、時間的コヒーレンスに関連するモジュールのみが計算に参加します。
この2段階のトレーニング戦略により、Follow Your Poseは入手可能なデータセットから効果的に学習し、高い制御性と時間的な一貫性を備えた動画を生成することができます。