project
ID-Animator - テンセントなどが開発した、パーソナライズされたキャラクター動画生成フレームワーク。
ID-Animatorは、テンセントフォトンスタジオ、中国科学技術大学、中国科学院合肥物質科学研究院の研究者らが開発した、ゼロショット方式の人体動画生成技術です。単一の参照顔画像に基づいて動画を生成することができます。
ID-Animatorとは何ですか?
テンセントフォトンスタジオ、中国科学技術大学、中国科学院合肥物質科学研究院の研究者らが開発したID-Animatorは、ゼロショット方式の人物動画生成技術です。単一の参照顔画像に基づいてパーソナライズされた動画を生成し、画像内の人物の特徴を保持しつつ、テキストプロンプトに基づいて動画コンテンツを調整します。このフレームワークは、事前学習済みのテキスト・動画拡散モデルと軽量な顔アダプタを組み合わせることで、特定の人物に対する追加学習を必要とせずに効率的な動画生成を実現します。ID-Animatorは、専用データセットを構築し、ランダムな顔参照学習手法を採用することで、動画の人物識別精度と生成品質を向上させています。
ID-Animatorの主な機能
- 動画キャラクターの変更(再文脈化)ID-Animatorは、提供された参照画像とテキストに基づいて、動画内のキャラクターのコンテキスト情報を変更できます。例えば、キャラクターの髪型、服装、背景を調整したり、テキストプロンプトを使用して特定の動作を実行させたりすることで、キャラクターの全く新しいバックストーリーを作成できます。
- 年齢と性別の変更このモデルは、動画の内容やスタイルの要件に合わせて、動画内の登場人物の年齢や性別を必要に応じて調整できます。例えば、若者が成長していく様子や、少年が少女に変わっていく様子を描いた動画を生成できます。
- アイデンティティの混合ID-Animatorは、2つの異なる人物の特徴をブレンドして、異なる比率でそれぞれの特徴を組み合わせた動画を生成することができます。これは、新しいキャラクターを作成したり、実在の人物の特徴をブレンドしたりする際に非常に役立ちます。
- ControlNetとの統合ID-Animatorは、ControlNetなどの既存のきめ細かい条件付きモジュールと互換性があります。制御画像の単一または複数フレームを提供することで、制御画像と密接に統合されたビデオシーケンスを生成できます。これは、特定のアクションやシーンのビデオを生成する際に非常に便利です。
- コミュニティモデル統合ID-Animatorは、コミュニティモデル(Civitaiなどのモデル)とも統合でき、これらのモデルでトレーニングを行わなくても効果的に動作し、顔の特徴の安定性と動的な生成を維持します。
ID-Animator公式サイト入口
- 公式プロジェクトホームページ:https://id-animator.github.io/
- arXivの研究論文:https://arxiv.org/abs/2404.15275
- GitHubのソースコード:https://github.com/ID-Animator/ID-Animator
ID-Animatorの仕組み
- 事前学習済みのテキストからビデオへの拡散モデルID-Animatorは、テキストプロンプトに基づいてビデオコンテンツを生成できる、事前学習済みのテキスト・トゥ・ビデオ(T2V)拡散モデルを基盤として使用しています。
- フェイスアダプター特定の人物像に合致した動画を生成するために、ID-Animatorは軽量な顔認識アダプタを導入しています。このアダプタは、潜在的な顔認識クエリを学習することで、人物像に関連する埋め込み情報をエンコードします。
- アイデンティティ指向データセットの構築研究者らは、個人の属性と動作キャプション技術を切り離して分析したデータセット、および構築された顔画像群から抽出された顔の特徴を含む、アイデンティティ指向のデータセットを構築した。
- ランダム顔参照トレーニング法ID-Animatorは、ランダムにサンプリングされた顔画像を使用して学習されます。このアプローチにより、識別に関係のない画像コンテンツと識別に関連する顔の特徴を分離することができ、アダプタは識別に関連する特徴の学習に集中できます。
- テキストと顔の特徴の融合ID-Animatorは、テキストと顔の特徴を組み合わせ、アテンションメカニズムを通してそれらを融合させることで、テキストによる説明と一致し、かつ本人の特徴を保持する動画を生成します。
- 生成プロセスID-Animatorは動画を生成する際、まず参照となる顔画像とそれに対応するテキストキューを受け取ります。顔アダプタは参照画像の特徴を埋め込みデータにエンコードし、これらの埋め込みデータとテキストの特徴を拡散モデルに入力して、最終的に動画を生成します。
- 最適化とトレーニングモデルのパフォーマンスを向上させるため、ID-Animatorのトレーニングプロセスでは、参照画像に含まれる本人確認に関係のない特徴の影響を軽減するために、ランダムな顔画像を参照画像として使用し、分類器フリーガイダンスなどの技術を用いて動画生成の品質を最適化しています。
- 互換性と拡張性ID-Animatorは、AnimateDiffなどの様々な事前学習済みT2Vモデルとの互換性を持つように設計されているため、既存のシステムへの統合や、様々なアプリケーションへの拡張が容易です。