project
MTVCrafter - 中国科学院、中国電信、その他の機関が共同開発した人物肖像アニメーション生成フレームワーク。
MTVCrafterは、中国科学院深圳先進技術研究院のコンピュータビジョン・パターン認識研究所や中国電信人工知能研究所など複数の機関によって開発された、斬新な人物画像アニメーションフレームワークです。オリジナルの3Dモーションシーケンスに基づいています。
MTVCrafterとは何ですか?
MTVCrafterは、中国科学院深圳先進技術研究院のコンピュータビジョン・パターン認識研究所や中国電信人工知能研究所などが共同開発した、斬新な人物画像アニメーションフレームワークです。オリジナルの3Dモーションシーケンスに基づいて高品質なアニメーションを生成します。このフレームワークは、4Dモーションタグ付け(4DMoT)を使用して3Dモーションデータを直接モデル化することで、ポーズ画像の2Dレンダリングに依存する従来の手法の制約を回避します。独自の4Dモーションアテンションと位置エンコーディングを使用して、4Dモーションタグをアニメーション生成のコンテキストとして効果的に活用する、モーション認識型ビデオ拡散トランスフォーマー(MV-DiT)を導入しています。MTVCrafterは、TikTokベンチマークでFID-VIDスコア6.98を達成し、2位の手法を65%上回り、高い汎化能力と堅牢性を示しました。
MTVCrafterの主な機能
- 高品質なアニメーション生成3Dモーションシーケンスを直接モデリングすることで、高品質で自然かつ一貫性のある人間アニメーション動画を生成します。
- 高い一般化能力単体および複数キャラクター、全身および半身キャラクターなど、目に見えない動きやキャラクターへの一般化をサポートし、アニメ、ピクセルアート、水墨画、写実的なスタイルなど、さまざまなスタイルに対応します。
- 精密な動作制御Jiyu 4Dのモーションタグ付けとモーションアテンションメカニズムにより、モーションシーケンスを正確に制御でき、アニメーションの精度と一貫性を確保します。
- アイデンティティの一貫性を維持するアニメーション生成時には、参照画像の同一性特性を維持し、同一性のずれや歪みを回避してください。
MTVCrafterの技術原則
- 4Dモーションマーカー(4DMoT)4DMoTはエンコーダー・デコーダーアーキテクチャを採用し、2次元畳み込みと残差ブロックに基づいてデータの時間的(フレーム)次元と空間的(関節)次元を処理します。ベクトル量子化器を用いて、連続的な動きの特徴を離散的なラベル空間にマッピングします。ラベルは統一された空間で表現されるため、後続のアニメーション生成が容易になります。
- 動き認識型ビデオ拡散トランスフォーマー(MV-DiT)本論文では、4Dモーションマーカーと視覚マーカー(ビデオフレームなど)を組み合わせた4Dモーションアテンションメカニズムを設計する。4D回転位置符号化(RoPE)に基づき、マーカー化とフラット化によって失われた時空間関係を復元する。モーション認識型分類器を導入し、無条件生成と条件付き生成の結合表現を学習することで、生成品質と汎化能力を向上させる。ノイズの多いビデオから得られた潜在変数と参照画像を結合するために、シンプルながら効果的な繰り返しとステッチング戦略を用い、同一性の一貫性を確保する。
MTVCrafterプロジェクトの住所
- GitHubリポジトリ:https://github.com/DINGYANB/MTVCrafter
- arXiv技術論文:https://arxiv.org/pdf/2505.10238
MTVCrafterの応用事例
- デジタルヒューマンアニメーション仮想アンカー、カスタマーサービス担当者、アイドルといったデジタルヒューマンに、自然で滑らかな動きや表情を生み出す。
- バーチャル試着ユーザーの写真と衣服を組み合わせることで、ダイナミックな試着効果を生み出し、ショッピング体験を向上させます。
- 没入型コンテンツユーザーの動きと同期した仮想キャラクターアニメーションをVRおよびARで生成し、没入感を高めます。
- 映画やテレビの特殊効果高品質なキャラクターアニメーションを迅速に生成し、制作コストを削減し、特殊効果を向上させることができます。
- ソーシャルメディアこれにより、ユーザーは写真と動作を組み合わせて自分だけのオリジナルアニメーションを作成でき、コンテンツの楽しさが増します。