AB
AiBoss
project

MimicMotion - テンセントと上海交通大学が共同開発したAI動画生成フレームワーク

MimicMotionは、テンセントが上海交通大学と共同開発したAI動画生成フレームワークです。ユーザーは画像と参照動画を提供するだけで、ワンクリックでリアルな人間の動きを再現した動画を生成できます。ダンスやスポーツなど、さまざまなジャンルに適しています。

MimicMotionとは何ですか?

Tencentの研究者によって開発されたMimicMotionは、高品質な人体動作動画生成フレームワークです。信頼度を考慮した姿勢誘導技術を採用することで、高品質な動画フレームと滑らかな時間的遷移を実現します。さらに、MimicMotionは領域損失増幅と手領域強調により、画像歪みを大幅に低減し、手の動きのディテールを向上させます。また、プログレッシブ潜在融合戦略を用いて長尺動画を生成することも可能で、特定の動作ガイドラインに準拠した高品質かつ長時間の人体動作動画を生成し、動画生成の制御性とディテールの豊かさを大幅に向上させます。

MimicMotionの機能

  • 多様な動画を作成するMimicMotionは、ユーザーが提供する姿勢指示に基づいて、様々な動きの動画コンテンツを生成できます。ダンス、スポーツ、日常動作など、対応する姿勢シーケンスが提供されれば、MimicMotionはそれに応じたダイナミックな動画を作成できます。
  • 動画の長さを制御するユーザーはニーズに合わせて動画の長さを指定できます。MimicMotionは、数秒の短いクリップから数分、あるいはそれ以上の長さのフル動画まで生成できるため、さまざまなアプリケーションシナリオに柔軟に対応できます。
  • 姿勢誘導と制御このフレームワークは、基準となるポーズを条件として使用することで、生成されるビデオコンテンツが指定されたポーズと動きの面で一貫性を保つことを保証します。MimicMotionを使用すると、ユーザーはビデオの動きを正確に制御でき、高度にカスタマイズされたビデオ生成が可能になります。
  • 品質保証の詳細MimicMotionは、動画内の細部、特に手など歪みが生じやすい部分に細心の注意を払います。信頼度を考慮した戦略により、これらの部分でより鮮明な映像を提供できます。
  • 時間の滑らかさより自然な視聴体験を提供するために、MimicMotionはビデオフレーム間のスムーズな遷移を保証し、途切れや不連続性を回避して、ビデオをより滑らかで自然に見せます。
  • 画像の歪みを軽減するMimicMotionは、自信度を考慮した姿勢誘導により、特に人物の手の部分において、不正確な姿勢推定によって引き起こされる画像歪みを特定し、軽減することができます。
  • 長尺動画の生成MimicMotionは、プログレッシブ潜在融合技術を採用しており、長時間の動画生成時にも高い時間的整合性を維持できます。この技術は、動画セグメント間の潜在特徴を融合することで、ちらつきや不整合を効果的に回避します。
  • 資源消費制御動画生成時、MimicMotionの最適化アルゴリズムは、リソース消費量を適正な範囲内に抑えます。長時間の動画生成時でも、計算リソースを効率的に管理し、過剰なコストを回避します。

MimicMotionの公式サイト

MimicMotionの技術原理

  • 姿勢誘導型ビデオ生成MimicMotionは、ユーザーが提供するポーズシーケンスを入力として使用し、ビデオコンテンツの生成をガイドします。これにより、モデルはポーズの変化に基づいて対応する動作を合成することができます。
  • 自信を高める姿勢指導このフレームワークでは、信頼度という概念を導入し、ポーズ推定モデルが提供する信頼度スコアを分析することで、ポーズシーケンス内の各キーポイントに重み付けを行います。これにより、モデルは信頼度の高いキーポイントをより重視できるようになり、ポーズ推定の不正確さが生成結果に与える影響を軽減できます。
  • 地域損失増幅MimicMotionは、特に手など歪みが生じやすい領域を対象とし、損失関数におけるこれらの領域の重みを増やすことでモデルの学習を強化し、生成される動画における手のディテールの質を向上させます。
  • 潜在拡散モデルMimicMotionは、潜在拡散モデルを使用して生成効率と品質を向上させています。このモデルは、ピクセル空間で直接処理するのではなく、低次元の潜在空間で拡散処理を実行することで、計算コストを削減します。
  • 進行性電位融合MimicMotionは、長尺動画を生成するために、段階的な潜在的特徴融合戦略を採用しています。動画セグメント間の重なり合うフレームの潜在的特徴を段階的に融合することで、セグメント間のスムーズな遷移を実現し、長尺動画生成時に発生する可能性のあるちらつきや不連続性を回避します。
  • 事前学習済みモデルの活用MimicMotionは、事前に学習済みのビデオ生成モデル(例えば、安定ビデオ拡散(SVD)など)に基づいており、モデルをゼロから学習させる場合に必要なデータ量と計算リソースを削減します。
  • U-NetとPoseNetの構造MimicMotionのモデルアーキテクチャは、時空間的な相互作用のためのU-Netと、姿勢シーケンスの特徴を抽出するためのPoseNetで構成されています。これらのネットワーク構造が連携することで、高品質な動画生成を実現します。
  • フレーム間の滑らかさMimicMotionは、生成プロセス中にフレーム間の時間的な関係を考慮することで、ビデオフレーム間の連続性と滑らかさを保証します。