AB
AiBoss
project

Motion Dreamer - 香港科技大学が開発した、モーションベースのビデオ生成フレームワーク

Motion Dreamerは、香港科技大学(広州)の研究者らが提案した、自然な動きのある動画を生成する動画生成フレームワークです。2段階の生成方法に基づいており、まず入力画像と動きの条件に基づいて中間的な動きの表現を生成し、次に…

Motion Dreamerとは何ですか?

香港科技大学(広州)の研究者らが提案した動画生成フレームワーク「Motion Dreamer」は、リアルな動きの動画を生成します。2段階の生成アプローチを採用しており、まず入力画像と動きの条件に基づいて中間的な動きの表現を生成し、次にこの表現を用いて高精細な動画を生成します。Motion Dreamerは、インスタンスフローという新しい動きのモダリティを導入し、疎な動きから密な動きまで制御を可能にします。ユーザーが疎な動きの手がかりを与えると、モデルは時間的に一貫性のある動画を生成します。トレーニング中は、ランダムマスクインスタンスフロー戦略を採用することで、モデルの推論能力と汎化能力を向上させています。Physionデータセットと自動運転データセットを用いた実験では、Motion Dreamerが動きの一貫性と物理的な妥当性の点で他のモデルを大きく上回り、高品質な動画を生成できることが実証されています。

Motion Dreamerの主な機能

  • 物理的に整合性のあるビデオを生成するMotion Dreamerは2段階の動画生成フレームワークとして、物理法則に準拠した動画を生成できます。第1段階では、入力画像と動きの条件に基づいて、動きそのものに焦点を当て、セグメンテーションマップや深度マップなどの中間的な動き表現を生成します。第2段階では、これらの中間的な動き表現を用いて、高精細な動画を生成します。
  • 疎なモーション制御から密なモーション制御への変換インスタンスフローという新しいモーションモダリティの導入により、ユーザーは平均的なオプティカルフローを表す方向矢印などの疎なモーションキューを提供できるようになります。これにより、モデルはピクセル単位で整列された密なモーション表現を生成し、時間的に一貫性のあるビデオ生成が可能になります。
  • モデル推論能力を向上させるこのトレーニング戦略では、ランダムにマスクされたインスタンスストリームを使用します。トレーニング中にインスタンスストリームの一部がランダムにマスクされます。これにより、モデルは完全な高密度モーション表現を再構築する必要があり、欠落したモーションキューを推論するよう促され、モデルの汎化能力と推論に基づくモーション生成性能が向上します。

モーション・ドリーマーの技術原理

  • 2段階生成フレームワーク
    • フェーズ1:動作推論入力画像と動きの条件に基づいて、動きそのものに焦点を当て、セグメンテーションマップや深度マップなどの中間的な動き表現が生成されます。この段階では、拡散ベースのビデオ生成モデルを採用し、低周波の動き表現を重視することで時間的な一貫性を向上させています。具体的には、オプティカルフロー、インスタンスセグメンテーションマップ、深度マップなどの中間的な動き表現を予測し、これらを総合的に分析することで、シーンのダイナミクスを包括的に記述します。
    • フェーズ2:高忠実度ビデオ合成このモデルは、第1段階で生成された中間的な動き表現を条件として使用することで、高精細な動画を生成します。動き推論と動画合成を分離することで、高品質な動画ディテールを維持しながら、物理的に整合性のある動きをより正確に生成できます。
  • インスタンスストリーム:インスタンスストリームは、人間の入力と高密度なモーション表現を結びつけるために使用される、疎から密への新しいモーションモダリティです。インスタンスストリームをモデルに効果的に統合するために、ネットワーク内の異なるスケールの特徴マップに一致するように、インスタンスストリームのマルチスケールバージョンが用意されます。次に、Softmax Splatting関数を使用して、フローフィールドに応じて特徴マップを変形し、特徴を新しい場所に分配することで、モーション情報をシームレスに統合しつつ、エンドツーエンドのトレーニングをサポートするために微分可能性を維持します。
  • ランダムマスクインスタンスストリームトレーニング戦略トレーニング中、インスタンスストリームの一部にランダム化されたマスクが適用され、モデルは完全な密なモーション表現を再構築する必要があります。これにより、モデルは欠落しているモーション情報を推論するようになり、汎化能力と推論に基づくモーション生成の有効性が向上します。モデルが不完全なモーション情報を処理できるようにトレーニングすることで、オブジェクト間の相互作用や妥当なモーション軌跡をよりよく理解し予測できるようになり、入力データが少ない場合でももっともらしいモーションを生成できます。

モーション・ドリーマーのプロジェクト住所

Motion Dreamerの応用事例

  • 動画コンテンツ制作映画、テレビシリーズ、広告などの映像コンテンツ制作において、Motion Dreamerは高品質で物理的に整合性の取れたビデオクリップを生成することができ、クリエイターにより多くの創造的な空間と素材の選択肢を提供します。
  • アニメーション制作アニメーション映画やゲームアニメーションの制作において、Motion Dreamerはリアルなキャラクターアニメーションを生成することができ、手作業によるアニメーション制作の時間とコストを削減し、アニメーション制作の効率を向上させます。
  • 没入型体験VRおよびARアプリケーションにおいて、Motion Dreamerはリアルな仮想シーンとダイナミックなエフェクトを生成し、ユーザーにより没入感のある体験を提供します。
  • インタラクティブなアプリケーションMotion Dreamerは、ユーザー入力によるわずかな動きの手がかりを与えることで、ユーザーとインタラクションする動的なコンテンツを生成し、より自然で滑らかなインタラクティブ体験を実現します。
  • 運転シナリオシミュレーションMotion Dreamerは、自動運転の分野で様々な複雑な運転シナリオを生成するために使用でき、自動運転アルゴリズムのテストと最適化に役立ちます。
  • 交通流分析Motion Dreamerによって生成される膨大な量の運転シナリオデータは、交通流の分析と予測に利用でき、都市交通計画と管理の参考となる。