project
モーションプロンプティング - Googleがミシガン大学およびブラウン大学と共同で開発した、モーション軌道制御ビデオ生成モデル
モーションプロンプティングは、Google DeepMind、ミシガン大学、ブラウン大学が共同開発した動画生成技術です。モーション軌跡に基づいて動画コンテンツの生成を制御・誘導します。
モーションプロンプティングとは何ですか?
モーションプロンプティングは、Google DeepMind、ミシガン大学、ブラウン大学が共同開発した動画生成技術です。モーション軌跡に基づいて動画コンテンツの生成を制御・誘導します。モーションプロンプティングは、点軌跡を柔軟なモーション表現として使用し、単一点からシーン全体まで、あらゆる複雑さの動きをエンコードできます。ユーザーは、テキストプロンプトと同様に「モーションプロンプト」を設計することで、オブジェクト制御、カメラ制御、物理現象のシミュレーションなど、動画モデルのさまざまな機能を刺激できます。モーションプロンプティングは、動画生成の柔軟性と精度を向上させ、将来のインタラクティブな動画生成や世界モデルクエリに新たな可能性をもたらします。
動作プロンプトの主な機能
- オブジェクト制御動きの手がかりに基づいて、ビデオ内の特定のオブジェクトの動き(回転や移動など)をきめ細かく制御することが可能です。
- カメラ制御これにより、動画におけるカメラの動きを制御できるようになり、移動、回転、ズームなどの操作が可能になります。
- 物理現象のシミュレーション動画では、流体力学(水、煙など)や剛体力学といった物理現象を紹介する。
- 物体とカメラの同時制御オブジェクト制御とカメラ制御の動きの合図を組み合わせることで、複雑なシーンインタラクションを可能にします。
- ドラッグ&ドロップによる画像編集ドラッグ&ドロップ操作による画像編集をサポートしており、ダイナミックな画像編集を実現します。
- モーション伝達これは、ある動画の動きを別の動画の最初のフレームに転送することで、動きを再利用することを指します。
- モーション増幅動画内の微妙な動きを拡大して、より目立つようにします。
動作誘導の技術的原理
- 点軌跡表現この技術は、点軌跡を動きの表現方法として用い、動画内の任意の数の点の動きを捉えます。これには、オブジェクト固有の動きやシーン全体の動きも含まれます。
- 条件付きビデオ生成モデル事前学習済みの動画拡散モデルに基づいて、モーションキューを条件付き入力として受け入れるように制御ネットワーク(ControlNet)を学習させる。
- 動作の手がかりの構築ユーザー入力(マウスドラッグなど)を点の軌跡に変換したり、コンピュータビジョン技術に基づいて高度なユーザー要求から詳細な動作軌跡を生成したりする。
- 軌跡コーディング点の軌跡を時空間ボリュームとしてエンコードし、各軌跡には、訪れた各場所に固有の埋め込みベクトルを配置する。
- モデルトレーニングこのモデルは、動画から抽出された軌跡データを用いて学習され、軌跡の指示に基づいて動画が生成される。
- 軌道スパース性調整ユーザーは軌道の疎度を調整することで、制御の精緻さとビデオモデルの自由度のバランスを取ることができます。
- マルチタスク異なる動きの手がかりを組み合わせることで、単一のモデルで複数の複雑な動画生成タスクを実現できる。
モーションプロンプトのプロジェクトアドレス
- プロジェクト公式サイト:motion-prompting.github.io
- arXiv技術論文:https://arxiv.org/pdf/2412.02700
モーションプロンプトの応用シナリオ
- 映画およびビデオ制作監督や映像制作者は、複雑な手動アニメーションを必要とせずに、特殊効果ショットやアクションシーンなどの複雑でダイナミックなシーンを作成できます。
- ゲーム開発ゲーム開発者は、ゲーム用の動的な背景動画を作成したり、ゲームキャラクターと環境との間の動的な相互作用に利用したりします。
- 仮想現実(VR)と拡張現実(AR)VRおよびARアプリケーションにおいて、より自然でリアルな仮想環境とインタラクティブな効果を作成する。
- インタラクティブメディアアートアーティストたちは、鑑賞者が自身の身体の動きに基づいて作品とインタラクトできる、新しいインタラクティブなアート作品を制作している。
- 教育と訓練現実世界の物理現象や動的なシナリオをシミュレートすることに基づいており、物理学、工学、医学教育などの分野で活用できる。