project
LeviTor - 南京大学、アント・フィナンシャル、その他の機関によってオープンソース化された、3Dターゲット軌道制御ビデオ合成技術。
LeviTorは、南京大学、アントグループ、浙江大学などの機関によって開発された画像から動画への合成技術です。深度情報とK平均クラスタリングポイントを組み合わせて動画内の3Dオブジェクトの軌道を制御し、明示的な3D軌道追跡の必要性を排除します。LeviTorは…
LeviTorとは何ですか?
LeviTorは、南京大学、アントグループ、浙江大学などの研究機関によって開発された画像から動画への合成技術です。深度情報とK平均法クラスタリングポイントを組み合わせることで、動画内の3Dオブジェクトの軌道を制御し、明示的な3D軌道追跡の必要性を排除します。高品質な動画オブジェクトセグメンテーションデータセットで学習されたLeviTorは、複雑なシーンにおけるオブジェクトの動きや相互作用を効果的に捉えます。ユーザーフレンドリーな推論プロセスにより3D軌道の入力が簡素化され、動画生成技術がより高度で使いやすくなります。LeviTorの登場は、3Dオブジェクトの軌道制御への道を開き、クリエイティブなアプリケーションの範囲を広げ、より幅広いユーザーに適しています。
LeviTorの主な機能
- 物体の動きを精密に制御する静止画像から動画を生成する際に、物体の動きの軌跡を正確に制御します。
- クリエイティブなアプリケーションを強化する3D軌道制御に基づき、映像合成の創造的な応用範囲が拡大する。
- ユーザー入力を簡素化するユーザーは、シンプルな2D画像上に描画して奥行きを調整することで3D軌跡を入力できるため、技術的な障壁が低くなります。
- 深度情報とオブジェクトマスクを自動的に抽出します。このシステムは画像から深度情報とオブジェクトマスクを自動的に抽出するため、ユーザーの操作が軽減されます。
- インタラクティブな軌跡描画ユーザーは対話的に物体の軌跡を描画し、システムはそれを3Dパスとして解釈する。
LeviTorの技術原則
- K平均クラスタリングビデオオブジェクトマスクのピクセルに対してK平均クラスタリングを実行し、代表的な制御点のセットを取得します。
- 深層情報融合DepthAnythingV2深度推定ネットワークは、相対深度マップを予測し、各制御点における深度をサンプリングして、制御点に深度情報を追加します。
- 制御信号の構成2次元座標と推定深度値を組み合わせることで制御軌道が構築され、これがビデオ拡散モデルの制御信号として機能する。
- ビデオ拡散モデル制御信号はビデオ拡散モデルに入力され、3D軌道に沿ったビデオが生成される。
- ユーザーフレンドリーな推論プロセスユーザーがクリックして深度値を調整することで3D軌跡を入力できる、ユーザーフレンドリーなインタラクティブシステムを設計してください。
Levitorプロジェクトの住所
- プロジェクト公式サイト:ppetrichor.github.io/levitor
- GitHubリポジトリ:https://github.com/qiuyu96/LeviTor
- ハギングフェイスモデルライブラリ:https://huggingface.co/hlwang06/LeviTor
- arXiv技術論文:https://arxiv.org/pdf/2412.15214
LeviTorの応用事例
- 映画の特殊効果制作リアルな特殊効果シーンを生成し、ロケ撮影コストを削減し、制作効率を向上させる。
- ゲームアニメーション制作ゲーム開発において、ダイナミックなゲーム背景やキャラクターアニメーションを作成することは、ゲームの没入感を高める上で重要です。
- バーチャルリアリティ体験VRアプリケーションでは、より没入感のある本格的な体験をユーザーに提供するために、リアルな仮想環境が合成されます。
- 拡張現実ディスプレイAR(拡張現実)の分野では、仮想情報が現実世界とシームレスに統合され、教育やナビゲーションなどのシナリオで活用されている。
- 広告ビデオ制作視聴者の注目を集め、ブランドイメージと製品の魅力を高める、ダイナミックな広告動画を作成する。