project
ReCapture - Googleとシンガポール国立大学が共同開発した動画処理技術
ReCaptureは、Googleとシンガポール国立大学が開発した動画処理技術で、ユーザーが提供する単一の動画から、新しいカメラ軌跡を持つ新しい動画を生成できます。ReCaptureは、マルチビュー拡散モデルまたは深度ベースの点群レンダリングを使用します。
ReCaptureとは何ですか?
Googleとシンガポール国立大学が共同開発した動画処理技術「ReCapture」は、ユーザーが提供する単一の動画から、斬新なカメラ軌道を持つ新しい動画を生成できます。ReCaptureは、マルチビュー拡散モデルまたは深度ベースの点群レンダリングを用いて、ノイズの多いアンカー動画を新しいカメラ軌道で生成します。次に、マスク付き動画の微調整を行い、アンカー動画を、元の動画のシーンの動きを保持しつつ、新しい角度からシーンを映し出す、クリーンで時間的に一貫性のある角度調整済み動画に変換します。ReCaptureは、元の動画では見えなかったシーンも合理的に想定することができます。
ReCaptureの主な機能
- 新しい視点の動画を生成するユーザーが提供したソースビデオから、全く新しいカメラ軌道を持つビデオを生成し、同じシーンを異なる角度から観察することを可能にします。
- 元のシーンの動きを維持する新しい視点の動画を生成する際に、元の動画に存在するすべてのシーンの動きを保持します。
- 映画的なカメラワークズーム、パン、チルトといった映画的なカメラワークをシミュレートし、動画の視覚効果を高めます。
- シーン完了元の動画に欠けているシーンを想像して補完し、動画コンテンツの完成度を高めてください。
- 動画の画質を向上させるマスク処理を用いた動画微調整技術に基づき、ノイズの多いアンカー動画を、ノイズが少なく、時間的に一貫性のある高品質な動画に変換します。
ReCaptureの技術原理
- アンカービデオ生成:
- 深度推定と点群レンダリングフレームごとの深度推定に基づいて、ビデオフレームは3D点群シーケンスに変換されます。ユーザーが指定したカメラの動きに応じて新しい視点がシミュレートされ、点群シーケンスがレンダリングされて新しいビデオフレームが生成されます。
- マルチビュー拡散モデルより複雑なカメラ軌道(例えば、シーン内の特定の点の周囲を回る軌道など)の場合、マルチビュー拡散モデルを使用して、新しい視点からのビデオフレームを生成します。
- マスクされたビデオの微調整:
- 時間的LoRA(低ランク適応)マスクされたアンカービデオ上で、LoRA学習シーンの時間的ダイナミクスを微調整し、学習アンカービデオの意味のあるピクセル部分に焦点を当て、未知の領域を無視します。
- ローラ・スペース空間LoRA学習シーンの外観を、ソースビデオの拡張フレーム上で微調整し、塗りつぶされたピクセルが元のビデオピクセルとシームレスに融合するようにします。
- ビデオモデルに対する強力な事前分布ビデオモデルから得られる強力な事前知識を活用することで、適切なコンテンツがマスク領域に自動的に入力され、ビデオの時間的な一貫性が大幅に向上し、アンカービデオのジッターが解消されます。
ReCaptureのプロジェクトアドレス
- プロジェクト公式サイト:generative-video-camera-controls.github.io
- arXiv技術論文:https://arxiv.org/pdf/2411.05003
ReCaptureの応用シナリオ
- 映画およびビデオ制作映画制作者は、既に撮影済みの映像を再編集・調整し、元のカメラアングルや動きを変更することで、新たな視覚効果を生み出したり、シーンの構成を改善したりする。
- 動画編集およびポストプロダクション動画編集者は、例えばカメラアングルを変更して動画内の重要な要素を強調したり、不要な背景を削除したりするなどして、動画コンテンツを修正または強化します。
- 仮想現実(VR)と拡張現実(AR)VRやARアプリケーションでは、より没入感がありインタラクティブなビデオコンテンツを生成し、さまざまな視点からシーンを観察できる機能を提供します。
- ニュースとドキュメンタリージャーナリストやドキュメンタリー映画制作者は、出来事を再現することで、ニュース記事や歴史的出来事を複数の視点から紹介し、報道の深みと広がりを増す。
- スポーツの生中継スポーツイベントの生中継は、より多くの視点を提供し、視聴者がさまざまなカメラアングルから試合を体験できるようにすることで、視聴体験を向上させます。