project
GEN3C - NVIDIAがトロント大学などと共同で開発した生成型ビデオモデル。
GEN3Cは、NVIDIA、トロント大学、およびVector Instituteによって開発された新しい生成型ビデオモデルです。高精度なカメラ制御と時空間の一貫性に基づいて、高品質の3Dビデオコンテンツを生成します。GEN3Cは、点群ベースの3Dキャッシュを構築します...
GEN3Cとは何ですか?
GEN3Cは、NVIDIA、トロント大学、およびVector Instituteが共同開発した革新的な生成型ビデオモデルです。高精度なカメラ制御と時空間の一貫性に基づいて、高品質な3Dビデオコンテンツを生成します。GEN3Cは、点群ベースの3Dキャッシュを構築してビデオ生成をガイドし、入力画像またはビデオフレームから深度推定値を逆投影することで3Dシーンを生成し、生成モデルへの条件付き入力としてユーザーが提供するカメラ軌跡に基づいて2Dビデオをレンダリングします。GEN3Cの最大の特長は、カメラの動きを高精度に制御できる点にあり、従来の手法における明示的な3Dモデリングの欠如によって生じる不整合を回避します。GEN3Cは、単一視点から複数視点までのビデオ生成をサポートし、静的シーンと動的シーンの両方に適用可能で、疎なビューを用いた新しいビュー合成タスクにおいて最先端の結果を達成します。 GEN3Cは3D編集と複雑なカメラワーク(プッシュインやプルアウトショットなど)の生成をサポートしており、ビデオ制作とシミュレーションのための強力なツールを提供します。
GEN3Cの主な機能
- 精密なカメラ制御ユーザーが指定したカメラ軌道に基づいて動画を生成し、複雑なカメラ動作(ズームイン・ズームアウト、カメラの回転など)をサポートし、動画の時空間的な一貫性を維持します。
- 3D一貫性のあるビデオ生成これにより、物体が突然出現したり消えたりするなどの問題を回避し、リアルで一貫性のある動画の生成をサポートします。
- 複数の疎な視点を用いた斬新な視点合成単一視点、疎な複数視点、密な複数視点からの入力に対応し、高品質な新しいタイプのビュービデオを生成します。
- 3D編集とシーン操作ユーザーは3D点群を修正(オブジェクトの削除や追加など)してシーンを編集し、対応する動画を生成できます。
- 長尺動画の生成空間的・時間的な一貫性を維持しながら、長尺動画の生成をサポートします。
GEN3Cの技術原理
- 3Dキャッシュの構築入力画像またはビデオフレームの深度推定結果を逆投影することで3D点群を生成し、時空間的に一貫性のある3Dキャッシュを形成する。このキャッシュはビデオ生成の基礎となり、シーンの明確な3D構造を提供する。
- 3Dキャッシュのレンダリングユーザーが指定したカメラ軌跡に基づいて、3Dキャッシュを2Dビデオにレンダリングします。
- ビデオ生成この手法では、事前学習済みのビデオ拡散モデル(Stable Video DiffusionやCosmosなど)を条件付き入力として使用し、高品質なビデオを生成します。このモデルは、拡散処理中にノイズ除去の目的関数を最適化し、レンダリング時のアーティファクトを修復し、欠落した情報を補完します。
- 多視点融合入力に複数の視点が含まれる場合、GEN3Cは最大プーリング融合戦略を用いて、異なる視点からの情報をビデオ生成モデルに集約し、一貫性のあるビデオを生成します。
- 自己回帰生成とキャッシュ更新長時間の動画を生成する場合、GEN3Cは動画を複数の重なり合うブロックに分割し、ブロックごとに動画を生成し、3Dキャッシュを更新して動画の時空間的な一貫性を維持します。
GEN3Cのプロジェクトアドレス
- プロジェクト公式サイト:https://research.nvidia.com/labs/toronto-ai/GEN3C/
- GitHubリポジトリ:https://github.com/nv-tlabs/GEN3C
- arXiv技術論文:https://arxiv.org/pdf/2503.03751
GEN3Cの応用シナリオ
- シングルビュービデオ生成一枚の画像から動的な動画を生成できるため、迅速なコンテンツ制作に最適です。
- 新しいタイプのビュー合成限られた数の視点から新しい視点の動画を生成し、VR/ARや3D再構築に利用できます。
- ドライビングシミュレーター自動運転訓練を支援するため、さまざまな視点から運転シナリオの動画を生成する。
- 動的なビデオ再レンダリング既存の動画に新たな視点を与え、動画編集や二次制作に活用します。
- 3Dシーン編集シーンコンテンツを修正して新しいビデオを生成し、映画やテレビ番組の制作、ゲーム開発を支援する。