AB
AiBoss
project

GEN3C - NVIDIAがトロント大学などと共同で開発した生成型ビデオモデル。

GEN3Cは、NVIDIA、トロント大学、およびVector Instituteによって開発された新しい生成型ビデオモデルです。高精度なカメラ制御と時空間の一貫性に基づいて、高品質の3Dビデオコンテンツを生成します。GEN3Cは、点群ベースの3Dキャッシュを構築します...

GEN3Cとは何ですか?

GEN3Cは、NVIDIA、トロント大学、およびVector Instituteが共同開発した革新的な生成型ビデオモデルです。高精度なカメラ制御と時空間の一貫性に基づいて、高品質な3Dビデオコンテンツを生成します。GEN3Cは、点群ベースの3Dキャッシュを構築してビデオ生成をガイドし、入力画像またはビデオフレームから深度推定値を逆投影することで3Dシーンを生成し、生成モデルへの条件付き入力としてユーザーが提供するカメラ軌跡に基づいて2Dビデオをレンダリングします。GEN3Cの最大の特長は、カメラの動きを高精度に制御できる点にあり、従来の手法における明示的な3Dモデリングの欠如によって生じる不整合を回避します。GEN3Cは、単一視点から複数視点までのビデオ生成をサポートし、静的シーンと動的シーンの両方に適用可能で、疎なビューを用いた新しいビュー合成タスクにおいて最先端の結果を達成します。 GEN3Cは3D編集と複雑なカメラワーク(プッシュインやプルアウトショットなど)の生成をサポートしており、ビデオ制作とシミュレーションのための強力なツールを提供します。

GEN3Cの主な機能

  • 精密なカメラ制御ユーザーが指定したカメラ軌道に基づいて動画を生成し、複雑なカメラ動作(ズームイン・ズームアウト、カメラの回転など)をサポートし、動画の時空間的な一貫性を維持します。
  • 3D一貫性のあるビデオ生成これにより、物体が突然出現したり消えたりするなどの問題を回避し、リアルで一貫性のある動画の生成をサポートします。
  • 複数の疎な視点を用いた斬新な視点合成単一視点、疎な複数視点、密な複数視点からの入力に対応し、高品質な新しいタイプのビュービデオを生成します。
  • 3D編集とシーン操作ユーザーは3D点群を修正(オブジェクトの削除や追加など)してシーンを編集し、対応する動画を生成できます。
  • 長尺動画の生成空間的・時間的な一貫性を維持しながら、長尺動画の生成をサポートします。

GEN3Cの技術原理

  • 3Dキャッシュの構築入力画像またはビデオフレームの深度推定結果を逆投影することで3D点群を生成し、時空間的に一貫性のある3Dキャッシュを形成する。このキャッシュはビデオ生成の基礎となり、シーンの明確な3D構造を提供する。
  • 3Dキャッシュのレンダリングユーザーが指定したカメラ軌跡に基づいて、3Dキャッシュを2Dビデオにレンダリングします。
  • ビデオ生成この手法では、事前学習済みのビデオ拡散モデル(Stable Video DiffusionやCosmosなど)を条件付き入力として使用し、高品質なビデオを生成します。このモデルは、拡散処理中にノイズ除去の目的関数を最適化し、レンダリング時のアーティファクトを修復し、欠落した情報を補完します。
  • 多視点融合入力に複数の視点が含まれる場合、GEN3Cは最大プーリング融合戦略を用いて、異なる視点からの情報をビデオ生成モデルに集約し、一貫性のあるビデオを生成します。
  • 自己回帰生成とキャッシュ更新長時間の動画を生成する場合、GEN3Cは動画を複数の重なり合うブロックに分割し、ブロックごとに動画を生成し、3Dキャッシュを更新して動画の時空間的な一貫性を維持します。

GEN3Cのプロジェクトアドレス

GEN3Cの応用シナリオ

  • シングルビュービデオ生成一枚の画像から動的な動画を生成できるため、迅速なコンテンツ制作に最適です。
  • 新しいタイプのビュー合成限られた数の視点から新しい視点の動画を生成し、VR/ARや3D再構築に利用できます。
  • ドライビングシミュレーター自動運転訓練を支援するため、さまざまな視点から運転シナリオの動画を生成する。
  • 動的なビデオ再レンダリング既存の動画に新たな視点を与え、動画編集や二次制作に活用します。
  • 3Dシーン編集シーンコンテンツを修正して新しいビデオを生成し、映画やテレビ番組の制作、ゲーム開発を支援する。