AB
AiBoss
project

GenXD - シンガポール国立大学とマイクロソフトが共同開発した、汎用的な3Dおよび4D同時生成フレームワーク。

GenXDは、シンガポール国立大学とマイクロソフトが共同開発した3D-4D共創フレームワークです。任意の数の条件付き画像から高品質の3Dおよび4Dシーンを生成できます。このフレームワークは、データ処理ワークフローを使用してビデオからカメラデータを抽出します。

GenXDとは何ですか?

GenXDは、シンガポール国立大学とマイクロソフトが共同開発した3D-4D生成フレームワークです。任意の数の条件付き画像から、高品質な3Dおよび4Dシーンを生成できます。このフレームワークは、データ処理ワークフローを使用して動画からカメラの姿勢とオブジェクトの動きの強度を抽出し、この情報と大規模な4DデータセットCamVid-30Kに基づいてモデルをトレーニングします。GenXDは、マルチビュー時間モジュールに基づいてカメラとオブジェクトの動きを分離し、マスクされた潜在条件を使用して複数の視点からの条件付き生成をサポートすることで、単一のモデルで複数の3Dおよび4D生成タスクを処理できるようにします。

GenXDの主な機能

  • 3Dおよび4Dシーン生成GenXDは、動的なコンテンツと静的なコンテンツの両方を含め、単一または複数の視点から高品質の3Dおよび4Dシーンを生成できます。
  • カメラ姿勢推定GenXDは、Structure from Motion(SfM)技術に基づいて、動画内のカメラ姿勢を推定し、カメラの軌跡に沿った動画を生成するための基盤を提供します。
  • 物体の動きの推定GenXDは、深度推定とキーポイント追跡に基づいて、動画内の物体の動きを識別し、シミュレーションします。
  • マルチビュータイミングモジュールフレームワークの内部モジュールは、マルチビュー情報と時間情報を処理し、カメラの動きとオブジェクトの動きを分離し、よりリアルな動的シーンを生成します。
  • 潜在的な症状を覆い隠すGenXDは、マスクされた潜在条件を使用した条件生成をサポートしており、ネットワーク構造を変更することなく、モデルが任意の数の入力ビューを受け入れることを可能にします。

GenXDの技術原則

  • データ処理プロセスGenXDは、データ処理ワークフローを使用してビデオからカメラの姿勢と物体の動きに関する情報を抽出し、その後のモデルトレーニングに必要なデータを提供します。
  • マルチビュータイミングモジュールGenXDの内部マルチビュー時間モジュールは、マルチビュー情報と時間情報を処理し、α融合戦略を用いて3Dおよび4Dデータにおけるシームレスな学習を実行できます。
  • マスクされた潜在条件付き拡散モデルGenXDは、マスク付き潜在条件付き拡散モデル(LDM)を使用して、異なるカメラ視点と時間ステップで画像を生成し、単一視点と複数視点の生成をサポートしています。
  • カメラと被写体の動きを分離するGenXDはマルチビュータイミングモジュールに基づいて、カメラの動きとオブジェクトの動きを分離します。これは、ダイナミックなシーンを生成する上で非常に重要です。
  • 3Dおよび4Dデータの融合GenXDは、トレーニング中に3Dデータと4Dデータを組み合わせることで、モデルが空間情報と時間情報を同時に学習できるようにし、生成されるデータの品質を向上させます。
  • 3D表現の最適化GenXDによって生成された画像は、3Dガウス点群(3D-GS)やZip-NeRFなどの3D表現を最適化するために直接使用でき、高品質な3Dシーンの再構築を実現できます。

GenXDのプロジェクトアドレス

GenXDの応用シナリオ

  • ビデオゲーム開発GenXDは、ゲーム内で3Dおよび4D環境を生成するために使用され、よりリアルでダイナミックなゲーム世界を提供します。
  • 映画と視覚効果映画制作において、GenXDは複雑な3Dシーンや特殊効果を作成することで、実際の撮影コストとポストプロダクションコストを削減します。
  • 仮想現実(VR)と拡張現実(AR)GenXDは没入感のある3Dおよび4Dコンテンツを生成し、VRおよびARアプリケーションのユーザーエクスペリエンスを向上させます。
  • 建築と都市計画:GenXDが生成した3Dモデルに基づいて、建築家や都市計画家は、デザインコンセプトや計画案をより直感的に提示することができる。
  • 教育と訓練GenXDは、模擬手術や歴史再現など、教育や専門訓練で使用するためのシミュレーション環境を開発しています。