AB
AiBoss
project

3DTown - コロンビア大学は、Cybever AIなどと共同で、単一の視点から3Dの街並みを生成するフレームワークを発表しました。

3DTownは、コロンビア大学がCybever AIおよび他の機関と共同で開発したフレームワークで、単一の俯瞰図から3Dの街並みを生成します。このフレームワークは、領域ベースの生成と空間認識型3Dインペインティング技術に基づいており、入力画像を重なり合う領域に分解します。

3DTownとは何ですか?

3DTownは、コロンビア大学がCybever AIをはじめとする複数の機関と共同で開発したフレームワークで、単一の俯瞰図から3Dの街並みシーンを生成します。領域ベースの生成と空間認識型3Dインペインティング技術に基づき、入力画像を重なり合う領域に分解します。次に、事前学習済みの3Dオブジェクトジェネレーターが各領域の3Dコンテンツを生成します。マスクベースの補正フローインペインティング処理により、構造的な連続性を維持しながら欠落したジオメトリを補完します。3DTownは、高い幾何学的品質とテクスチャ忠実度を備えた一貫性のある3Dシーンの生成をサポートし、様々なスタイルのシーン生成において既存の最先端手法を凌駕する優れた性能を発揮します。

3DTownの主な機能

  • 多様な3Dシーンを生成する「雪の街」や「砂漠の街」など、さまざまなスタイルやレイアウトのシーン生成をサポートします。
  • 幾何学的形状とテクスチャの一貫性を維持する生成された3Dシーンは、形状と質感の点で入力画像と非常に高い一致度を示している。
  • 複雑なシナリオを効率的に処理する複雑なシーンを効果的に処理し、幾何学的歪みやレイアウトの錯覚を回避できます。

3DTownの技術原則

  • 地域化入力画像は重なり合う領域に分解され、各領域は独立して3Dコンテンツを生成します。事前学習済みの3Dオブジェクトジェネレーターを使用して各領域の3Dコンテンツを生成し、局所的な位置合わせと解像度を向上させます。領域融合に基づいて、生成された領域は段階的に統合され、一貫性のあるグローバルな3Dシーンが生成されます。
  • 空間認識3D復元単眼深度推定とランドマーク検出を用いて、粗い3D構造を空間事前情報として初期化します。マスク付き整流フロー(Masked Rectified Flow)手法を用いて、既知のコンテンツの連続性を維持しながら、欠落したジオメトリを補完します。2段階のマスク付き整流フローパイプラインにより、疎な構造と構造化された潜在表現が生成され、全体的な一貫性が確保されます。
  • 構造化された潜在表現この手法では、位置インデックスや潜在特徴ベクトルなどの構造化された潜在表現に基づいて3Dシーンを構築します。疎構造生成器と構造化潜在生成器を用いて、3Dシーンの潜在表現を段階的に生成します。
  • モジュール設計モジュール設計に基づき、複雑な3Dシーン生成の問題は複数のサブ問題に分解され、それぞれが統合される前に独立して解決される。

3DTownプロジェクトの住所

3DTownのアプリケーションシナリオ

  • 仮想世界の構築仮想都市やシーンを迅速に生成することができ、仮想現実(VR)や拡張現実(AR)アプリケーション向けにリアルな環境を提供する。
  • ゲーム開発これは、ゲームデザイナーがシンプルな俯瞰図から複雑な3Dゲームシーンを効率的に生成できるツールを提供し、時間とコストを節約します。
  • ロボットシミュレーションロボットの訓練用にリアルな3Dシーンを作成し、複雑な環境におけるロボットのナビゲーション能力とインタラクション能力を向上させる。
  • デジタルコンテンツ制作これは、アーティストやデザイナーが3Dシーンのプロトタイプを迅速に作成するのに役立ち、創造プロセスを加速させ、作業効率を向上させます。
  • 建築と都市計画構想スケッチから3D建築モデルや都市レイアウトを生成し、計画・設計作業を支援するとともに、計画案のプレゼンテーションや評価を容易にする。