AB
AiBoss
project

プロメテウス - 浙江大学がアント・フィナンシャルおよび他大学と共同開発した3D知覚ポテンシャル拡散モデル

Prometheusは、テキストから3Dシーンコンテンツを高速に生成するために特別に設計された、革新的な3D対応潜在拡散モデルです。オブジェクトレベルおよびシーンレベルの3D生成を数秒で完了させることができ、高品質な出力と優れた汎化性能を維持します。

プロメテウスとは何ですか?

Prometheusは、テキストから3Dシーンコンテンツを迅速に生成するために特別に設計された、革新的な3D対応潜在拡散モデルです。高品質な出力と優れた汎化能力を維持しながら、3Dレベルの3Dオブジェクトとシーンを数秒で生成できます。その核心は、2Dの事前知識を活用して、効率的で汎化可能な3D合成プロセスを推進することです。潜在拡散パラダイム内で動作するマルチビュー、フィードフォワード、ピクセルアラインメントされた3Dガウス生成プロセスとして3Dシーン生成を表現することで、Prometheusはテキスト記述から詳細かつ正確な形状を持つ3Dシーンを効果的に生成します。事前学習済みのテキストから画像生成モデルに基づく微調整と、外観情報と幾何学的情報を分離するためのRGB-D潜在空間の導入により、生成されるコンテンツの忠実度と幾何学的品質が向上します。

Prometheusの主な機能

  • 高効率3D生成オブジェクトやシーン全体を含む複雑な3Dシーンを数秒で生成できるため、3Dコンテンツ制作の効率が向上します。
  • 高品質な出力生成された3Dシーンは、視覚的な忠実度と幾何学的な品質の点で優れた性能を発揮し、テキストによる説明の詳細や背景情報を正確に反映している。
  • 優れた一般化能力Prometheusは、大規模な単一視点および複数視点のデータセットで学習することで、多様な3Dオブジェクトやシーンに一般化することができ、その一般化能力はStable Diffusionに匹敵します。
  • 複数ビューの一貫性生成された3Dシーンは、複数の視点間で一貫性を保ち、大きな回転や極端な遠近法の下でも安定した視覚効果を維持します。
  • テキストと3Dの位置合わせ生成された3Dシーンは、入力されたテキストプロンプトに正確に位置合わせできるため、生成されたコンテンツがユーザーの説明や期待と一致することが保証されます。

プロメテウスの技術的原理

  • 2段階のトレーニングフレームワーク
    • フェーズ1:3Dガウス変分オートエンコーダー(GS-VAE)事前学習済みの画像エンコーダ(Stable Diffusionエンコーダなど)は、RGB画像と予測された単眼深度マップを潜在空間にエンコードします。クロスビュー情報はマルチビュー・トランスフォーマーによって統合され、カメラ姿勢情報が注入されます。融合された潜在空間変数は、ピクセル単位で整列された3Dガウスシーンにデコードされます。このピクセル単位で整列された3Dガウスシーンは、シーンレベルの表現として機能します。
    • フェーズ2:マルチビュー電位拡散モデル(MV-LDM)ノイズ除去拡散プロセスを用いて、カメラの姿勢とテキスト情報に基づいて、マルチビューRGB-D潜在空間コードを共同で予測します。ランダムにサンプリングされたガウスノイズから出発し、反復的なノイズ除去プロセスによってマルチビュー潜在空間コードを復元します。そして、このマルチビューRGB-D潜在空間コードを用いて、最終的な3Dシーンを生成します。
  • RGB-D潜在空間の導入:Prometheusは、RGB-D潜在空間を導入し、外観情報(RGB)と幾何学的情報(D)を分離することで、生成されるモデルの忠実度と幾何学的品質を向上させます。これにより、高品質なビジュアルを維持しながら、より効率的に3Dガウス分布を生成できます。
  • フィードフォワード生成戦略:Prometheusはフィードフォワード生成戦略を採用しており、従来の最適化手法に比べて生成時間を短縮し、生成効率を向上させています。潜在空間からマルチビューRGB-D潜在空間コードをサンプリングし、GS-VAEデコーダを用いて3Dガウスシーンにデコードすることで、高速かつ高品質な3Dシーン生成を実現しています。
  • 分類器不要のガイダンス(CFG):生成された3Dシーンとテキストプロンプトとの整合性を確保するため、Prometheusは分類器フリーガイダンス(CFG)を用いてマルチビュー生成プロセスをガイドします。ガイダンスの強度を調整することで、マルチビューの一貫性と忠実度のバランスを取り、生成結果の不整合を回避します。
  • 大規模データセットでのトレーニング:Prometheusは、優れた汎化能力を確保するために、大規模な単一視点および複数視点のデータセットで学習されています。データセットには、オブジェクト中心、屋内、屋外、運転シナリオなど、さまざまなシーンタイプが含まれており、テキストプロンプトはマルチモーダルな大規模言語モデルによって生成されます。
  • 損失関数:トレーニング中、Prometheusは、平均二乗誤差(MSE)損失、知覚損失、スケール不変深度損失など、さまざまな損失関数を使用して、生成された3Dシーンが入力画像および深度マップと視覚的にも幾何学的にも一致するようにします。

プロメテウスプロジェクトのアドレス

Prometheusの応用シナリオ

  • コンテンツ作成VRやARアプリケーションで仮想環境を構築するための、リアルな3Dシーンやオブジェクトを素早く生成します。例えば、仮想展示会、仮想ツアー、仮想教育シナリオなどを作成できます。
  • リアルタイムインタラクションVRやARアプリケーションでは、ユーザーはテキスト入力を通じてリアルタイムで3Dシーンを生成・変更することができ、インタラクティブな体験が向上します。
  • シーンデザイン都市、森林、砂漠など、さまざまなゲームシーンを迅速に生成できるため、ゲーム開発の効率が向上します。開発者は簡単なテキスト記述だけで複雑な3D環境を生成できるため、手動モデリングにかかる時間とコストを削減できます。
  • コンセプトデザイン建築家やインテリアデザイナーは、Prometheusを使用して、建物やインテリアデザインの3Dモデルを迅速に生成し、予備設計や顧客へのプレゼンテーションに活用できます。テキストによる説明を用いることで、さまざまなスタイルやレイアウトの3Dシーンを素早く生成でき、設計効率が向上します。
  • バーチャルショーケース生成された3Dシーンは仮想デモンストレーションに使用でき、顧客はVRデバイスを通してデザイン効果に没入し、より直感的なフィードバックを得ることができる。