AB
AiBoss
project

Flex3D - Meta GenAIとオックスフォード大学が共同開発した2段階3D生成フレームワーク

Flex3Dは、MetaのGenAIチームとオックスフォード大学の研究チームが開発した革新的な2段階3D生成フレームワークです。テキスト、単一画像、または複数の高品質な入力ビューに基づいて疎なビュー画像から、高品質な3D画像を生成できます。

Flex3Dとは何ですか?

Flex3Dは、MetaのGenAIチームとオックスフォード大学の研究チームが開発した革新的な2段階3D生成フレームワークです。テキスト、単一画像、または疎なビュー画像から、任意の数の高品質な入力ビューに基づいて高品質な3Dコンテンツを生成するという課題に取り組んでいます。第1段階では、微調整されたマルチビューおよびビデオ拡散モデルに基づいて、多様な候補ビューが生成されます。ビュー選択メカニズムにより、高品質で一貫性のあるビューのみが再構成に使用されることが保証されます。第2段階では、トランスフォーマーベースのモデルであるFlexible Reconstruction Model(FlexRM)が、任意の数の入力ビューを処理し、効率的かつ詳細な3D生成のために3Dガウス点を直接出力します。Flex3Dは、3D再構成および生成タスクにおいて最先端のパフォーマンスを実現しており、ユーザー調査では92%を超える勝率を達成しています。

Flex3Dの主な機能

  • 高品質な3Dコンテンツ生成テキストによる説明、単一画像、または疎なビュー画像から、高品質な3Dモデルを生成します。
  • 柔軟なビュー生成高度に調整されたマルチビューおよびビデオ拡散モデルに基づいて、豊富な候補ビューを生成し、対象となる3Dオブジェクトの複数の角度を捉えます。
  • ビューフィルタリングメカニズム後続の3D再構築プロセスで使用するために、高品質で一貫性のあるビューを自動的に選択します。
  • フレキシブル再構築モデル(FlexRM)トランスフォーマーアーキテクチャに基づいており、任意の数の入力ビューを処理し、3Dガウス点を直接出力できます。
  • 非常に効率的な3D表現3次元平面表現と3Dガウスレンダリング技術を用いることで、高速かつ詳細な3Dモデル生成を実現できます。
  • 堅牢性不完全な入力ビューをシミュレートしてトレーニングを行うことで、入力ノイズに対するモデルの堅牢性が向上する。

Flex3Dの技術的原理

  • マルチビュー拡散モデル:微調整されたマルチビュー画像拡散モデルとビデオ拡散モデルを使用して、候補ビュープールを生成します。
  • 選択パイプを表示品質評価と特徴マッチングネットワークに基づいて、3D再構成に使用する高品質な画像が選択されます。
  • コンバーターアーキテクチャFlexRMはトランスフォーマーアーキテクチャに基づいており、さまざまな数や角度の入力ビューを処理できます。
  • 3次元平面表現と3Dガウスプロット3平面特徴と3Dガウスレンダリング技術を組み合わせることで、3平面特徴はMLPに基づいて3Dガウス点にデコードされます。
  • 2段階トレーニング戦略まず、モデルの事前学習を行い、次に、高密度にレンダリングされた実世界のデータを使用して、第2段階の学習を実行します。
  • 不完全な入力ビューシミュレーショントレーニング中は、不完全な入力ビューがシミュレートされ、モデルの堅牢性を高めるために3Dガウス点にノイズが追加されます。

Flex3Dプロジェクトのアドレス

Flex3Dの応用事例

  • ビデオゲーム開発ゲームアセットや環境の3Dモデルを迅速に生成できるため、ゲームのデザインと開発の効率が向上します。
  • 拡張現実(AR)と仮想現実(VR)ARおよびVRアプリケーション向けに、リアルな3Dオブジェクトとシーンを作成し、ユーザーの没入感を高めます。
  • 映画およびアニメーション制作キャラクターデザイン、小道具製作、シーン構築など、映画やアニメーションで使用するための高品質な3Dモデルを生成します。
  • ロボット工学複雑な環境におけるロボットのナビゲーション能力と操縦能力をシミュレーションおよび訓練するための3Dモデルを生成する。
  • 電子商取引オンラインストア向けに商品の3Dビューを生成し、より魅力的な商品表示を提供することで、消費者の購買意思決定を支援します。