AB
AiBoss
project

Amodal3R - 南洋理工大学がオックスフォード大学などと共同で開発した、条件付き3D生成モデル。

Amodal3Rは、部分的にしか見えない2Dオブジェクト画像から完全な3D形状と外観を推論・再構築する条件付き3D生成モデルです。このモデルは、「ベース」となる3D生成モデルTRELLISをベースに、マスクの重み付けを組み込んでいます。

Amodal3Rとは何ですか?

Amodal3Rは、部分的にしか見えない2Dオブジェクト画像から完全な3D形状と外観を推論・再構築する条件付き3D生成モデルです。基本的な3D生成モデルTRELLISをベースに、マスク重み付けマルチヘッドクロスアテンション機構とオクルージョン対応アテンション層を導入することで、オクルージョンに関する事前知識を活用し、再構築プロセスをガイドします。合成データのみで学習されたAmodal3Rは、実世界のシナリオで非常に優れた性能を発揮し、「2D予測補完+3D再構築」という既存の2段階手法を大幅に上回り、オクルージョンシーンにおける3D再構築の新たなベンチマークを確立しました。

Amodal3Rの主な機能

  • 遮蔽を考慮した3D再構成重度の遮蔽がある2D画像の場合、Amodal3Rは2D断片情報と意味推論を組み合わせて、完全な3Dモデルを生成することができます。
  • 既存の方法を超えて「2D予測完了+3D再構成」という2段階方式と比較して、Amodal3Rは遮蔽条件下でより優れた性能を発揮し、3D再構成における新たなベンチマークを確立した。

Amodal3Rの技術原則

  • 基本的な3D生成モデルの拡張機能Amodal3Rは、「基本的な」3D生成モデルから出発し、それを拡張して、遮蔽された2D画像を処理して、妥当な3D形状と外観を復元します。
  • マスク重み付けマルチヘッド交差注意メカニズム本モデルは、マスク重み付けマルチヘッドクロスアテンション機構を導入しており、遮蔽問題への対処能力が向上しています。具体的には、アテンション機構はマスクによって制御され、生成プロセスにおいて可視部分に重点を置き、遮蔽に関する事前知識を用いて遮蔽領域の形状とテクスチャを推測します。
  • 知覚注意層の遮蔽マスク重み付けマルチヘッドクロスアテンション機構に続き、Amodal3Rは遮蔽を考慮したアテンションレイヤーを導入する。
  • DINOv2に基づく特徴抽出Amodal3Rは、高品質な視覚的特徴抽出のためにDINOv2を利用しています。DINOv2によって提供される特徴は、3D再構成のためのより多くのコンテキスト情報を提供し、モデルがより正確な3D再構成を実行するのに役立ちます。
  • 合成データを用いた学習および汎化能力合成データのみで学習されたAmodal3Rは、遮蔽物のある実世界のシーンでも完全な3Dオブジェクトを再構築することを学習します。これは、このモデルの高い汎化能力を示しており、合成データから学習した知識を実世界のシナリオに適用できることを示しています。

Amodal3Rのプロジェクトアドレス

Amodal3Rの応用事例

  • 拡張現実(AR)と仮想現実(VR)AR(拡張現実)やVR(仮想現実)アプリケーションにおいて、Amodal3Rは部分的にしか見えない2D画像から完全な3Dモデルを再構築するのに役立ち、より没入感のある体験を提供します。
  • ロボットビジョンロボットが複雑な環境で動作する場合、物体が部分的に遮蔽されている状況に遭遇することがあります。Amodal3Rは、ロボットが周囲の物体をより正確に認識・理解するのに役立ち、経路計画とタスク実行の精度向上を実現します。
  • 自動運転自動運転の分野では、車両は周囲の物体をリアルタイムで認識する必要があります。Amodal3Rは、部分的に遮蔽された画像から完全な3Dモデルを再構築することができ、自動運転システムが複雑な交通状況をより正確に識別し、処理するのに役立ちます。
  • 3Dアセットの作成ゲーム開発、映画制作、その他3Dアセットを必要とする分野において、Amodal3Rはシンプルな2D画像から高品質な3Dモデルを生成し、3Dモデリングプロセスを簡素化します。
  • 学術研究Amodal3Rは、コンピュータビジョンと3D再構成の研究のための新しいツールと手法を提供します。研究者はこのモデルを使用して、より複雑なシーンやより効率的な再構成アルゴリズムを探求することができます。