project
Depth Anything 3 - ByteDanceが発表した視覚空間再構成モデル
Depth Anything 3(DA3)は、ByteDanceのSeedチームが開発した視覚空間再構築モデルです。単一のTransformerアーキテクチャを用いて、あらゆる視点からの視覚入力から3次元空間形状を復元します。
Depth Anything 3とは何ですか?
Depth Anything 3 (DA3)は、ByteDanceのSeedチームが開発した視覚空間再構築モデルです。単一のTransformerアーキテクチャを採用し、あらゆる視点からの視覚入力から3D空間形状を復元します。このモデルは「深度レイ」表現方式を採用することで、複雑なマルチタスク学習を不要にし、モデル設計を簡素化しています。Depth Anything 3は、カメラ姿勢精度と幾何学的再構築精度において従来の主流モデルを凌駕しつつ、高い推論速度を維持しています。自動運転、ロボットナビゲーション、仮想現実などのアプリケーションに適しており、視覚空間再構築のための新しい効率的なソリューションを提供します。
Depth Anything 3の主な特徴
- マルチビュー空間再構成Depth Anything 3 (DA3) は、単一の画像、複数の視点からの画像、ビデオストリームなど、任意の数の視覚入力から三次元空間構造を再構築することができます。
- カメラ姿勢推定このモデルは、カメラのパラメータを知らなくても、入力画像のカメラ姿勢(位置と向きを含む)を正確に推定できる。
- 単眼深度推定このモデルは単眼深度推定タスクにおいて優れた性能を発揮し、単一の画像からピクセルレベルの深度情報を予測することで、3Dシーン理解のための基礎的なサポートを提供する。
- 新たな視点の統合3Dガウスレンダリング技術と組み合わせることで、このモデルは未知の視点から見た高品質な画像を生成でき、仮想現実や拡張現実における透視投影レンダリングタスクに適している。
- 効率的な推論と展開このモデルのシンプルなアーキテクチャ設計は、推論速度とリソース消費において大きな利点をもたらし、大規模なシナリオを迅速に処理することを可能にし、モバイルデバイスや組み込みデバイスへの展開に適しています。
深さに関する技術的原則 3
- シングルトランスフォーマーアーキテクチャ単一のTransformerモデル(DINOv2など)を基本アーキテクチャとして使用することで、複雑なカスタム設計の必要性を排除しています。Transformerの自己注意機構は、任意の数の入力ビューを柔軟に処理し、ビュー間の情報を動的に交換し、効率的なグローバル空間モデリングを実現します。
- 深度線特性評価本モデルは、深度マップとレイマップを予測することで3D空間を包括的に記述する「深度・レイ」表現手法を提案する。深度マップはピクセルからカメラまでの距離を示し、レイマップは3D空間におけるピクセルの投影方向を示す。この表現手法により、空間形状とカメラの動きが自然に分離され、モデルの出力が簡素化され、精度と効率の両方が向上する。
- 入力適応型クロスビュー自己注意機構本稿では、入力ビューのトークンを動的に再配置することで効率的なビュー間情報交換を実現する、入力適応型クロスビュー自己注意機構を導入する。この機構により、モデルは単眼からマルチビューまで、さまざまな入力シナリオを柔軟に処理できるようになる。
- デュアルDPTヘッド設計深度マップと光線マップを同時に予測するために、DA3はデュアルDPTヘッド構造を採用しています。2つの予測ヘッドは特徴処理モジュールを共有し、最終的な融合段階で深度マップと光線マップの出力をそれぞれ最適化することで、2つのタスク間の相互作用と一貫性を向上させています。
- 教師と生徒のトレーニングパラダイム教師・生徒型のトレーニングパラダイムを採用し、合成データでトレーニングされた教師モデルが高品質の擬似ラベルを生成することで、生徒モデルに対してより正確な指導を提供する。
- ワンステップで高精度な出力を実現この手法は、単一のフィードフォワードで高精度の深度マップとレイマップを生成するため、従来の手法で必要だった複数回の反復最適化が不要になります。この設計により、推論速度が大幅に向上し、トレーニングと展開プロセスが簡素化され、3D再構成における精度と効率の両方が確保されます。
Depth Anything 3のプロジェクトアドレス
- プロジェクト公式サイト:https://depth-anything-3.github.io/
- GitHubリポジトリ:https://github.com/ByteDance-Seed/depth-anything-3
- arXiv技術論文:https://arxiv.org/pdf/2511.10647
- オンラインでデモを体験してください:https://huggingface.co/spaces/depth-anything/depth-anything-3
Depth Anything 3の応用シナリオ
- 自動運転DA3は、車両カメラで撮影されたマルチビュー画像から3D環境を迅速に再構築することができ、自動運転システムが周囲の物体までの距離や位置をより正確に認識するのに役立ち、それによって意思決定の信頼性と安全性を向上させる。
- ロボットナビゲーションDA3は、環境の三次元構造をリアルタイムで再構築することで、ロボットに正確な地形情報や障害物情報を提供し、複雑な環境下での効率的なナビゲーションと経路計画を支援する。
- 仮想現実(VR)と拡張現実(AR)現実世界のシーンを高精度の3Dモデルに迅速に変換し、仮想現実におけるシーンの再構築や拡張現実における仮想オブジェクトの融合に活用することで、ユーザーの没入感を高めることができる。
- 建築測量および設計このシステムは、建築シーンのマルチビュー画像から詳細な3D点群を再構築し、建築測量、インテリアデザイン、仮想建築散策のための効率的なデータサポートを提供します。
- 文化遺産保護DA3は、歴史的建造物や文化遺産の三次元構造を再構築するために使用でき、デジタル保護、修復研究、仮想展示を容易にし、文化遺産の保存と促進に役立ちます。