project
HoloDrive - SenseTimeが上海AIラボおよびその他の機関と共同で開発した、2D-3Dマルチモーダルな街並み生成フレームワーク。
HoloDriveは、SenseTimeや上海人工知能研究所などが提案した、自動運転向けの包括的な2D-3Dマルチモーダル街路シーン生成フレームワークです。このフレームワークは、カメラ画像とLiDAR点群を統合的に生成することで、自動運転における2Dシーン生成のギャップを埋めます。
HoloDriveとは何ですか?
HoloDriveは、SenseTimeや上海人工知能研究所などが提案した、自動運転向けの包括的な2D-3Dマルチモーダル街路シーン生成フレームワークです。このフレームワークは、カメラ画像とLiDAR点群を共同で生成し、自動運転における2D-3Dマルチモーダル共同生成のギャップを埋めます。HoloDriveは、異種生成モデル間でBEV-to-CameraおよびCamera-to-BEV変換モジュールを採用し、2D生成モデルに深度予測ブランチを導入することで、画像空間からBEV空間への投影の曖昧さを解消します。
HoloDriveの主な機能
- カメラ画像とLiDAR点群を同時に生成するHoloDriveは、マルチビューカメラ画像とLiDAR点群を同時に生成することができ、自動運転における2D-3Dマルチモーダル統合生成のギャップを埋める。
- クロスモーダル構造HoloDriveは、BEV-to-CameraおよびCamera-to-BEV変換モジュール、ならびに2D生成モデルにおける深度予測ブランチを通じて、2D空間と3D空間間の効率的な位置合わせと情報交換を実現し、モデル全体のエンドツーエンドのトレーニングを可能にします。
- 時間構成と段階的なトレーニングHoloDriveはこの手法を拡張し、時間構造と綿密に設計された段階的なトレーニングを取り入れることで未来予測を可能にし、単一フレーム生成とビデオ生成の両方のタスクに適したものにしています。
- 高性能発電NuScenesデータセットを用いた実験結果によると、HoloDriveはマルチビューカメラ画像とLiDAR点群の単一フレームおよび連続データ生成において最先端の性能を達成し、既存の最先端手法(SOTA)を大幅に上回っていることが示されています。
HoloDriveの技術原理
- BEVからカメラへの変換モジュールとカメラからBEVへの変換モジュール: 異種生成モデル間でBEV-to-CameraおよびCamera-to-BEV変換モジュールを使用して、3D空間と2D空間を整合させます。
- 深層予測ブランチ2D生成モデルに深度予測ブランチを導入し、3D LiDARから自然な教師信号を導出することで、画像空間からBEV空間への投影の曖昧さを解消する。
- 時間構造HoloDriveは時間構造を取り入れることで、この手法を未来予測へと拡張し、単一フレーム生成とビデオ生成の両方のタスクに適したものにしている。
- 段階的なトレーニング段階的なトレーニング戦略に基づき、ビデオ領域における追加的なマルチタスク学習を組み合わせることで、トレーニング段階におけるスムーズな移行が実現される。
HoloDriveプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2412.01407
HoloDriveのアプリケーションシナリオ
- リアルな街並みを生成するHoloDriveは、マルチビューカメラ画像とLiDAR点群を共同で生成することで、リアルな街並みを作り出すことができ、現実世界を手作業でモデリングするコストを削減します。
- 2D-3Dジョイント生成HoloDriveは、BEV-to-CameraおよびCamera-to-BEV変換モジュール、ならびに2D生成モデルにおける深度予測ブランチを通じて、2D空間と3D空間間の効率的な位置合わせと情報交換を実現します。
- 時間構成と段階的なトレーニングHoloDriveはこの手法を拡張し、時間構造と綿密に設計された段階的なトレーニングを取り入れることで、未来を予測することを可能にする。