project
EMMA - Waymoのエンドツーエンドのマルチモーダル自動運転モデル
EMMAは、GeminiモデルをベースとしたWaymoのエンドツーエンドのマルチモーダル自動運転モデルです。生のカメラセンサーデータを、計画された軌道、認識された物体、道路地図要素などの運転固有の出力に直接マッピングします。EMMAは、従来とは異なる...
EMMAとは何ですか?
WaymoのGeminiモデルをベースとしたエンドツーエンドのマルチモーダル自動運転モデルEMMAは、生のカメラセンサーデータを、計画された軌道、認識された物体、道路地図要素などの運転固有の出力に直接マッピングします。EMMAは、センサー以外の入力と出力を自然言語テキストとして表現し、事前学習済みの大規模言語モデルの知識を活用して、統一された言語空間で複数の運転タスクを共同処理します。EMMAはnuScenesモーションプランニングとWaymoオープンデータセットで最先端のパフォーマンスを発揮しますが、処理される画像フレーム数の制限、高精度3Dセンシング手法の統合の欠如、高い計算コストなどの制約があります。このモデルは、自動運転モデルアーキテクチャの開発を促進し、複雑なシナリオにおける自動運転システムの汎化能力と推論能力を向上させることができます。
EMMAの主な機能
- エンドツーエンドの動作計画:
- 自動運転車の将来の軌道は、カメラセンサーの生データから直接生成される。
- 軌道は、加速や操舵といった車両固有の制御動作に変換される。
- 3D物体検出このシステムは、主要なセンサーとしてカメラを使用し、車両、歩行者、自転車などの周囲の物体を検知・識別します。
- 道路地図要素の認識車線や交通標識などの主要な道路要素を含む道路地図を特定し、作成する。
- シーンの理解一時的な道路封鎖や運転に影響を与えるその他の状況など、シナリオ全体の状況を理解する。
- マルチタスクこれにより、統一された言語空間内で複数の運転タスクを共同処理し、タスク固有のプロンプトを使用して出力を生成することが可能になります。
- 連鎖思考推論:に基づく連鎖推論はモデルの意思決定能力と解釈可能性を高め、将来の軌道を予測する際に、意思決定の根拠を説明することを可能にする。
EMMAの技術原則
- マルチモーダル大規模言語モデル(MLLM)Geminiなどの事前学習済みMLLMは、インターネット規模の幅広いデータで学習されたモデルであり、豊富な「世界知識」を備えています。
- 自然言語表現センサー以外のすべての入力および出力(ナビゲーションコマンド、車両の状態、軌跡、3D位置など)は、自然言語テキストとして表現されます。
- 視覚的質問応答(VQA)運転タスクは、Geminiの事前学習機能に基づき、幅広い世界知識を保持したVQA問題として再考される。
- 自己回帰モデル自己回帰型ジェミニモデルは、交互に入力されたテキストと画像を処理し、テキスト出力を生成するために使用されます。
- エンドツーエンドのトレーニングエンドツーエンドのトレーニングに基づいて、運転動作はセンサーデータから直接生成されるため、モジュール間の記号的なインターフェースは不要になります。
エマのプロジェクト住所
- arXiv技術論文:https://arxiv.org/pdf/2410.23262
EMMAの応用シナリオ
- 市街地および郊外での運転EMMAは、複雑な都市交通環境や郊外の道路状況に対応でき、リアルタイムの運転判断と走行経路計画を提供します。
- 交通渋滞と複雑な交差点交通渋滞や複数の交差点がある状況において、EMMAは効果的な経路計画と意思決定を行い、安全かつ効率的なナビゲーションを確保することができます。
- 特別な気象条件と照明条件EMMAは、雨、霧、夜間走行など、さまざまな天候や照明条件に適応し、安定した走行性能を維持できます。
- 工事区域および仮設道路は閉鎖されています。EMMAは、そのシーン認識能力に基づいて、工事区域や一時的な道路閉鎖箇所を特定し、それに応じて運転を調整することができる。
- 緊急対応突然の障害物や動物などの緊急事態が発生した場合、EMMAは迅速に反応し、回避や減速などの措置を講じることができます。