project
OpenEMMA - テキサス大学、トロント大学、その他の研究機関との共同開発により生まれた、自動運転のためのオープンソースのエンドツーエンド・マルチモーダルモデル。
OpenEMMAは、テキサスA&M大学、ミシガン大学、トロント大学が共同開発した、自動運転のためのオープンソースのエンドツーエンド・マルチモーダルモデルフレームワークです。事前学習済みの大規模マルチモーダル言語モデル(MLLM)を利用して、視覚データや複雑な運転シナリオを処理します。
OpenEMMAとは何ですか?
OpenEMMAは、テキサスA&M大学、ミシガン大学、トロント大学が共同開発した、自動運転向けのオープンソースのエンドツーエンド・マルチモーダルモデルフレームワークです。事前学習済みの大規模マルチモーダル言語モデル(MLLM)を活用し、複雑な運転シナリオにおける視覚データの処理と推論を行います。このフレームワークは、連鎖的な推論プロセスを採用することで、軌道計画や知覚タスクにおけるモデル性能を大幅に向上させています。また、3Dバウンディングボックス予測の精度を高めるために、特別に最適化されたYOLOモデルも統合しています。OpenEMMAは、より広範な研究開発を促進し、自動運転技術の進歩を推進するプラットフォームを提供します。
OpenEMMAの主な機能
- エンドツーエンドの軌道計画センサー入力から直接運転動作を学習し、記号的なインターフェースを必要とせずに、知覚から意思決定までのエンドツーエンドの最適化を実現する。
- マルチモーダルデータ処理このフレームワークは、前方カメラの画像とテキスト履歴、および車両の状態を入力として処理し、運転タスクを視覚的な質問応答(VQA)問題として捉えます。
- 連鎖思考推論このモデルは、連鎖思考に基づく推論プロセスを用いて、主要な対象物に関する詳細な記述、行動に関する洞察、およびメタ的な意思決定を生成するようモデルを導きます。
- 3D物体検出OpenEMMAは、統合され高度に調整されたYOLOモデルにより、3D道路上の物体を正確に検出することができ、物体検出の精度を向上させます。
- 人間が読める出力OpenEMMAは、MLLMの既存の世界知識に基づいて、シーン理解などの知覚タスク向けに、解釈可能で人間が読みやすい出力を生成することができる。
OpenEMMAの技術原則
- 事前学習済みMLLM事前学習済みのMLLM(機械学習モデル)に基づいて、複雑な視覚データを処理し、運転シナリオを推論する。
- 連鎖的な推論プロセス連鎖的な推論に基づいて、このモデルは速度ベクトルと曲率ベクトルを生成することができ、これらは車両の将来の軌道を計算するために使用されます。
- 速度ベクトルと曲率ベクトル速度ベクトルと曲率ベクトルが与えられると、このモデルはまず各時間ステップにおける進行方向角を積分し、次に速度のx成分とy成分を計算し、最後に積分された速度成分を用いて最終的な軌跡を計算します。
- 物体検出機能の強化空間推論におけるMLLMの限界を克服するため、3Dバウンディングボックス予測に特化して最適化されたYOLOモデルを統合した。
- エンドツーエンドの計画と推論OpenEMMAは指示ベースのアプローチを採用しており、MLLM(マルチレベル学習モデル)が、軌道生成タスクを運転プロセスを反映した人間が解釈可能なコンポーネントに分解することで、人間が解釈可能な知識を生成するように促します。
OpenEMMAプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/taco-group/OpenEMMA
- arXiv技術論文:https://arxiv.org/pdf/2412.15208
OpenEMMAの応用シナリオ
- 市街地走行複雑な都市交通環境において、変化する信号機、歩行者、自転車、その他の車両に対応し、自動運転車のためのリアルタイムの意思決定と経路計画を提供する。
- 高速道路での運転高速道路においては、車線維持、追い越し、障害物回避など、高速走行車両の操縦に関する意思決定支援を提供する。
- 駐車と低速走行駐車場や低速走行環境において、自動運転車が正確な駐車操作を行い、障害物を回避し、狭い空間を走行するのに役立つ。
- 夜間運転OpenEMMAは低照度環境下でも動作可能で、物体検出や走行経路計画など、夜間運転のための意思決定支援機能を提供する。
- 複雑な気象状況雨や霧などの複雑な気象条件下では、自動運転車が安全運転を維持するのを支援し、天候が運転に与える影響を軽減します。