AB
AiBoss
project

MindVLA-o1 - Li Autoの次世代自動運転基盤モデル

MindVLA-o1は、Li Autoが発表した次世代自動運転の基本モデルです。独自のマルチモーダルMoEアーキテクチャを採用し、視覚、言語、行動の3つのモダリティを統合しています。

MindVLA-o1とは何ですか?

MindVLA-o1は、Li Autoが開発した次世代自動運転基盤モデルであり、視覚、言語、行動の各モダリティを統合した独自のマルチモーダルMoEアーキテクチャを採用しています。このモデルは、3D ViTエンコーダーによる空間認識、暗黙的世界モデルを用いた未来予測、そして統一された行動生成メカニズムによる走行軌跡出力を実現しています。閉ループ強化学習とハードウェアおよびソフトウェアの協調設計を組み合わせることで、MindVLA-o1はより遠くまで見通せ、より深く思考し、より安定した運転が可能となり、汎用的な具現化されたインテリジェントエージェントへの自動運転の進化における重要な一歩となります。

MindVLA-o1の主な機能

  • 3D空間認識MindVLA-o1は、3D ViTエンコーダとフィードフォワード3DGS表現によって3D空間認識を実現し、シーン内の静的な環境と動的な物体を正確に理解します。
  • マルチモーダルな思考と推論このモデルは、潜在空間における将来のシナリオの進化を外挿するための予測的な潜在世界モデルを導入し、視覚的理解と言語推論の深い統合を実現する。
  • 統合動作生成本システムは、VLA-MoEアーキテクチャと並列復号機構を採用し、動的制約に適合し、リアルタイム要件を満たす高精度な走行軌道を生成する。
  • 閉ループ自己進化フィードフォワード型シーン再構築と強化学習のフレームワークに基づき、このモデルはシミュレーション環境内で継続的に進化し、実データ規模の限界を克服する。
  • 高効率なエッジ展開ハードウェアとソフトウェアの協調設計の原理を用いた最適化により、本システムは車両搭載型エッジチップへの効率的な展開を実現し、モデル精度と推論効率のバランスを取っている。

MindVLA-o1の技術原理

  • 3D自己教師あり視覚コーディングこのモデルは、LiDAR点群を幾何学的情報として使用する視覚中心の3D ViTエンコーダを採用し、フィードフォワード3DGS表現を導入することで、静的環境と動的オブジェクトをそれぞれモデル化します。自己教師あり学習は次フレーム予測タスクを通じて行われ、モデルは意味理解と3D知覚の両方の能力を備えることができます。
  • 予測型隠れ世界モデル将来の画像を直接生成する際の高い計算コストを回避するため、このモデルはコンパクトな潜在空間で効率的な予測を行います。3段階の学習を通して、将来のシーンの潜在空間表現と推論能力を構築し、現在を理解し、未来を想像し、論理的な判断を下すという一連のプロセスを統合的に実現します。
  • 統合動作生成VLA-MoEアーキテクチャにおいて、アクションエキスパートは特に走行軌道生成を処理するように設計されています。リアルタイム要件を満たすため、並列デコードを使用してすべての軌道点を一度に出力します。また、離散拡散を用いて複数回の反復最適化を行い、軌道空間が連続的であり、動的制約を満たすことを保証します。
  • 閉ループ強化学習従来の漸進的最適化による再構成手法をフィードフォワード型シーン再構成にアップグレードし、生成モデルと組み合わせることでシミュレーション機能を拡張するとともに、統一された3DGSレンダリングエンジンと分散型トレーニングフレームワークを活用することで、低コストかつ高効率な強化学習のクローズドループを実現する。
  • ハードウェアとソフトウェアの共同設計ハードウェア制約を特徴付けるRooflineモデルに基づき、精度とレイテンシに関してパレート最適解を見つけるため、約2,000種類のアーキテクチャ構成を評価しました。その結果、エッジ環境においては、より幅広く浅いモデルアーキテクチャの方が効率的であり、アーキテクチャ探索サイクルを数ヶ月から数日に短縮できることが分かりました。

MindVLA-o1の主要情報と使用要件

  • 位置Li Autoの次世代自動運転基盤モデルは、身体化された知能を目指した、ネイティブなマルチモーダルVLAアーキテクチャである。
  • リリース時間2026年3月17日、NVIDIA GTC 2026において、台座モデルを担当したZhan Kun氏によって正式に発表された。
  • 5つの主要な技術革新3D空間認識、マルチモーダル思考、統一的な行動生成、閉ループ強化学習、およびハードウェア/ソフトウェアの協調設計。
  • 技術の進化エンドツーエンドからVLA、そしてネイティブマルチモーダルへと進化する過程は、物理AI時代の幕開けを象徴している。
  • アプリケーション拡張機能同じVLAモデルで車両やロボットを制御できます。自動運転は、物理AIの出発点に過ぎません。
  • データレベルこのシステムは、MindDataの統合型VLAデータエンジンを利用して、大規模な運転データを継続的に収集、クリーニング、および自動的にラベル付けします。
  • コンピューティング能力レベル大規模な閉ループトレーニングをサポートするためには、MindSimの制御可能なマルチモーダル世界モデルとRL Infra強化学習インフラストラクチャの使用が必要となる。
  • ハードウェアレベルNVIDIA Drive OrinまたはThorプラットフォームをベースとしたデプロイメントでは、モデルの精度と推論レイテンシのバランスを取るために、Paretoの最適な構成が必要となります。
  • シミュレーションレベル統合された3DGSレンダリングエンジンと分散型トレーニングフレームワークを活用することで、低コストかつ高効率な強化学習の反復処理を実現します。

MindVLA-o1の主な利点

  • ネイティブなマルチモーダル統合アーキテクチャMindVLA-o1は、視覚、言語、行動の各様式を同一のフレームワークに統合し、後処理なしで共同トレーニングと連携を行うことで、より高い効率性と優れた汎化能力を実現します。
  • 3D空間奥行き理解3D ViTエンコーダとフィードフォワード3DGS表現を用いることで、このモデルは意味理解と3D知覚の両方の能力を備え、従来のBEV平面シーン撮影や過度に密なOCCの限界を克服する。
  • 隠れた空間の効率的な推論予測型潜在世界モデルは、コンパクトな潜在空間で未来を「想像」することで、画像を直接生成する際の高い計算コストを回避し、現在を理解することと未来を予測することの統一性を実現します。
  • リアルタイムで正確な意思決定を行うVLA-MoEアーキテクチャは、アクションエキスパート、並列復号、および離散拡散最適化を組み合わせることで、軌道生成精度とリアルタイム要件のバランスを取っています。
  • エッジにおける効率的な展開ハードウェアとソフトウェアの協調設計の原則により、アーキテクチャの探索サイクルが数ヶ月から数日に短縮され、車載チップにおける精度とレイテンシの最適なバランスを見出すことができる。

MindVLA-o1と類似の競合製品との比較

比較対象寸法 MindVLA-o1 テスラFSD ファーウェイ広告
アーキテクチャロードマップ ネイティブマルチモーダルVLA統合アーキテクチャ エンドツーエンドの純粋なビジョン エンドツーエンド+マルチセンサー融合
知覚スキーム LiDARによる幾何学的特徴を活用した視覚中心のアプローチ 純粋な視覚 マルチセンサー融合
推論能力 隠された世界モデルが未来を予測する エンドツーエンドの暗黙的推論 ルール+AIハイブリッド
行動生成 MoE+並列デコーディング+離散拡散 エンドツーエンドの直接出力 分割意思決定
シミュレーション訓練 フィードフォワード再構成+強化学習 シャドウモード+シミュレーション データ閉ループを主な焦点とする
展開の最適化 ハードウェア・ソフトウェア協調設計法則 自社開発チップ Dojo/HW4.0 Ascendチップの最適化
アプリケーション拡張機能 車両+ロボット汎用VLA 自動運転に焦点を当てる 自動運転に焦点を当てる
技術段階 物理AI/身体化された知能 AIベースのエンドツーエンド AIベースのエンドツーエンド

MindVLA-o1の応用シナリオ

  • 自動運転MindVLA-o1は、次世代の自動運転基盤モデルとして、都市部の道路、高速道路、複雑な交差点など、あらゆるシナリオにおける運転タスクに対応でき、知覚・理解から意思決定・計画に至るまで、エンドツーエンドのインテリジェンスを実現します。
  • インテリジェントなコックピット操作ネイティブのマルチモーダルアーキテクチャの言語理解機能を活用することで、システムは乗客の音声コマンドを理解し、視覚認識と組み合わせることで、自然な人間とコンピュータのインタラクションとプロアクティブなサービスを実現します。
  • ロボット制御同じVLAモデルは、ロボットプラットフォームに拡張することができ、ロボットアームや車輪型ロボットなど、さまざまな形態の具現化されたインテリジェントエージェントを駆動して、物理世界のタスクを完了させることができる。
  • シミュレーションテスト検証MindSimワールドモデルを使用して高精細な仮想シーンを生成し、異常気象や稀な事故といったロングテールシナリオにおける大規模なクローズドループテストやモデル反復をサポートします。
  • インテリジェント交通管理3D空間認識および予測能力に基づいて、車両と道路の連携や交通流予測といった都市レベルの高度道路交通システムへと拡張することができる。