project
Xiaomi OneVL - XiaomiのEmbodied Intelligenceチームがオープンソース化した、大規模な自動運転モデル。
Xiaomi OneVLは、Xiaomiのエンボディード・インテリジェンス・チームが開発したオープンソースの自動運転モデルです。VLA(視覚・言語・行動)、ワールドモデル、潜在空間推論という3つの主要な技術ルートを単一のフレームワークに統合した、業界初のモデルです。
Xiaomi OneVLとは何ですか?
Xiaomi OneVLは、XiaomiのEmbodied Intelligenceチームが開発したオープンソースの自動運転モデルです。業界初となる、VLA(Vision-Language-Action)と潜在空間推論を用いた世界モデリングという3つの主要な技術アプローチを単一のフレームワークに統合しました。このモデルは、デュアル補助デコーダを使用してコンパクトな潜在変数を監視し、思考が思考しないのと同等の速さで、思考するよりも効果的であるという画期的な成果を達成しています。車両側の推論レイテンシはわずか0.24秒で、NAVSIMを含む4つのベンチマークで最先端(SOTA)のパフォーマンスを実現しています。モデルの重みとコードは、Apache 2.0ライセンスの下で完全にオープンソース化されています。
Xiaomi OneVLの主な機能
- 視覚・言語・運動(VLA)統合推論シーン理解、言語推論、および行動出力の駆動を単一のフレームワークに統合することで、知覚から意思決定、実行まで、ワンステップのエンドツーエンドのクローズドループを実現します。
- 世界モデルによる将来予測内蔵のビジュアルワールドモデルデコーダーは、0.5秒後と1.0秒後のシーンフレームを予測することができ、モデルに道路形状、車両の動き、環境変化の因果関係を内部化させる。
- 潜在的なCoT推論ディープ推論は、コンパクトな潜在変数に対して実行されます。推論中は補助デコーダは破棄されます。すべての潜在変数トークンは、わずか0.24秒のレイテンシで単一の並列処理によって事前に入力されます。これは「直接予測」と同等の速度でありながら、より高い精度を実現します。
- デュアル補助デコーダーの監督付きトレーニングトレーニング段階では、言語デコーダーがテキストの思考連鎖を再構築し、ビジュアルデコーダーが将来のフレームを予測します。二次元監視により、潜在変数が意味論的推論と物理世界の因果法則を同時に符号化することが保証されます。
- 高精度軌道予測Qwen3-VL-4B-Instructバックボーンネットワークをベースに、上部にMLPヘッダー出力トレースを追加することで、NAVSIMベンチマークにおいて88.84のPDMスコアを達成し、8B競合製品を凌駕しています。
Xiaomi OneVLの技術原理
- 3つの主要技術ルートの統合Xiaomi OneVLは、VLA(視覚・言語・行動)、世界モデル、潜在空間推論という3つの独立した技術経路を単一のフレームワークに統合した初のシステムです。これにより、モデルは現在のシーンを理解しながら、物理的な因果法則に基づいて将来の環境変化を予測し、行動を促す出力を生成することが可能になり、知覚と推論から意思決定まで、エンドツーエンドのクローズドループを実現します。
- デュアル補助デコーダ監視アーキテクチャトレーニング段階では、モデルは2つの補助デコーダを導入します。1つは、テキストによる思考連鎖を再構築し、潜在変数が意味推論能力を符号化することを保証する言語デコーダ、もう1つは、将来のフレーム(T+0.5秒、T+1.0秒)を予測し、潜在変数に道路形状や車両の動きなどの物理的ダイナミクスを内在化させる視覚世界モデルデコーダです。推論段階では、両方のデコーダは破棄され、コンパクトな潜在変数のみが予測に使用されます。
- 3段階の漸進的トレーニングトレーニングは、軌跡アライメント、言語推論アライメント、およびビジュアルワールドモデルアライメントの3つの段階に分かれており、潜在変数を軌跡出力、言語推論ターゲット、およびビジュアル予測ターゲットに段階的に整合させていきます。いずれかの段階をスキップすると、パフォーマンスが著しく低下する(最大21.71ポイント)ため、安定したトレーニングには3つの段階を同時に最適化することが不可欠であることが分かります。
- ワンステップ潜在空間並列推論推論フェーズにおけるすべての潜在変数トークンは、単一の並列処理で事前に入力されるため、自己回帰的なトークンごとの生成は不要です。車両側のレイテンシはわずか0.24秒(4.16Hz)で、「直接回答を出力する」速度に匹敵します。その精度は明示的な思考連鎖法を大幅に上回り、パフォーマンスの面で明示的なCoTを凌駕する初の潜在空間推論方式となります。
- 軽量モデルベースバックボーンネットワークにはQwen3-VL-4B-Instructが使用され、軌道予測のためにコンパクトなMLPヘッダーが追加されています。ビジュアルトークナイザーにはEmu3.5-VisionTokenizer(コードブックサイズ131072)が使用されています。4Bパラメータスケールで、NAVSIMベンチマークにおいてPDMスコア88.84を達成し、8Bの競合製品であるAdaThinkDriveおよびLaST-VLAを上回りました。
Xiaomi OneVLの主な利点
- スピードと正確性の両方を実現するXiaomi OneVLは、明示的な思考連鎖を凌駕する精度を持つ、業界初の潜在空間推論手法です。車載推論の遅延時間はわずか0.24秒で、直接予測速度に匹敵する性能を持ちながら、明示的な自己回帰CoTよりも32%高速です。
- 3つの主要技術ルートの統合Xiaomi OneVLは、VLA、ワールドモデル、潜在空間推論という3つの独立した技術的手法を単一のフレームワークに統合した初のモデルであり、シーン理解、物理的因果推論、および将来予測機能を同時に備えることができる。
- 二次元の説明可能な決定Xiaomi OneVLは、意思決定において音声による説明と視覚的な予測の両方を提供します。運転ロジックを言葉で説明し、将来のシナリオを生成画像で表示することで、説明のつかない自動運転の「ブラックボックス」問題を解決します。
- 軽量性と高性能が両立するこのモデルは、4Bパラメータを持つQwen3-VL-4B-Instructバックボーンネットワークをベースとしており、NAVSIMベンチマークで88.84のPDMスコアを達成し、8Bの競合製品を凌駕し、より小さなモデルサイズでより高いパフォーマンスを実現しています。
- 完全オープンソースで商業的に実現可能モデルの重み、トレーニング、推論コードはすべてApache 2.0ライセンスの下で完全にオープンソース化されており、学術機関や産業界による自由な二次開発および商用利用をサポートしています。
- 4つのベンチマークは完全に最先端の技術を採用しています。Xiaomi OneVLは、NAVSIM、ROADWork、Impromptu、Alpamayo-R1という4つの権威あるベンチマークテストにおいて、最先端の性能を達成しました。中でも、Alpamayo-R1はすべてのテスト方法の中で最高のADE(平均有効偏差)を記録しています。
Xiaomi OneVLプロジェクトの住所
- プロジェクト公式サイト:https://xiaomi-embodied-intelligence.github.io/OneVL/
- GitHubリポジトリ:https://github.com/xiaomi-research/onevl
- arXiv技術論文:https://arxiv.org/pdf/2604.18486
Xiaomi OneVLの競合製品比較
| 比較対象寸法 | Xiaomi OneVL | EMMA (Waymo) |
|---|---|---|
| 所属 | シャオミのスマートボディ | Waymo(Google) |
| モデルの位置特定 | エンドツーエンドのVLA + ワールドモデル統合フレームワーク | エンドツーエンドのマルチモーダル汎用IST自律走行モデル |
| 基本モデル | Qwen3-VL-4B-Instruct(4B) | ジェミニ/PaLI-X(大規模、具体的なパラメータは非公開) |
| コアアーキテクチャ | 潜在空間推論+二重補助デコーダ(言語+視覚世界モデル) | プレーンテキストVQAパラダイムでは、すべての入力と出力が自然言語テキストとして表現されます。 |
| 推論方法 | シングルパス並列プリフィル、0.24秒遅延(4.16Hz) | トークンごとに自己回帰的なCoTを生成すると、レイテンシと計算コストが高くなります。 |
| ワールドモデル | 内蔵のビジュアルデコーダーは、次の0.5秒/1.0秒のフレームを予測できます。 | 明確な世界モデルがなければ、未来のシーンを生成する能力が欠けている。 |
| アクション出力 | 連続軌道予測(MLPヘッドからの直接出力) | テキスト形式のBEV座標(ウェイポイント)は、テキストから浮動小数点数への変換が必要です。 |
| 説明可能性 | 言語+視覚的二重次元(テキスト解説+未来シーン予測) | テキストベースのCoT推論チェーン(根拠)+視覚的位置特定(3D/BEV位置アノテーション) |
| マルチタスク機能 | スポーツ計画に焦点を当てる、4つのベンチマーク、SOTA | 共同訓練計画、3D検出、道路地図推定、およびシーン理解のための汎用ISTモデル。 |
| トレーニング方法 | 3段階の段階的整合(軌跡→言語→視覚) | エンドツーエンドの微調整、マルチタスクの共同学習、およびGeminiの事前学習済み世界知識の活用。 |
| センサー入力 | 視覚(カメラ) | ビジョン(カメラ)は、LiDAR/レーダーをサポートしていません。 |
Xiaomi OneVLのアプリケーションシナリオ
-
先進的なインテリジェントドライビングの量産展開これは、従来のCoT推論におけるボトルネック、例えば過剰な遅延やリアルタイム展開の困難さといった問題を解決するものです。
-
複雑な道路状況における意思決定歩行者の意図、車両の車線変更、その他の動的なシナリオを予測し、「ブラックボックス」リスクを回避する。
-
モデル決定可視化これは、自動運転システム向けに、監査可能で解釈可能な言語および画像ベースの意思決定支援機能を提供する。
-
学術研究の二次的発展Apache 2.0ライセンスに基づき、オープンソースコードと、学術および産業利用に対する手厚いサポートを提供します。