project
Xiaomiオートワールドモデル - Xiaomiの運転支援ワールドモデル
Xiaomi Auto World Modelは、Xiaomi Autoが発表した運転支援ワールドモデルであり、3D再構築(WorldRec)とビデオ生成(WorldGen)を深く連携させた初のモデルです。
Xiaomi Auto Worldモデルとは何ですか?
Xiaomi Auto World Modelは、Xiaomi Autoが開発した運転支援ワールドモデルで、3D再構成(WorldRec)とビデオ生成(WorldGen)を初めて深く連携させたものです。WorldRecは疎な3Dアンカーポイントを使用して10秒で10秒のビデオを高速に再構成し、WorldGenは2段階のトレーニングとODE蒸留により4段階のノイズ除去と0.19秒/フレームの生成を実現し、最大1分間のビデオをサポートします。Waymo再構成精度(PSNR 28.48)とnuScenes生成品質(FVD 64.97)において最先端(SOTA)の結果を達成しており、合成データ、シミュレーションテスト、運転支援トレーニングという3つの主要なビジネスシナリオで展開されています。
Xiaomi Auto World Modelの主な機能
-
WorldRec 3D再構築モジュール従来の密なガウス分布ではなく、疎な3Dクエリアンカーを採用することで、複数の視点と時間からの特徴集約と可視性加重融合を実現します。10秒の動画をわずか10秒で再構築できるため、マルチビューの競合やゴースト現象の問題を解消できます。
-
WorldGenビデオ生成モジュール双方向時間的注意の事前学習と因果的微調整という2段階の学習モデルに基づき、ODE蒸留によってノイズ除去ステップ数を50ステップから4ステップに圧縮しました。将来のフレーム、未観測の視点、および遮蔽領域の内容は0.19秒/フレームで生成され、最大フレーム数(約1分)を連続的に生成できます。
-
再構成生成深結合再構成側は安定性を生成するために3次元幾何学的事前制約を提供し、生成側は再構成境界を未観測の時空間領域まで拡張する。両者は相互に補正し合い、長期的な時系列ドリフトを抑制する。
-
極端なシーン生成豪雨、大雪、濃霧などの極端な気象条件や、動物の侵入などの長期にわたる危険なシナリオの高品質な合成をサポートし、知覚モデルのトレーニングに必要な希少なデータを提供します。
-
3つの主要事業が立ち上げられた合成データ生成(10万本以上のクリップを提供)、クローズドループシミュレーションテスト(実際の事故を再現し、それに応じて最適化)、および運転支援トレーニング(一人称視点の運転指導ビデオを動的に生成)。
Xiaomi Auto World Modelの技術原理
-
WorldRecスパースアンカーポイント表現ピクセル単位の予測を行うガウス分布のパラダイムを用いる代わりに、疎な3Dクエリポイントをシーン表現として使用します。各アンカーポイントは、複数のカメラと時間点からの特徴を積極的に集約し、視認性重み付けによって信頼性の高い観測値が自動的にフィルタリングされるため、ソースからの視点間の一貫性が確保されます。
-
4次元ガウス型グローバル表現観測の増分に応じて拡大する4Dガウスシーン表現を維持し、それを車両の視点に投影してレンダリングの事前入力として使用し、モデルを生成するための決定論的な幾何学的制約を提供する。
-
ワールドジェン二段階トレーニング第1段階では、双方向時間的注意の事前学習を行い、運転シナリオの時間的・空間的な全体像を把握します。第2段階では、因果的注意と教師強制を微調整し、ODE蒸留法と組み合わせることで処理速度を12倍に向上させ、分布マッチング蒸留法を用いて露出バイアスを解消します。
-
閉ループ制約の再構築・生成再構成における決定論的な幾何学的事前分布は、再構成でカバーされていない時空間領域を埋めるために、継続的に修正および生成されます。両者の目的関数は、高い安定性、高い一貫性、および高い現実性を実現するために、構造的に相互に制約されています。
Xiaomi Auto Worldモデルの使い方
-
オンラインプラットフォーム「運転支援アカデミー - リアルなシミュレーションシナリオ」が、すべてのXiaomi車両モデル向けにリリースされました。
-
利用条件Xiaomi製の自動車(SU7モデルなど)を所有し、車載システム内の「運転支援スクール」モジュールにアクセスする必要があります。
Xiaomi Auto Worldモデルの主な利点
-
最先端性能Waymoの再構成PSNRは28.48(DGGTより約1ポイント高い)で、nuScenesのゼロショット汎化PSNRも26.54とトップでした。生成FVDは64.97で、双方向および自己回帰ベースラインモデルすべてを上回りました。
-
スピード推論単一ビュー生成時間は0.19秒/フレーム、3ビュー生成時間は0.46秒/フレームであり、同様の自己回帰手法であるEpona(1.06秒/フレーム)よりも5.6倍高速です。
-
超長時間81フレーム(10Hz/30Hz、最大1分間)の連続生成をサポートしており、公開されているベースラインモデルの8~16フレームという制限をはるかに超えています。
-
ゼロショット一般化nuScenesはゼロショットテストにおいて引き続きトップの座を維持しており、新たなシナリオへの高い適応性を実証している。
-
生産が開始されました。同社は、合成データ、シミュレーションテスト、シャオミ車向けスマートコックピットという3つの主要シナリオにおいて、ビジネスサイクルを完了させた。
Xiaomi Auto World モデルプロジェクトの住所
- プロジェクト公式サイト:https://JointWM.github.io/
- arXiv技術論文:https://arxiv.org/pdf/2605.18137
Xiaomi Auto Worldの類似製品との比較
| 比較対象寸法 | Xiaomi Auto World Model | Waymo World Model |
|---|---|---|
| 会社 | Xiaomi Auto | Waymo(Alphabet/Google) |
| リリース時間 | 2026年5月 | 2026年2月 |
| テクニカルルート | 再構築+生成の高度に結合した統合アーキテクチャ(WorldRecとWorldGenは相互に制約関係にある) | Genie 3に基づく生成世界モデル(純粋に生成されたルートを、運転シナリオに合わせて学習させたもの) |
| 再構築モジュール | WorldRec:疎な3Dアンカーポイント表現、10秒で10秒間のビデオ再構成、PSNR 28.48(Waymoデータセット) | 独立した再構築モジュールは存在せず、シーン全体はGenie 3の事前学習済み世界知識に基づいて生成されます。 |
| モジュールを生成する | WorldGen:4段階のノイズ低減、0.19秒/フレーム、81フレーム(約1分)の連続生成をサポート。 | Genie 3をベースとした世代で、マルチセンサー出力(カメラ+LiDAR)をサポートし、極限状況のシミュレーションが可能です。 |
| 建築的特徴 | 再構築は生成の基礎(幾何学的制約)を築き、生成は再構築の範囲を拡大する(観測されていない領域を補完する)。 | 純粋に生成的な手法であり、言語、動作、シーンレイアウトという3つの制御メカニズムを通してシミュレーションを調整する。 |
| センサーサポート | 主にカメラデータ(複数視点画像入力)向けに設計されています。 | カメラ+LiDARマルチセンサー出力通常のドライブレコーダーの映像を、複数のセンサーによるアナログデータに変換できます。 |
| ベンチマーク | Waymo PSNR 28.48(DGGTより約1ポイント高い)、nuScenes FVD 64.97、FID 7.04 | 具体的な定量的指標は明らかにされなかったが、これまで前例のないロングテールシナリオをシミュレートできる能力が強調された。 |
| 生成速度 | シングルビュー:0.19秒/フレーム、スリービュー:0.46秒/フレーム | 具体的な推論速度は明らかにされなかったが、「スケーラブルな推論」と効率的なバリエーションに重点が置かれた。 |
| 最大発電時間 | 81フレーム(10Hz/30Hz、最大約1分)。 | 明示的に述べられてはいないが、Genie 3は分単位での一貫したデータ生成をネイティブにサポートしている。 |
| 極限状況への対応能力 | 大雨、大雪、濃霧、動物の侵入などのロングテールシーンの生成 | 竜巻、洪水、雪に覆われたゴールデンゲートブリッジ、象やライオンなどの珍しい動物、無謀な運転手など。 |
| ビジネス実装 | 3つの主要なシナリオが実施されました。合成データ(10万件以上のクリップ)、シミュレーションテスト、および運転支援トレーニング。 | Waymoドライバーのトレーニングと検証に使用され、ロボタクシーの拡大(2026年までに週100万件の注文を目標とする)を支援する。 |
Xiaomi Auto Worldモデルの応用シナリオ
-
合成データ生成これにより、運転支援知覚モデルのトレーニング用に、高品質で多様性に富み、かつリスクの高いロングテールシーン合成データが提供され、実世界のシーンサンプルが不足しているという問題に対処します。
-
シミュレーションテスト実際の事故シナリオを再現する閉ループシミュレーション環境を構築し、的を絞った最適化を行い、テストの効率と網羅性を向上させ、実車テストのコストとリスクを削減する。
-
運転補助サービスこのシステムは、インテリジェントコックピット内で一人称視点の運転指導ビデオを動的に生成し、複雑な道路状況下での正しい操作方法をユーザーに実演することで、人間と機械の協働運転における安全性とユーザーエクスペリエンスを向上させる。