project
MiMo-Embodied - Xiaomiのクロスドメイン統合型大型モデル
MiMo-Embodiedは、Xiaomi初のオープンソースのクロスドメイン身体モデルであり、自動運転と身体知能の両方のタスクを統合し、環境認識、タスク計画、空間理解など、多くの面で優れた性能を実現しています。
MiMo-Embodiedとは何ですか?
MiMo-Embodiedは、Xiaomiがリリースした世界初のオープンソースのクロスドメイン・エンボディードモデルです。自動運転とエンボディードインテリジェンスの両方のタスクを統合し、環境認識、タスクプランニング、空間理解において優れたパフォーマンスを実現します。ビジュアル言語モデル(VLM)アーキテクチャに基づき、エンボディードインテリジェンスによる教師ありファインチューニング、自動運転による教師ありファインチューニング、連鎖推論ファインチューニング、強化学習ファインチューニングの4段階のトレーニング戦略を採用することで、クロスドメイン汎化能力を大幅に向上させています。自動運転領域では、MiMo-Embodiedは交通シーンを正確に認識し、動的なターゲットの挙動を予測し、安全かつ効率的な運転計画を生成できます。エンボディードインテリジェンス領域では、自然言語による指示を理解し、複雑なタスクプランニングと空間推論を実行できます。MiMo-Embodiedは、複数のベンチマークテストにおいて既存のオープンソースモデルや専用モデルを凌駕し、強力なマルチモーダルインタラクション能力を実証しています。
MiMo-Embodiedの主な機能
-
ドメイン間統合機能MiMo-Embodiedは、環境認識、タスク計画、空間理解といった中核的な機能を網羅し、自動運転と身体化された知能タスクを統合することに成功した初のモデルであり、複雑で動的な環境におけるマルチモーダルなインタラクションに適しています。
-
環境認識自動運転のシナリオにおいて、このモデルは交通状況を正確に理解することができ、交通標識、車両、歩行者などの主要な要素を識別し、それらの動的な挙動を予測することで、安全運転を支援する。
-
タスクの計画と実行身体化された知能の分野において、MiMo-Embodiedは自然言語による指示に基づいて実行可能な動作シーケンスを生成し、ロボットのナビゲーションや操作といった複雑なタスク計画を完了することができる。
-
空間認識と推論このモデルは強力な空間推論能力を備えており、物体間の空間的な関係を理解し、ナビゲーション、インタラクション、シーン理解などのタスクを支援することができます。ロボット操作や自律走行における経路計画に適しています。
-
マルチモーダルな相互作用MiMo-Embodiedは、視覚と言語の高度な融合を通じて、画像、動画、テキストの入力を処理し、視覚的な質問応答、指示の遵守、場面描写といったマルチモーダルなタスクをサポートする。
-
強化学習の最適化強化学習を用いて微調整を行うことで、複雑なシナリオにおけるモデルの意思決定能力とタスク実行の信頼性が向上し、実環境における効率的な展開が保証される。
-
オープンソースと普遍性MiMo-Embodiedは完全なオープンソースであり、そのコードとモデルはHugging Faceで公開されています。研究者や開発者に、身体化された知能と自動運転の分野におけるイノベーションを推進するための強力なツールを提供します。
MiMo-Embodiedの技術原理
-
クロスドメイン統合アーキテクチャMiMo-Embodiedは、統一された視覚言語モデル(VLM)アーキテクチャを採用し、自動運転と身体化知能のタスクを単一のモデルに統合しています。視覚エンコーダ、プロジェクター、および大規模言語モデル(LLM)を通じて、視覚入力とテキスト理解の高度な融合を実現しています。
-
多段階トレーニング戦略このモデルは、身体化された知能の教師ありファインチューニング、自動運転の教師ありファインチューニング、連鎖推論のファインチューニング、強化学習のファインチューニングという4段階のトレーニングを通じて性能を向上させ、さまざまなタスクやシナリオにおける汎化能力を確保します。
-
視覚入力処理Vision Transformer (ViT) は、単一画像、複数画像、および動画をエンコードし、視覚的特徴を抽出し、多層パーセプトロン (MLP) を介して LLM に整合した潜在空間にマッピングすることで、視覚と言語のシームレスな統合を実現します。
-
データ駆動型クロスドメイン学習本研究は、一般的な視覚言語理解、身体化された知能、および自動運転シナリオを網羅する多様なデータセットを構築し、モデルに豊富なマルチモーダルな監視信号を提供するとともに、基本的な知覚から複雑な推論までの学習をサポートする。
-
強化学習の最適化トレーニングの最終段階では、グループ相対ポリシー最適化(GRPO)アルゴリズムを使用して強化学習の微調整を行い、複雑なタスクやエッジシナリオにおけるモデルの意思決定の質と信頼性を最適化します。
-
推論と出力生成LLMの推論能力を活用することで、視覚入力と言語コマンドを組み合わせ、タスク関連の応答や意思決定を生成し、自動運転における経路計画や、身体化された知能におけるタスク実行を支援する。
MiMo-Embodiedプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/XiaomiMiMo/MiMo-Embodied
- ハギングフェイスモデルライブラリ:https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B
- arXiv技術論文:https://arxiv.org/pdf/2511.16518
MiMo-Embodiedの応用シナリオ
-
自動運転MiMo-Embodiedは、複雑な交通状況に対応し、環境認識、状態予測、運転計画を実行できるため、都市部の道路や高速道路など、さまざまな自動運転シナリオに適しており、インテリジェント運転システムのための意思決定支援を提供します。
-
ロボットのナビゲーションと操作身体化された知能の分野では、モデルは自然言語による指示に基づいて屋内ナビゲーションや物体操作などのタスクを実行でき、家庭や産業などの環境におけるロボットの自律的な動作を支援する。
-
視覚的な質問応答と対話視覚的質問応答(VQA)タスクに適しており、画像や動画コンテンツを理解し、関連する質問に答えることができ、人間とコンピュータのインタラクションにおける情報検索と解釈をサポートします。
-
場面の理解と描写このモデルは、意味理解を実行し、複雑なシーンの説明を生成することができ、セキュリティ監視や高度道路交通システムなどの分野におけるシーン分析に適している。
-
マルチモーダルタスク実行画像、動画、テキストなどのマルチモーダル入力に対応し、指示の追跡や画像への注釈付けといったクロスモーダルなタスクも処理できるため、インテリジェントアシスタントや自動化システムに適しています。
-
複雑な環境におけるタスク計画複雑な環境において、MiMo-Embodiedは指示に基づいて複数ステップのタスクプランを生成することができ、ロボットが清掃や調理といった複雑な作業を完了することを可能にする。