AB
AiBoss
project

Xiaomi-Robotics-0 - XiaomiのオープンソースVLAロボットモデル

Xiaomi-Robotics-0は、Xiaomi初のオープンソースVLA(視覚・言語・動作)大型ロボットモデルで、47億個のパラメータを誇ります。MoTハイブリッドアーキテクチャを採用しており、Qwen3-VLマルチモーダルモデルが「頭脳」として機能し、視覚および言語コマンドを理解します。

Xiaomi-Robotics-0とは何ですか?

Xiaomi-Robotics-0は、Xiaomi初のオープンソースVLA(Vision-Language-Motion)大型ロボットモデルで、47億個のパラメータを誇ります。MoTハイブリッドアーキテクチャを採用しており、Qwen3-VLマルチモーダルモデルが「脳」として視覚および言語コマンドを理解し、拡散トランスフォーマーが「小脳」として高周波アクションブロックを生成します。非同期実行とΛ形状アテンションマスクを革新的に導入することで、推論遅延によるモーションの途切れを解消し、一般消費者向けグラフィックカード上でリアルタイムかつスムーズな制御を実現しています。LIBEROやCALVINなどのシミュレーションベンチマークで最先端(SOTA)記録を樹立し、ブロック分解やタオル折り畳みといった実世界のデュアルアーム操作タスクに既に成功裏に適用されています。

Xiaomi-Robotics-0の主な機能

  • 自然言語理解このモデルは、曖昧な人間の指示を解析し、視覚入力から空間的な関係性や操作意図を識別することができる。
  • アクション生成制御このモデルは、高周波で滑らかな動作シーケンスを出力することで、ロボットに精密な物理的動作を実行させることができる。
  • リアルタイム非同期実行並列推論と並列実行をサポートすることで、遅延や途切れを解消し、スムーズで一貫性のある動作を保証します。
  • 両腕の協調動作両手を使って、積み木を分解したりタオルをたたんだりといった複雑で長時間かかる作業を行うことをサポートします。
  • 適応的な政策調整このモデルは、キャプチャが失敗した場合や環境が変化した場合、自動的にアクション戦略を切り替えて柔軟に対応できる。
  • マルチモーダル機能の維持このモデルは、視覚的な質問応答や物体検出といった一般的な理解能力を保持しており、壊滅的な忘却を防ぐ。

Xiaomi-Robotics-0の技術原理

  • MoTハイブリッドアーキテクチャQwen3-VL-4Bマルチモーダルモデルは、視覚言語入力を処理する「脳」として使用され、拡散変換器は動作を生成する「小脳」として使用されます。パラメータの総数は47億で、一般的な理解と細かい制御の両方を考慮しています。
  • 2段階トレーニング第1段階では、アクション提案メカニズムを使用してVLMがアクション分布を学習し、それを特徴空間に整合させ、視覚言語とロボットデータを組み合わせて忘却を防ぎます。第2段階では、VLMを固定し、フローマッチングによってノイズから正確なアクションシーケンスを復元するためにDiTを特別にトレーニングします。
  • 非同期実行メカニズムロボットは現在の動作ブロックを実行しながら、並行して次の動作ブロックを推論します。クリーンアクションプレフィックスは、直前の動作を入力条件として使用することで、軌道シーケンスの連続性を確保し、機構からの推論遅延によって生じる動作ギャップを解消します。
  • Λ字型アテンションマスクDiTの因果的注意マスクを置き換え、隣接するノイズトークンが過去のアクションに焦点を当ててスムーズな遷移を実現することをサポートする一方、後続のトークンがプレフィックスにアクセスすることを禁止し、視覚信号に焦点を当てるように強制し、モデルが慣性アクションをコピーすることを回避し、環境の急激な変化に対する感度を向上させます。

Xiaomi-Robotics-0 プロジェクトアドレス

  • プロジェクト公式サイト:https://xiaomi-robotics-0.github.io/
  • GitHubリポジトリ:https://github.com/XiaomiRobotics/Xiaomi-Robotics-0
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-0
  • 技術論文:https://xiaomi-robotics-0.github.io/assets/paper.pdf

Xiaomi-Robotics-0の応用シナリオ

  • 工業用精密組立このモデルは、最大20個の構成要素からなる複雑なアセンブリを正確に分解できるため、電子製品や自動車部品などの精密組立の場面に適しています。
  • ハウスクリーニングサービスこのモデルは、タオルを振って隠れた隅々まで照らし出したり、余分な物を見つけて元の場所に戻したりすることができるため、在宅介護や高齢者介護の場面に適している。
  • 物流倉庫保管および仕分けこのモデルは、高周波で滑らかな動作を生成する能力を備えているため、形状や材質の異なる様々な製品の加工ニーズに対応できます。
  • 科学研究、教育、開発このモデルは、大学や研究機関が、身体化された知能アルゴリズムに関する研究、ロボット制御戦略の開発、および教育デモンストレーションを実施する上で役立ちます。
  • ビジネスインタラクティブディスプレイこのモデルは、ショールーム、店舗、記者会見などの場面で展開でき、低遅延でスムーズな人間とコンピュータの協働機能を実証し、ブランドの技術的なイメージを高めることができます。