project
Xiaomi-Robotics-U0 - Xiaomiの統合型具現化合成モデル
Xiaomi-Robotics-U0は、Xiaomiが発表した380億個のパラメータを持つ統合型具現化合成モデルです。世界ベースのモデルに基づいて継続的に学習され、テキストから画像への変換、画像編集、具現化されたシーン生成、具現化された転送、具現化されたビデオ生成などを共同で最適化します。
Xiaomi-Robotics-U0とは何ですか?
Xiaomi-Robotics-U0は、Xiaomiが発表した380億個のパラメータを持つ統合型具現化合成モデルです。世界ベースのモデルに基づいて継続的に学習され、テキストから画像への生成、画像編集、具現化シーン生成、具現化転送、具現化ビデオ生成の5つの主要タスクに対して共同で最適化されています。Xiaomi-Robotics-U0は、複数のロボット形態をサポートする初の高品質マルチビューシーン生成モデルです。具現化シーン生成と転送に関する人間による評価では、GPT-Image-2.0を上回り、World Arenaの具現化ビデオ生成リーダーボードで1位を獲得しました。また、実世界の操作タスクにおけるπ0.5の成功率を36.9%から63.2%に向上させました。
Xiaomi-Robotics-U0の主な機能
-
テキストベースの画像生成基となる世界モデルの視覚的知識を保持しながら、高品質なテキストから画像への合成をサポートします。
-
画像編集カメラ制御、時間制御、構造抽出などのきめ細かな操作を含む、あらゆる画像編集に対応しています。
-
具現化されたシーン生成ロボットの形状とシーンの説明に基づいて、複数の視点間で一貫性のある初期観測ビューを生成する。
-
身体化された移住複数の視点と動的な相互作用における一貫性を維持しながら、シナリオ間での構造化された制御可能な移行を可能にする。
-
エンボス加工ビデオ生成ゼロサンプル、マルチビューによる動画生成をサポートし、静止画を連続動作動画に合成します。
Xiaomi-Robotics-U0の技術原理
-
統一自己回帰フレームワークEMU3.5の初期化に基づき、IBQトークナイザーを使用して16×16の空間圧縮を行い、すべてのモダリティを次のトークン予測のための離散的な語彙に統合します。
-
合同継続訓練: 限られたロボットデータを使用することによって生じる汎化能力の低下を回避するため、一般化データセットと具現化データセットに対して継続的にトレーニングを行うために、統一された自己回帰目的関数が使用されます。
-
FlashAR+ 推論アクセラレーション逆対角並列復号を備えた垂直予測ヘッドを導入し、vLLM最適化と組み合わせることで、1024×1024解像度の画像の生成速度が82.9倍向上しました。
-
構造化制御分解シーンをワークスペース、タスクオブジェクト、無関係なオブジェクト、照明、背景という5つの独立した制御次元に分離し、スケーラブルな具現化されたビデオ強化をサポートします。
-
サブタスク・サブゴールのインターリーブ学習ロボットの軌跡はHDBSCANクラスタリングを用いてサブタスクに分解され、画像とテキストが交互に並んだシーケンスが生成されることで、長期的なタスクの進捗状況と詳細な相互作用のダイナミクスを捉えることができる。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Xiaomi-Robotics-U0 の使い方
- 環境設定モデルの重みと推論コードをダウンロードするには、Xiaomi Roboticsの公式ウェブサイトにアクセスし、CUDAとvLLMをサポートする高性能GPU環境を設定してください。
- モデル読み込み中EMU3.5アーキテクチャに基づき、Xiaomi-Robotics-U0の380億個のパラメータチェックポイントが初期化およびロードされ、IBQトークナイザーが統一的に呼び出されてマルチモーダル入力シーケンスが処理されます。
- テキストベースの画像生成入力されたテキスト説明に基づき、標準的な自己回帰次トークン予測を用いて、解像度1024×1024の高画質画像を直接生成します。
- 画像編集テキストによる指示とともに1~3枚の参照画像を提供すると、モデルは「Any-to-Image」機能に基づいて、カメラ制御、時間制御、構造抽出などのきめ細かな編集を実行します。
- 具現化されたシーン生成ロボットの形態記述と構造化されたシーンテキストを入力すると、モデルはマルチビューの一貫性と幾何学的整合性を厳密に満たす初期観測画像を出力する。
- 身体化された移住現在のマルチビュー観測データとターゲットシーンの説明に基づいて、モデルはインタラクティブなダイナミクスを維持しながら、転送されたマルチビューRGB画像を生成します。
- エンボス加工ビデオ生成初期観測フレームとタスク指示を提供します。このモデルは、自己回帰展開によって、時間的に一貫性のあるロボット動作ビデオを15~25フレーム生成します。
- 推論の高速化FlashAR+の垂直予測ヘッドとvLLM最適化を有効にすることで、1024×1024解像度での画像生成速度が82.9倍向上します。
- データエンジンアプリケーション生成された具象シーンまたはビデオシーケンスは、下流のロボットポリシーネットワークに直接入力され、現実世界の操作タスクにおける分布外汎化能力を向上させる。
Xiaomi-Robotics-U0 の主な利点
-
団結基本的な画像・動画生成と具現化された生成を単一のフレームワーク内で統合した初のモデルであり、学習後の処理によって生じる視覚的知識の損失を回避する。
-
多角的視点の一貫性様々なロボット形状において、幾何学的整合性とカメラキャリブレーションの制約を厳密に満たしながら、高品質なマルチビューシーン生成をサポートします。
-
管理された移住構造化された制御メカニズムの導入により、インタラクティブなダイナミクスを維持しながら、作業スペース、背景、照明などの要素をきめ細かく編集することが可能になります。
-
データエンジンの機能生成された具現化されたシーンは、時間的に一貫性のある動作ビデオに直接展開することができ、下流のポリシー学習のための拡張可能な合成軌跡を提供する。
-
最先端性能具現化されたシーンの生成と転送においてGPT-Image-2.0を凌駕し、World Arenaにおける具現化されたビデオ生成において第1位にランクインしている。
Xiaomi-Robotics-U0プロジェクトのアドレス
- プロジェクト公式サイト:https://robotics.xiaomi.com/xiaomi-robotics-u0.html
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
- arXiv技術論文:https://arxiv.org/pdf/2607.11643
Xiaomi Robotics U0の競合製品比較
| 寸法 | Xiaomi-Robotics-U0 | π0.5 |
|---|---|---|
| 位置 | 制御可能なデータとシナリオの生成に焦点を当てた、統一された具現化合成世界モデル。 | 直接的なロボット制御に焦点を当てた、エンドツーエンドのビジョン・言語・アクション戦略モデル。 |
| パラメータサイズ | 380億個のパラメータを持つ自己回帰型トランスフォーマー | VLMバックボーンとアクションエキスパートの階層型アーキテクチャを採用 |
| 中核となる能力 | マルチビューシーン生成、具現化転送、ビデオ生成、画像編集 | エンドツーエンドのロボット制御、汎用的なホームタスク実行 |
| 建築 | EMU3.5の初期化に基づき、次トークン予測を統一しました。 | 離散的なアクショントークンを事前に学習させ、次にストリームマッチングを学習させて連続的なアクションを生成する。 |
| データエンジン | これにより、具現化されたシーンやビデオを直接生成することができ、配信外マッピングの成功率を36.9%から63.2%に向上させることができます。 | それ自体でデータを生成する能力はなく、現実世界のデータ収集に依存している。 |
| 多角的視点の一貫性 | マルチビューシーン生成と、様々なロボット形態間での幾何学的に整合性のある転送をネイティブにサポート | これは単一視点戦略モデルであるため、複数視点合成を直接処理することはできません。 |
| 視覚的知識の保持 | 一般的な生成タスクと具現化されたタスクを共同で訓練し、VLMベンチマークで高いスコアを維持しました(ERQA 40.8、SEED 78.6)。 | VLMベンチマークスコアが低い(ERQA 0.0、SEED 21.5)ことは、視覚理解能力の低下を示している。 |
Xiaomi-Robotics-U0の応用シナリオ
-
ロボットデータ合成これは、実機ロボットの訓練用に大規模で多様な合成動作軌跡を生成し、実データ収集における高コストと限られたシナリオという問題を解決する。
-
クロスフォームシーン移行シーンの一貫性を維持しながら、同じ操作タスクをあるロボット形態(例えば、単腕ロボット)から別のロボット形態(例えば、双腕ロボット)に移行させる。
-
シミュレーション環境の構築シミュレーションプラットフォームのトレーニングや戦略検証のために、高品質なマルチビューロボット操作シナリオを迅速に生成できます。
-
強化された運用戦略生成された分布外データを利用することでロボット戦略の汎化能力を向上させ、例えばπ0.5の成功率を26.3%向上させる。
-
身体化された知能研究世界の基本モデルとして、長期的なタスク計画、サブタスクの分解、インタラクティブな動的予測などの基礎研究を支える。