project
Qwen-Robot Suite - Alitongyi社が発売した物理世界向け基本モデルキット
Qwen-Robot Suiteは、物理世界における知能を実現するためにアリババ同義が開発した基盤となるモデルスイートです。これには、Qwen-RobotNav(ナビゲーション)、Qwen-RobotManip(操作)、Qwen-RobotWorld(世界モデル)などが含まれます。
Qwen-Robot Suiteとは何ですか?
Qwen-Robot Suiteは、物理世界におけるインテリジェンスを実現するためにAlibaba Tongyiが開発した基盤となるモデルスイートです。Qwen-RobotNav(ナビゲーション)、Qwen-RobotManip(操作)、Qwen-RobotWorld(世界モデル)の3つの基本モデルで構成されています。このスイートは、言語優先のインターフェースを通じて視覚言語表現空間と物理的な動作を橋渡しし、オントロジーやシナリオを横断したトレーニングと推論を統合します。これにより、汎用的な大規模モデルが高レベルのプランナーとして機能し、基盤となる物理ツールを動的に呼び出して長期的なタスクループを完了させることができます。
Qwen-Robot Suiteの主な機能
-
統合物理ナビゲーションQwen-RobotNavは、指示の追従、ポイント/ターゲットナビゲーション、ターゲット追跡、自律走行、および身体を使った質問応答という5つの主要分野を網羅しており、これらすべてを単一のモデルで実行します。
-
クロスボディ操作制御Qwen-RobotManipは、単腕、双腕、器用な手、移動プラットフォームなど、15種類のロボット本体に対応しており、視覚言語から動作への直接的なマッピングを可能にします。
-
世界情勢予測Qwen-RobotWorldは、自然言語による動作記述を受け取り、動作、運転、ナビゲーションのシナリオにおいて、物理法則に準拠した将来の状態を予測します。
-
インテリジェントエージェントツールキットこれら3つのモデルはすべて、言語優先のインターフェースを提供しており、物理世界のためのツールとして、汎用的なQwenモデルによって動的に呼び出し、組み合わせることができる。
-
ゼロサンプル実展開Unitree Go2などの実機ロボットへのゼロサンプル展開をサポートし、シナリオ固有の微調整は不要です。
Qwen-Robot Suiteの技術的原理
- Qwen-RobotNav:パラメトリックビジョン割り当てと制御可能な観測プロトコルこのモデルは、ビジョン割り当て戦略自体をパラメータ化し、タスクモードを通じてナビゲーション動作(コマンド追従、ターゲット探索、追跡、自動運転)を選択し、視覚トークン予算、時間減衰、カメラごとの重み、フレームサンプリングモードという4軸推論パラメータを調整可能なインターフェースとして公開します。モデルは、視覚データと言語データを組み合わせた1560万個のサンプルで学習され、同じ重みセットでアーキテクチャを変更することなくさまざまなナビゲーションニーズに対応できます。上位レベルのプランナーは、タスクモードとコンテキスト戦略を動的に切り替え、再構成可能なナビゲーションプリミティブとしてモデルを繰り返し呼び出し、2層メモリ機構を使用して長距離推論を実現します。
- Qwen-RobotManip: クロスオントロジーアライメントとスケーラブルなトレーニングの統合Qwen3.5-4B VL をバックボーンとして使用し、フローマッチング DiT アクションヘッドと組み合わせることで、この研究は 3 つのメカニズムを通じて異種オントロジーの競合を解決します。統一された 80 次元の状態アクション表現は、多様なオントロジータイプ間で共有されます。カメラ座標系でのエンドエフェクタの増分ポーズ位置決めにより、視覚的に類似した動きは数値的に類似し、形態的な違いが隠蔽されます。最後に、コンテキスト適応ポリシーは、実行履歴を暗黙のオントロジー識別子として扱い、推論中のオンライン動作キャリブレーションを可能にします。データに関しては、11,320 時間のオープンソースロボットデータ、1,933 時間の人間のビデオ、および人間とロボットの転送合成パイプラインによって生成された 24,808 時間のクロスオントロジーデータを使用してトレーニングが完了し、合計で 38,100 時間を超えるコーパスが使用されました。
- Qwen-RobotWorld:言語駆動型二流世界モデル設計の鍵となる要素は、すべての動作を自然言語インターフェースに統合し、エンドエフェクタの姿勢、操舵コマンド、ナビゲーションランドマークを単一のトレーニング信号に標準化することで、20種類以上のオントロジータイプと500種類以上の動作カテゴリの協調学習を可能にすることです。このモデルは、60層のデュアルストリームMMDiTを採用し、Qwen2.5-VL意味表現とビデオ潜在変数を深く結合しています。軽量テキストエンコーダとは異なり、このモデルは完全なマルチモーダル大規模言語モデルを動作エンコーダとして使用し、剛体、流体、重力などの物理的知識を内部化することで、物理的に信憑性のある未来を暗黙的に生成します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Qwen-Robot Suiteの使い方
-
モジュールを選択タスクの要件に基づいて、基盤となる物理エンジンとしてRobotNav(移動性)、RobotManip(操作性)、またはRobotWorld(予測性)を選択してください。
-
設定インターフェース視覚履歴の符号化パラメータは、4軸制御可能な観測プロトコルを通じて調整でき、単一または複数のカメラのさまざまな入力構成に適応させることができる。
-
アクセスプランナー上位レベルの汎用インテリジェントエージェント(Qwen-3.5など)は、長期目標をサブタスクに分解し、言語コマンドを通じて対応するモデルを動的に呼び出します。
-
実行閉ループ基盤となるモデルは、言語による指示を受け取り、実際のロボットやシミュレーション環境の実行を制御するために、物理的な動作や将来のフレームを出力する。
-
メモリ管理これは、断片間のメモリと証拠ノートブックを活用してコンテキストを圧縮し、複数ステップのナビゲーション、環境フォレンジック、および障害復旧をサポートします。
Qwen-Robot Suiteの主な利点
- 言語優先の統合インターフェースこれら3つのモデルはすべて自然言語による操作インターフェースを提供しており、異なるロボット形態ごとに独自のプロトコルを設計する必要なく、汎用的なLLM(言語学習モジュール)からツールとしてシームレスに呼び出すことができる。
- クロスオントロジーの強力な一般化カメラ座標系の動きに合わせた統一された80次元表現により、このモデルはゼロサンプル条件下で15のプラットフォーム間で移行することが可能になり、実環境において従来最高のパフォーマンスの2倍を達成しました。
- 完全にオープンソースのデータを使用したトレーニングRobotManipは、オープンソースデータのみを使用して38,000時間以上のトレーニングを完了し、人間と機械の相互作用を統合するパイプラインを通じてデータ障壁を大幅に低減することで、アライメントがスケーリングの前提条件であることを証明しました。
- 物理的一貫性の生成この世界モデルは、モーションエンコーダーとして完全なVLM(仮想線形モデル)を使用し、ニュートンの法則、質量保存則、流体力学を内部化しており、WorldModelBenchなどの物理推論ベンチマークにおいて、オープンソースモデルの中で第1位にランクされています。
Qwen-Robot Suiteプロジェクトの住所
モデルの重み付け、技術ブログ、および独立したプロジェクトページは、まだ完全には公開されていない可能性があります。
Qwen-Robot Suiteと類似製品との比較
| 比較対象寸法 | Qwen-Robot Suite | π0.5 (Physical Intelligence) |
|---|---|---|
| データ戦略 | 人間と機械間の情報伝達合成パイプラインを含む、完全オープンソースデータ(38,000時間以上)を用いたトレーニング。 | 大規模な実機ロボット遠隔操作データ収集に依存して |
| 身体適合性 | 15のプラットフォームと20以上のオントロジーにまたがる、統一された80次元表現。 | 主に特定のオントロジータイプ向けに最適化されており、形態学的分類を超えた一般化は限定的である。 |
| アクションインターフェース | 自然言語を用いて操作、ナビゲーション、運転タスクを統合する、言語優先のアプローチ。 | アクショントークンが主要な構成要素であり、言語は二次的な要素である。 |
| 一般化能力 | サンプルゼロでのクロスオントロジー転送、オープン環境での実世界展開 | 分散処理性能は優れているが、オブジェクト指向設計の一般化とオントロジー間の転送は比較的限定的である。 |
| システムアーキテクチャ | 3つのモデルとエージェントフレームワークを組み合わせることで、長期計画のための階層的なサポートが提供される。 | 単一のVLAモデルはエンドツーエンドで実行されるが、長期的なタスクは外部の計画に依存する。 |
Qwen-Robot Suiteの応用シナリオ
-
家庭用サービスロボットデスクトップの清掃、衣類の整理、調理補助といった長時間の作業を実行でき、タスクを細分化したり、障害から復旧したりする能力も備えている。
-
倉庫保管および物流同じナビゲーションモデルが、倉庫内のターゲット検索、棚在庫管理、AGV経路追跡を処理するため、異なるモデル間でのゼロサンプル展開が可能になります。
-
自動運転と身体に埋め込まれたナビゲーションこの統合モデルは、都市部での運転、屋内での指示追従、およびオープン環境の探索を網羅し、証拠に基づいた質問応答をサポートします。
-
シミュレーションデータの合成低コストかつ大規模な学習データエンジンとして世界モデルを使用し、物理的に妥当な未来像を生成する。
-
人間とロボットが協働する産業用アームこれにより、15種類の産業用/サービス用ロボットプラットフォーム間でスキル移転が可能になり、生産ラインの切り替え時の再プログラミングコストを削減できます。