project
Qwen-VLA - Alitongyiが立ち上げた、普遍的なビジョン・言語・行動モデル
Qwen-VLAは、Tongyi Labsが開発した汎用的な視覚・言語・行動モデルです。視覚・言語の基盤としてQwen3.5-4Bを使用し、1.15B個のパラメータを持つDiTアクションデコーダと組み合わせています。このモデルは、統一された行動軌跡予測フレームワークを使用して、...
Qwen-VLAとは何ですか?
Qwen-VLAは、Tongyi Labsが開発した汎用ビジョン・言語・アクションモデルです。ビジュアル・言語の基盤としてQwen3.5-4Bを使用し、11億5千万個のパラメータを持つDiTアクションデコーダと組み合わせています。このモデルは、操作、ナビゲーション、軌道予測という3つの主要タスクを、統一されたアクション軌道予測フレームワークを通じて単一のモデルに統合しています。オントロジーベースの条件付きキューを活用することで、テキスト記述を変更するだけで11種類のロボットプラットフォームに対応できます。このモデルは、複数のベンチマークにおいて専用モデルを凌駕し、ゼロショット動的操作で26.6%の成功率を達成することで、熟練者から汎用的な動作者へと身体化された知能を飛躍的に向上させています。
Qwen-VLAの主な機能
-
タスク全体にわたる統合制御単一のモデルで、運用、航法、軌道予測という3つの主要なタスクを同時に処理できるため、従来の専用モデルに見られた断片的な性質を打破できる。
-
クロスボディプラグアンドプレイWidowX、Franka Panda、Mobile ALOHA、Galaxea R1など、11種類のロボットプラットフォームに対応し、シングルアーム、デュアルアーム、モバイルベースなどの構成をカバーしています。これらのプラットフォーム間の切り替えは、テキストプロンプトを変更するだけで簡単に行えます。
-
ゼロショットオープンワールド一般化色、インスタンス、位置、背景、指示という、目に見えない5つの配信次元において高い成功率を維持し、新しい環境への再トレーニングを必要としません。
-
動的なオブジェクト操作動的な学習データは不要。移動物体に対してゼロショット操作が可能。DOMINOベンチマークの成功率は26.6%で、専用のファインチューニングモデルを凌駕。
-
長期航行タスク適応型トークン割り当てメカニズムは、長い命令に対してより豊富なエピソード履歴を保持し、VLN-CEベンチマークのR2R(応答対応答)は57.5%、RxR(応答対応答)は59.6%で、専用のナビゲーションモデルを上回ります。
Qwen-VLAの技術原理
- 統一された運動軌跡予測フレームワーク従来の身体化された知能は、操作、ナビゲーション、軌道予測を独立したモデルに分離しているため、タスク間の転移性が限られています。Qwen-VLAは、これら3つの計算構造が同型であることを発見しました。つまり、すべて「シーンの観察+指示の理解→将来のアクションシーケンスの予測」というプロセスで構成されており、モデリングが統合されています。このモデルは、Qwen 3.5-4Bの視覚言語バックボーンと1.15B DiTアクションデコーダーを組み合わせ、異なるタスクのデータを同じトレーニング中に共同で監視することで、視覚的位置特定と空間推論能力のタスク間転移性を実現しています。
- オントロジーに基づくキュー条件付けロボットのハードウェアの違いに対応するため、従来の手法ではロボット本体ごとに独立したブランチをカスタマイズしていました。Qwen-VLAは、これらのハードウェアの違いを単一のプラットフォームインターフェースとして構造化されたテキストプロンプトにエンコードします。これらのプロンプトには、ロボットモデル、アーム数、関節構成、制御周波数などの情報が含まれており、これらはVLMによって処理されます。バックボーンネットワークの隠れ状態は、ノイズを含むアクションブロックと連結され、DiTデコーダに送信されます。推論時には、プロンプトを置き換えるだけでプラットフォームを切り替えることができます。
- テキスト・トゥ・アクションDiT事前トレーニング(T2A)トレーニングでは、VLM を事前トレーニングしながら DiT をゼロから初期化するという課題に直面します。解決策は、VLM を固定し、DiT を個別にトレーニングし、画像を提供せずにテキストのみを入力することです。これにより、DiT は最初にアクションの分布、テキストとアクションのアライメント、およびオントロジーの条件付けを学習できます。この段階での計算コストは、マルチモーダル トレーニングの 1/10 です。アブレーション実験により、合成データ 20% + 実データ 80% が最適 (71.1%) であることが検証され、画像なしの方が画像ありよりも実際には優れており、2,000 ステップでピークに達します。
Qwen-VLAの使い方
- 環境準備GitHubから公式リポジトリをクローンし、依存関係をインストールしてから、事前学習済みの重みをダウンロードしてください。
- モデル推論ロボットのハードウェア構成に基づいて、ボディプロンプトを生成し、画像、指示、プロンプトをモデルに入力し、アクションシーケンスを取得して、ロボットに送信して実行します。ループ内で反復処理を行い、閉ループ制御を実現します。
- モデルトレーニング(上級)トレーニングは、T2A → CPT → SFT → RL の4段階のプロセスを経て行われ、動作生成、視覚認識、タスク適応、およびクローズドループ最適化能力を段階的に向上させていきます。
- クロスプラットフォーム展開ロボットを切り替える際は、プロンプトのハードウェア説明欄を変更するだけで済みます。新しいロボットへの適応時には、SFT段階で収集したデータに微調整を加えることができます。
Qwen-VLAの主な利点
-
汎用性は専門性を凌駕する単一の汎用モデルは、5つのシミュレーションベンチマークのうち3つで、最高の専用モデルを上回る性能を発揮した。
-
軽量クロスボディ対応変更する必要があるのはテキストプロンプトのみであり、ロボットごとにモデルを再学習させる必要はありません。
-
効率的な事前トレーニング戦略T2A段階の計算コストはマルチモーダルトレーニングのわずか1/10であるため、VLMの事前トレーニング結果への干渉を回避できる。
-
優れたOOD汎化能力実際のOODの平均成功率は76.9%で、π₀.₅ +35.4ppと未訓練のバリアント +40.7ppを上回っています。
-
ゼロショット動的シナリオにおける画期的な進歩DOMINOベンチマークのゼロサンプル性能は26.6%で、専用のファインチューニングモデルであるPUMAを17.2%上回っています。
Qwen-VLAのプロジェクトアドレス
- プロジェクト公式サイト:https://qwen.ai/blog?id=qwenvla
- GitHubリポジトリ:https://github.com/QwenLM/Qwen-VLA
- arXiv技術論文:https://arxiv.org/pdf/2605.30280
Qwen-VLAと類似の競合製品との比較
| 寸法 | Qwen-VLA | π₀.₅ (Physical Intelligence) |
|---|---|---|
| 建築基盤 | Qwen3.5-4B VLM + 1.15B DiTデコーダー | フローマッチングに基づくVLAアーキテクチャ |
| 作業の均一性 | 運用、航法、軌道予測という3つのタスクを統合する | 業務上のタスクに集中する |
| クロスオントロジーアプローチ | 条件付きテキスト候補は、アーキテクチャを変更することなく実装できます。 | 体型によって微調整や適応が必要となる。 |
| 対応プラットフォーム | 11種類(WidowX、ALOHA、Frankaなど) | 主に限られた数の主要プラットフォームをサポートしています。 |
| 事前トレーニング戦略 | 視覚的な事前学習なしのT2A(計算コスト1/10) | エンドツーエンドのマルチモーダル共同トレーニング |
| 動的動作 | サンプルサイズゼロ:26.6%(ドミノ) | サンプルサイズゼロ:7.5% |
| OODの一般化 | 実際の平均値は76.9%です。 | 41.5% |
| ナビゲーション機能 | VLN-CE R2Rは57.5%で、専用航法モデルを上回る。 | サポートされていません |
| オープンソースレベル | 論文、コード、重み付けデータはすべてオープンソースです。 | 部分的にオープンソース |
| トレーニング効率 | T2A段階の計算コストは、マルチモーダル段階の計算コストの10分の1である。 | 標準的なマルチモーダルトレーニング費用 |
Qwen-VLAの応用シナリオ
-
多機能産業用ロボット同じモデルで、組立ライン上の異なる作業ステーションへのピッキング、移動、ナビゲーションといった多様なタスクを完了させることができ、各タスクごとに個別のモデルを導入する必要はありません。
-
さまざまなシナリオに展開されるサービスロボット家庭用ロボットは、キッチンでの作業を実行したり、リビングルームを自律的に移動したり、廊下で経路を計画したりすることができ、タスクの種類をシームレスに切り替えることができる。
-
科学研究および教育プラットフォーム研究者は、テキストプロンプトを変更するだけで、ロボットごとにモデルを再学習させることなく、新しいハードウェアプラットフォーム上でアルゴリズムを迅速に検証できる。
-
動的な環境下での運用物流や倉庫業務においては、動的なシナリオに対応するためにトレーニングデータを再収集する必要なく、コンベアベルト上を移動する荷物をつかむことができる。
-
長期にわたる複雑な指導この博物館案内ロボットは、「まずAホールに行って写真を撮り、それから人混みを避けてBホールへ行く」といった、複数の手順を含む長い作業を実行できる。