project
Wall-OSS-0.5 - 独立変数ロボットのための、オープンソースで国内開発の具現化された知能モデル。
Wall-OSS-0.5は、独立変数ロボット向けに国内で開発されたオープンソースの具現化知能モデルです。大規模なビジョン・言語・アクション(VLA)モデルカテゴリに属し、タスクの微調整なしに実機ロボットに展開できる「ゼロショット」機能を備えています。このモデルは、革新的な…
Wall-OSS-0.5とは何ですか?
Wall-OSS-0.5は、独立変数ロボット向けに国内で開発されたオープンソースの具現化知能モデルです。Vision-Language-Motion(VLA)大規模モデルカテゴリに属し、タスクの微調整なしに実機ロボットに展開できる「ゼロショット」機能を備えています。革新的なGradient-Bridge協調学習手法により、基本モデルのバックボーンに動作機能を統合し、ロボットがハンドリングや仕分けなどの17種類の実世界タスクを直接実行できるようにしています。これらのタスクのうち4つでは、完了率が80%を超えています。
Wall-OSS-0.5の主な機能
-
ゼロサンプル実機ロボット操作事前学習済みのチェックポイントは、物理ハードウェアに直接展開でき、特定のタスクに合わせて微調整する必要なく、取得、ソート、整理などの操作を実行できるため、「展開のための事前学習」が実現します。
-
複数の形態にわたる統一的な適応事前学習済みの単一のチェックポイントで、デスクトップ型デュアルアームやモバイル操作など、20種類以上のロボット形態に対応できるため、従来のモデルではハードウェアの種類ごとに個別に学習させる必要があったという制約を打破できます。
-
3つの目標を連携させたトレーニング離散的な行動予測、マルチモーダル予測、連続的なフローマッチングを補完し最適化することで、「勾配ブリッジ」が形成され、行動学習と視覚言語理解が互いに干渉することなく相乗的に向上することが可能となる。
-
ハイブリッドエキスパートアーキテクチャ(MoT)視覚言語トークンはVLエキスパートによってルーティングおよび処理され、連続的なアクション計算はアクションエキスパートによって処理されます。共同アテンションメカニズムにより、言語理解とアクション生成の両方を考慮したエンドツーエンドの勾配フローが実現されます。
-
視覚言語能力の保持動作訓練は基本的なVLM能力を損なうことなく、対象物の認識能力を21.8パーセントポイント向上させ、一般的な視覚言語理解能力と推論能力を完全に維持する。
-
高効率な微調整適応LeRobotデータセットで微調整を行った結果、15種類の実際のロボットタスクの平均進捗率は60.5%に達し、類似モデルπ0.5を17.5パーセントポイント上回った。
-
強力な一般化能力と長期的な実行力変形可能な物体を操作するなど、目に見えない3つのタスクにおいて高い進捗率を維持し、ロープを締めたり、布を畳んだり、果物かごを整理したりといった長時間のタスクなど、多段階の連続操作をサポートします。
Wall-OSS-0.5の技術原理
-
4BパラメータVLAアーキテクチャ30億個のパラメータを持つQwen2.5-VL視覚言語モデルを基盤とし、動作生成コンポーネントを重ね合わせることで、パラメータの総数は40億個に達し、視覚認識、言語理解、ロボット動作生成のエンドツーエンドの統合を実現します。
-
ハイブリッドエキスパートルーティング(MoT)このアーキテクチャは、エキスパート混合モデルを採用しており、視覚言語トークンはVLエキスパートを経由してルーティングされ、連続的なアクション計算は独立したアクションエキスパートによって処理されます。両者は共同アテンション機構によって接続され、エンドツーエンドの勾配フローを実現し、アクション学習と言語理解の間の干渉を回避します。
-
勾配橋渡し共同トレーニング革新的なことに、離散的な行動予測、マルチモーダル予測、および連続的なフローマッチングが、協調学習のための補完的な最適化目標として使用され、行動方針学習と視覚言語の事前学習知識が互いに矛盾するのではなく強化し合うことを可能にする「勾配ブリッジ」を形成します。
-
連続ストリームマッチングアクション生成フローマッチング技術を用いて連続的な動作空間をモデル化することで、従来の離散化や回帰手法と比較して、より滑らかで高次元のロボット制御信号をより正確に生成できる。
-
事前トレーニングをデプロイメント設計として活用する大規模で多様なデータを用いた事前学習により、モデルは事前学習段階で一般的な物理動作の事前知識を習得します。タスク固有の微調整後処理を行うことなく、ゼロショット推論を用いて実際のロボットハードウェア上でチェックポイントを直接実行できます。
-
大規模な異種トレーニングデータこのシステムは20種類以上のロボットに対応しており、各トレーニングラウンドには100万以上の実際のロボットの軌跡が含まれています。同時に、9000万のマルチモーダルコーパス(1200万のエンティティブリッジングサンプルを含む)を統合し、約60%の自社収集データと40%のオープンソースデータという、タスクバランスの取れたサンプリングを実現しています。
-
共同注意とエンドツーエンドの最適化VL ExpertとAction Expertはアテンション計算グラフを共有しており、言語コマンド、視覚シーン、アクション出力が特徴レベルで深く結合され、勾配がモダリティ間で双方向に伝播することを保証しています。
-
機能分離および維持メカニズム3つの目的を掲げた協調的かつ専門家が分離した設計により、動作訓練は基本的なVLM能力を損なうことなく、実体認識能力を21.8パーセントポイント向上させ、一般的な視覚言語理解および推論能力を完全に維持する。
Wall-OSS-0.5の使い方
-
環境準備Python 3.10 用の conda 環境を作成し、PyTorch などの基本的な依存関係をインストールし、推論を高速化するために Flash Attention バージョン 2.7.4 以降がインストールされていることを確認してください。
-
LeRobotライブラリをインストールしますHugging Face LeRobotのリポジトリをクローンし、指定された互換バージョンにチェックアウトしてから実行してください。
pip install -e .インストールが完了しました。 -
Wall-Xツールチェーンのインストール:クローン
wall-xオープンソースリポジトリ、実行中git submodule update --init --recursiveサブモジュールをプルした後、インストールコマンドを実行してツールチェーンのデプロイを完了します。 -
事前学習済み重みをダウンロードするハグフェイスから(
x-square-robot/wall-oss-0.5公式サイトで公開されている事前学習済みモデルのチェックポイントをダウンロードしてください。 -
ロボットパラメータを設定する対象となるロボットの種類(デスクトップ型デュアルアーム、モバイル型など)に応じて、自由度(DOF)構成、モデルパス、データパス、およびトレーニングハイパーパラメータを設定します。
-
微調整を実行する(オプション)特定のタスクを対象とした最適化を行うには、LeRobot 形式のデータセット (例: ...) に対して微調整スクリプトを実行します。
bash ./workspace/lerobot_example/run.sh業務遂行能力を向上させるため。 -
実機にデプロイする事前学習済みまたはファインチューニング済みのチェックポイントをロードし、実際のロボットハードウェア上でゼロショット推論またはファインチューニング推論を実行し、実行可能なロボット制御戦略を直接出力します。
Wall-OSS-0.5の主な利点
-
すぐに展開して使用できます従来のVLAモデルは使用前に微調整が必要ですが、事前学習済みのチェックポイントは実行可能なロボットポリシーを直接生成します。
-
非常に適応力が高い15種類の実際のロボットタスクで微調整を行った結果、平均進捗率は60.5%となり、π0.5の43.0%よりも17.5パーセントポイント高くなった。
-
高い一般化能力3つの未公開タスク(変形可能な物体の操作など)で高い進捗率を維持しており、ロープを締めるタスクは82%の達成率となっている。
-
視覚言語能力の保持動作訓練は基本的なVLM能力を損なうことなく、身体的な接地能力を21.8パーセントポイント向上させ、一般的なVL能力を完全に維持する。
-
データ規模の分野で業界をリード20種類以上のロボットを対象とし、1ラウンドあたり100万以上の軌跡と9000万のマルチモーダルサンプルを収録しています。
Wall-OSS-0.5 のプロジェクトアドレス
- プロジェクト住所:https://x2robot.com/oss#resources
- GitHubリポジトリ:https://github.com/X-Square-Robot/wall-x
- 紙の住所:https://x2robot.com/api/files/file/wall_oss_05.pdf
Wall-OSS-0.5と類似競合製品との比較
| 比較対象寸法 | Wall-OSS-0.5 | π0.5 | OpenVLA |
|---|---|---|---|
| 開発組織 | Xスクエアロボット(独立変数ロボット) | Physical Intelligence(PI) | スタンフォード大学およびその他の学術機関 |
| パラメータサイズ | 40億(30億Qwen2.5-VLバックボーン) | 一般公開されていません(π0アーキテクチャ拡張版に基づく) | 70億ドル(LLaMA 2-70億ドルバックボーン) |
| コアアーキテクチャ | MoTハイブリッドエキスパート+グラディエントブリッジング共同トレーニング | トランスフォーマー階層的推論+モーションエキスパート | Prismatic VLM(SigLIP + DINOv2 + LLaMA 2) |
| 行動生成方法 | 離散トークンと連続フローのマッチングの協調最適化 | 高レベルの離散トークン自己回帰+低レベルのフローマッチングノイズ除去 | 予測のための言語モデルの語彙において、動作を個別のトークンとして扱う。 |
| トレーニングデータサイズ | 20種類以上のロボット形態、1ラウンドあたり100万以上の軌跡、9000万のマルチモーダルサンプル | ネットワークデータ、ロボット間の経験、音声コマンドを組み合わせたマルチソース連携 | Open X-Embodimentデータセットには97万個の軌跡が含まれています。 |
| ゼロサンプル展開機能 | 事前訓練のチェックポイントから直接展開。17のタスクのうち4つは80%以上完了。 | 事前学習には事後学習/微調整が必要であり、ゼロショット方式のハードウェア展開は直接サポートされていません。 | 事前学習済みモデルは、タスク固有の微調整が必要であり、直接的なゼロショット展開には対応していません。 |
| 微調整後のパフォーマンス | 15の実際のタスクにおける平均進捗率は60.5%で、π0.5を17.5パーセントポイント上回っている。 | 実際の家庭環境におけるタスクの成功率は60%~88%で、複雑な指示に対する遵守率も高い。 | WidowX / Google Robotは、RT-2-Xよりも16.5%高いマルチタスク成功率を誇る。 |
| オープンソースレベル | 完全オープンソース(重み、トレーニングコード、レシピ、アブレーション実験) | 研究成果が発表され、一部の技術的な詳細が明らかにされた。 | 完全オープンソース(モデルの重み、コード、LoRA/量子化の微調整方式) |
| 中核となるイノベーションのポイント | 勾配ブリッジングにより、事前学習と展開が可能になり、アクションと仮想学習機能が相互に損失を与えることなく相乗的に強化されます。 | オープンワールドの一般化と階層的推論(高レベルのセマンティックプランニング+低レベルのアクション実行) | 初の完全オープンソースの汎用VLAは、VLMを使用して生成されたアクションを直接微調整することの実現可能性を検証する。 |
| VLM機能の保守 | 実体認識能力は21.8%向上したが、一般的なVLの理解力と推論能力は完全に維持された。 | 意味理解はネットワークデータに依存しており、トレーニング後も特定の行動を維持する必要があります。 | 事前学習済みのVLMを微調整した結果、ベースラインの言語能力は比較的高い。 |
Wall-OSS-0.5の適用シナリオ
-
ホームサービス積み木を分類したり、果物を分類したり、引き出しを整理したり、指輪を積み重ねたり、その他日常的な家事をしたりすること。
-
フレキシブルオブジェクト処理ロープを締めたり、布を畳んだり、花を生けたりするなど、変形可能な物体を操作する作業。
-
工業用組立精密部品のピッキング、色分け、工具の返却など、反復的な製造工程。
-
アームコラボレーション両手の協調動作を必要とする、複雑な組み立て、仕分け、および長距離にわたる組み合わせ動作。
-
長期的なタスク実行バスケットの仕分けなど、継続的な注意を必要とする複数段階の作業といった、多段階の連続作業。