project
UnifoLM-VLA-0 - Unitree Robotics社製の、大規模でオープンソースの汎用ロボットマニピュレーションモデル。
UnifoLM-VLA-0は、Unitree Roboticsがオープンソース化した汎用的なビジョン・言語・アクション(VLA)大規模モデルであり、継続的な事前学習のためにQwen2.5-VL-7Bアーキテクチャに基づいています。
UnifoLM-VLA-0とは何ですか?
UnifoLM-VLA-0は、Unitree Roboticsがオープンソース化した汎用ビジョン・言語・アクション(VLA)モデルで、Qwen2.5-VL-7Bアーキテクチャに基づいて継続的に事前学習されています。2D/3D空間認識や軌道予測といった多次元の監視信号を融合することで、このモデルは「視覚言語理解」から「具現化されたインテリジェントエージェント」へと進化します。単一の戦略を用いて、テーブルの片付け、タオルの折りたたみ、果物の仕分けなど、12種類の複雑なヒューマノイドロボットタスクを完了できます。LIBEROシミュレーションベンチマークでは、平均98.7%の精度を達成し、強力な空間推論能力とタスク横断的な汎化性能を示しています。
UnifoLM-VLA-0の主な機能
- 一般的なロボット操作UnifoLM-VLA-0は、エンドツーエンドのビジョン・言語・アクションモデルとして、自然言語コマンドを通じてヒューマノイドロボットを制御し、複雑なタスクを完了させることができます。これには、物の整理、タオルの折りたたみ、果物の仕分け、工具の片付け、テーブルの拭き掃除など、12種類の複数ステップの長距離タスクが含まれます。
- 空間認識と推論このモデルは、物体検出とセグメンテーション、3Dバウンディングボックス予測、空間関係推論(「左にある鉛筆」など)、アフォーダンス推論(位置決定を掴む能力)、軌道計画など、強力な2D/3D空間理解機能を備えています。
- 単一戦略マルチタスク単一のモデル重みだけで様々なシナリオやタスクに対応でき、各タスクごとに個別のトレーニングを行う必要がないため、優れたタスク間転移能力を発揮します。
UnifoLM-VLA-0の技術原理
- モデルアーキテクチャオープンソースの視覚言語モデルであるQwen2.5-VL-7Bをベースに、アクションヘッドを追加することで、視覚認識と自然言語理解からロボット制御アクションを直接出力できるエンドツーエンドのビジョン・言語・アクションアーキテクチャを構築しました。
- 継続的な事前トレーニングこのモデルは、ロボットや一般的なシナリオを網羅するマルチタスクデータセットで継続的に事前学習されており、2D検出とセグメンテーション、階層的なタスク分解、3D物体検出、空間推論、軌道予測などの多様な監視信号を統合することで、モデルのマルチモーダルな知覚能力と物理的理解能力を向上させています。
- モーションモデリングこのモデルは、動作ブロック予測メカニズムを導入し、順方向および逆方向の動的制約を適用して動作シーケンスを統一的にモデル化することで、ロボットと物体間の物理的な相互作用のダイナミクスを深く理解し、長距離の動作計画と意思決定をサポートする。
- 空間の拡張テキストによる指示を2D/3Dの空間的な詳細と深く統合することで、意味論理と幾何学的空間との間に正確な整合性を確立し、空間認識能力と幾何学的理解能力を大幅に向上させ、指示の理解と空間推論に関する運用タスクの要件を満たします。
UnifoLM-VLA-0のプロジェクトアドレス
- プロジェクト公式サイト:https://unigen-x.github.io/unifolm-vla.github.io/
- GitHubリポジトリ:https://github.com/unitreerobotics/unifolm-vla
UnifoLM-VLA-0の応用シナリオ
- ホームサービスこのモデルは、机の片付け、タオルのたたみ、シミの拭き取りなど、日常的な家事をこなすことができます。
- オフィスアシスタントこのモデルは、文房具の整理、通学カバンの整理、工具の片付けなど、オフィス環境の維持管理作業を実行できます。
- 健康管理薬瓶の開封や薬の分注など、精密な操作が求められる医療支援シナリオをサポートする。
- 教育と訓練これは、色による物の分類や積み木を積み重ねるなど、構造化された認知教育の実演に使用できます。
- 工業用選別このモデルは自動仕分け機能をサポートしており、果物や部位などの品物をルールに従って分類し、指定された場所に配置します。