project
EMMA-X - シンガポール工科デザイン大学によるエンボス加工を施したマルチモーダルモーションモデル
EMMA-Xは、シンガポール工科デザイン大学が開発した、70億個のパラメータを持つ身体化されたマルチモーダル行動モデルです。これは、証拠に基づいた思考連鎖(CoT)推論データに基づいてOpenVLAを微調整することによって作成されました。EMMA-Xは、階層的な身体化されたデータセットを組み込んでいます...
EMMA-Xとは何ですか?
シンガポール工科デザイン大学が開発したEMMA-Xは、曖昧連鎖推論(CoT)データに基づいてOpenVLAを微調整することで作成された、70億個のパラメータを持つ具現化されたマルチモーダルモーションモデルです。EMMA-Xは、3D空間モーション、2Dグリッパー位置、曖昧推論を含む階層的な具現化データセットを組み合わせ、斬新な軌道分割戦略を導入しています。グリッパーの開閉状態とロボットアームのモーション軌道を利用することで、曖昧タスク推論と前方空間推論を強化し、特に空間推論を必要とする実世界のロボットタスクにおいて、大幅な性能向上を実現しています。
EMMA-Xの主な機能
- 空間推論能力の向上グリッパーの予測される将来の2次元位置と3次元動作計画に基づいて、ロボットの長期的なタスク計画能力が最適化される。
- 具体的なタスク計画このモデルは、視覚とタスク推論を組み合わせることで、環境に適応する行動戦略を生成し、ロボットが複雑なタスクを実行する能力を向上させる。
- 軌跡の分割グリッパーの状態とロボットアームの動作軌跡を利用することで、操作シーケンスを意味的に類似した動作セグメントに分割し、タスクの理解と動作計画を向上させる。
- 幻覚の問題を軽減する視覚イメージとタスク推論を組み合わせることで、タスク推論プロセス中のエラーや錯覚を軽減できる。
- 階層型計画データ生成各操作セグメントごとに、2次元グリッパー位置と3次元空間動作を生成するとともに、ロボットの意思決定プロセスを支援するための具体的な推論を生成する。
EMMA-Xの技術原理
- 階層型具現化データセットBridgeV2データセットに基づいて構築されたこのデータセットには、6万件のロボット動作軌跡が含まれており、それぞれに詳細な空間推論情報とタスク推論情報が記載されています。
- 先読み空間推論このモデルは、グリッパーの将来の位置と動作計画を予測し、ロボットの直近の動作を長期目標に沿うように導く。
- 軌跡分割戦略動作シーケンスは、エンドエフェクタの動作軌跡とグリッパーの状態と組み合わせた、HDBSCANアルゴリズムと独自の距離測定法を用いて動的に分割されます。
- Geminiがタスク推論を生成するGeminiモデルは、各セグメントごとにサブタスクと具体的な推論を生成するために使用され、タスク理解の精度を向上させます。
- EMMA-XアーキテクチャOpenVLAの調整に基づき、連鎖的な思考訓練によって空間推論能力と場面理解能力が向上し、ロボットの次の行動戦略を予測できるようになる。
EMMA-Xプロジェクトの住所
- GitHubリポジトリ:https://github.com/declare-lab/Emma-X
- ハギングフェイスモデルライブラリ:https://huggingface.co/declare-lab/Emma-X
- arXiv技術論文:https://arxiv.org/pdf/2412.11974
EMMA-Xの応用シナリオ
- 製造自動化ロボットは、組み立て、梱包、品質管理などの作業に使用され、生産ラインの効率と柔軟性を向上させます。
- 物流および倉庫管理倉庫では、ロボットが商品のピッキング、移動、仕分けを支援し、保管スペースと物流プロセスを最適化する。
- サービス業飲食業やホテル業では、ロボットは調理補助、客室清掃、物品配達といった複雑な作業を担っている。
- 医療支援医療分野では、ロボットは手術の補助や研究室での検体処理など、繊細な作業を行う。
- ホームオートメーション家庭用サービスロボットは、掃除や片付け、その他の家事をこなすことで、生活の利便性を向上させます。