AB
AiBoss
project

ACE-Ego - DaXiao Roboticsと香港中文大学が共同開発した、身体性を備えた操作型VLAモデル。

ACE-Egoは、DaXiao Roboticsが香港中文大学のMMLabと共同開発した、オープンソースの脳ベースのマルチモルフィック身体操作(VLA)モデルです。このモデルは、6,000時間以上の人間の一人称視点ビデオを使用して事前学習されており、カメラ空間の動きと形態学的条件を組み込んでいます。

ACE-Egoとは何ですか?

ACE-Egoは、Daxiao Roboticsが香港中文大学のMMLabと共同開発した、オープンソースの多面体型マニピュレーションVLAモデルです。このモデルは、6,000時間以上の人間の1人称視点ビデオを使用して事前学習されており、カメラ空間モーションと形態学的条件付きエンコーディングにより、同じモデルをさまざまなロボットボディに適用できます。RoboCasa GR1 TableTopベンチマークで72.8%という最先端のパフォーマンスを達成し、ビニール袋や靴箱の梱包といった複雑な小売業務を安定して完了させ、多面体型ロボットの導入コストを大幅に削減します。

ACE-Egoの主な機能

  • 一つの脳、多様な適応能力形態学的条件付き符号化を用いることで、同じVLAモデルを様々なロボットのボディに適用できるため、ロボットごとに個別のトレーニングを行う必要がなくなる。
  • 複雑な作戦の実行ビニール袋への梱包や靴箱への靴の収納など、長期間にわたる高頻度接触型の小売業務をサポートします。
  • 両腕協調制御難易度の高い双腕操作ベンチマークであるRoboTwin 2.0において、90.62%の成功率を達成し、複雑な両手協調動作をサポートしました。
  • オープンソースのエコシステムこのモデルと関連リソースは業界向けにオープンソース化されており、身体化された知能の研究開発への参入障壁を低くしている。

ACE-Egoの技術原理

  • 人間中心の事前トレーニングこのシステムは、6,000時間を超える人間の一人称視点ビデオ、複数体ロボットのデモンストレーション、およびシミュレーションデータを統合し、事前学習に活用します。日常的な人間の動作を撮影したビデオを用いて一般的な動作表現を確立し、少量のロボットデータを用いて微調整することで、スキル転移を実現します。
  • カメラ空間モーションこの手法は、動作予測をカメラ座標系に統一することで、ロボット本体とカメラの視点の違いによって生じる動作空間の不整合を解消し、異なる形状のロボットに対しても統一された動作コマンドを出力できるようにする。
  • 形態学的状態のコーディング関節構造や自由度構成といったロボットの形態情報を符号化することで、モデルは異なる物体の物理的な制約を理解し、同一モデル内で様々なロボットハードウェアに適応することができる。
  • 信頼性に関する意識向上トレーニング信頼性評価メカニズムを導入することで、トレーニング中に信頼性の高い行動予測と信頼性の低い行動予測を区別し、複雑な接触操作におけるモデルの安定性と安全性を向上させる。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

ACE-Egoの使い方

  • 環境準備公式GitHubリポジトリをクローンし、Pythonの依存関係をインストールして、システムがPyTorchとCUDAをサポートしていることを確認してください。
  • モデルのダウンロードオープンソースからACE-Egoの事前学習済み重みファイルを入手し、人間中心の事前学習済みVLAベースモデルをロードします。
  • オントロジー構成対象ロボットのURDF構造、関節の自由度、およびカメラパラメータは、形態学的条件コーディングインターフェースを介して入力され、1つの脳による複数タイプの適応を完了します。
  • カメラキャリブレーションロボットに搭載されたRGB-Dカメラの内部パラメータと外部パラメータを較正し、統一されたカメラ空間運動座標系を確立する。
  • データ微調整(オプション)特定のタスクに関するロボットのデモンストレーションデータを少量収集し、それを人間の動画から事前に学習させた重みと組み合わせることで、軽量な微調整を行う。
  • 視覚入力ロボットのリアルタイムカメラ映像と、「靴を靴箱に入れて」などの音声コマンドをモデルに入力します。
  • 行動推論このモデルは、位置、姿勢、グリッパーの開閉角度などを含む、エンドエフェクタのカメラ空間における動作シーケンスを出力する。
  • マッピング実行カメラ空間における動作指令を、対象ロボット本体の関節制御信号に変換し、ハードウェアを駆動して動作を完了させる。
  • 信頼性検証信頼性認識モジュールを有効にして、信頼性の低いアクションをフィルタリングし、長期間にわたる複雑な操作の安全かつ安定した実行を保証します。

ACE-Egoの主な利点

  • 優れた業績RoboCasa GR1 TableTop 72.8%は、最先端技術(SOTA)を刷新し、π0.5(37.0%)やGR00T-N1.6(47.6%)などの主流モデルを大幅に上回ります。
  • 形態学的横断的一般化単一頭脳・複数タイプアーキテクチャは、同じモデルで様々なロボットに対応できるため、複数のエンティティの展開コストを削減できます。
  • 複雑なタスク処理能力接触頻度が高く、サイクルが長い小売業務において安定した性能を発揮し、製品の仕分けから梱包、出荷までの全工程をカバーします。
  • 高いデータ効率人間の動画を用いた事前学習に基づいているため、高価なロボットのデモンストレーションデータへの依存度を低減できる。

ACE-Egoプロジェクトの住所

  • プロジェクト公式サイト:https://acerobotics-vla.github.io/ACE-Ego/
  • GitHubリポジトリ:https://github.com/ACERobotics-VLA/ACE-Ego-0
  • 技術論文:https://acerobotics-vla.github.io/ACE-Ego-0/paper.html

ACE-Egoと類似の競合製品との比較

寸法 ACE-Ego π0.5
出版社 DaXiao Robotics × CUHK MMLab Physical Intelligence
位置 ワンブレイン・マルチボディ・マニピュレーション(VLA) 一般フローマッチングVLAモデル
RoboCasa GR1 72.8%(SOTA) 37.0%
事前学習データ 6,000時間以上の人間による映像とロボットのデータ 大規模マルチボディロボットデータ
主な機能 人間中心、カメラ空間モーション、形態学的条件コーディング ストリームマッチングアクション生成、大規模事前学習
オープンソースのステータス オープンソース クローズドソース(API/モデルの重み付けに制限があります)
形状適応 複数の脳タイプに対するネイティブサポート 各エンティティごとに個別の微調整が必要です。

ACE-Egoの応用シナリオ

  • 小売販売のフルフィルメントスーパーマーケット、コンビニエンスストア、その他同様の施設における、商品の仕分け、ビニール袋への包装、靴箱への梱包といったオフライン小売業務の自動化。
  • 物流倉庫倉庫内での商品の仕分け、梱包、パレット積みなど、密接な接触を必要とする物流プロセスのインテリジェント化。
  • ホームサービス家庭環境における整理整頓、片付け、簡単な掃除など、日常的な家事のお手伝い。
  • ビジネスサービスショッピングモール、ホテル、レストラン、その他同様の施設における商品の取り扱い、陳列棚の維持管理、カウンター上の整理整頓。
  • 工業生産部品の組み立て、工具の取り扱い、生産ラインにおける材料の搬送など、精密な工業作業。