project
OmniManip - 智遠ロボティクスと北京大学が共同開発した汎用ロボット操作フレームワーク
OmniManipは、北京大学とZhiyuan Roboticsの共同研究室が開発した汎用ロボットマニピュレーションフレームワークです。視覚言語モデル(VLM)の高度な推論機能と高精度な3Dマニピュレーション機能を組み合わせることで、ロボットが非線形な動作を実行できるようになります。
OmniManipとは何ですか?
OmniManipは、北京大学とZhiyuan Roboticsの共同研究室が開発した汎用ロボット操作フレームワークです。視覚言語モデル(VLM)の高度な推論機能と高精度な3D操作機能を組み合わせることで、ロボットが非構造化環境で汎用的な操作を実行できるようにします。このフレームワークの中核は、オブジェクト中心の対話型プリミティブ表現手法にあります。タスクを複数の構造化された段階に分解することで、VLMが提供する常識的な推論機能に基づき、自然言語による指示を実行可能な3D空間制約に変換します。
OmniManipの主な機能
- ゼロショット汎化能力OmniManipは、多種多様なオープンボキャブラリーの指示やオブジェクトを処理でき、トレーニングなしで様々なロボット操作タスクにおいて高い汎化能力を発揮できる。
- クロスロボット形態機能OmniManipはハードウェアに依存しないアプローチであり、双腕ヒューマノイドロボットなど、さまざまな種類のロボットプラットフォームに容易に導入できます。
- 大規模シミュレーションデータ生成OmniManipは、大規模なロボット動作シミュレーションデータを自動的に生成するように設計されており、将来の研究のための強力なデータサポートを提供します。
OmniManipの技術原理
- オブジェクト中心のインタラクションのプリミティブ表現OmniManipは、オブジェクトの標準空間を通して相互作用プリミティブ(相互作用点や方向など)を定義するオブジェクト中心の表現方法を提案し、VLMの出力を実行可能な3D空間制約に変換します。これらの相互作用プリミティブはオブジェクトの標準空間で定義されるため、さまざまなシナリオ間で一貫性が確保され、より汎用的で再利用可能な操作戦略が可能になります。
- 二重閉ループシステム設計OmniManipは、高レベルの計画用と低レベルの実行用の2つの閉ループシステムを採用しています。
- クローズドループ計画OmniManipは、対話型レンダリングと対話型プリミティブ再サンプリングを通じて、VLM(仮想学習モデル)のための閉ループ推論を実現します。このメカニズムにより、VLM推論におけるエラー(錯覚問題など)を検出し修正することができ、計画結果の精度が保証されます。
- 閉ループ実行実行フェーズでは、OmniManipは6D姿勢トラッカーを使用してオブジェクトの姿勢をリアルタイムで更新し、それをロボットアームのエンドエフェクタの動作軌道に変換することで、堅牢なリアルタイム制御を実現します。
- タスクの分解と空間的制約OmniManipは、複雑なタスクを複数の段階に分解し、各段階にはインタラクションプリミティブによって定義された空間的制約を設定します。例えば、「カップにお茶を注ぐ」というタスクでは、システムはそれを「ティーポットをつかむ」と「お茶を注ぐ」の2つの段階に分解し、それぞれの段階に対応するインタラクションポイントと方向を生成します。
OmniManipのプロジェクトアドレス
- プロジェクト公式サイト:https://omnimanip.github.io/
- GitHubリポジトリ:https://github.com/pmj110119/OmniManip
- arXiv技術論文:https://arxiv.org/pdf/2501.03841
OmniManipの応用シナリオ
- 日常生活で物を扱う例えば、お茶を注ぐ、花を生ける、テーブルを片付けるなど。
- 産業オートメーション:精密な三次元操作機能により、複雑な作業の自動化を実現する。
- サービスロボット在宅サービスや医療支援など、構造化されていない環境で業務を行うこと。