project
RoboBrain - 人工知能アカデミーが開発した、オープンソースの身体化された脳モデル。
RoboBrainは、北京人工知能研究院(BAAI)が発表したオープンソースの身体化された脳モデルであり、単一機械知能を群知能へと発展させるものです。タスク計画のための基本モデル、運用領域認識のためのA-LoRAモジュール、そして…の3つのモジュールで構成されています。
RoboBrainとは何ですか?
RoboBrainは、北京人工知能研究院(BAAI)が発表したオープンソースの具現化脳モデルであり、単一機械知能を群知能へと進化させるものです。タスク計画用の基本モデル、操作可能領域認識用A-LoRAモジュール、軌道予測用T-LoRAモジュールの3つのモジュールで構成されています。RoboBrainは多段階学習戦略を採用し、長期の履歴フレームメモリと高解像度画像認識能力を備え、抽象的な指示を具体的な動作にマッピングできます。タスク計画、操作可能領域認識、軌道予測などの評価タスクにおいて優れた性能を発揮しています。
RoboBrainの主な機能
- 計画能力複雑な操作手順を、管理しやすいサブタスクに分解します。例えば、「ティーポットを持ち上げてカップに水を注ぐ」という手順を、「ティーポットに近づいて持ち上げる」「注ぎ口がカップの縁に合うようにティーポットを動かす」「ティーポットを傾けて水を注ぐ」といったステップに分解します。
- 手頃な価格に対する認識ティーポットの取っ手や注ぎ口など、インタラクティブなオブジェクトの操作可能な領域を特定し、解釈する。
- 軌道予測操作を完了するために必要な完全な軌跡、例えば現在の位置からティーポットの取っ手までの移動軌跡を予測します。
RoboBrainの技術原理
- モデルアーキテクチャRoboBrainはLLaVAフレームワークに基づいており、以下の3つの主要モジュールで構成されています。
- ビジュアルエンコーダーSigLIPモデルは、入力画像を視覚的特徴に符号化するために使用されます。
- プロジェクター視覚的特徴は、2層のMLPを使用して、テキスト埋め込みと同じ次元にマッピングされます。
- 大規模言語モデル(LLM)テキスト命令の理解と生成には、Qwen2.5-7B-Instructモデルを採用しています。
- 多段階トレーニング戦略RoboBrainは、ロボット操作タスクにおける性能を向上させるために、多段階のトレーニング戦略を採用している。
- OneVisionトレーニング大規模な汎用画像処理データセットを用いて事前学習を行い、基本的な視覚理解能力と言語理解能力を開発する。
- ロボットタスクトレーニングShareRobotデータセットの微調整により、タスク計画、運用エリア認識、および軌道予測機能が向上します。
- データセットのサポートRoboBrainの学習には、タスクプランニング、操作可能なオブジェクト領域、エンドエフェクタの軌道に関する多次元アノテーションを含む、高品質で多様なデータセットであるShareRobotデータセットが利用されています。このデータセットは、複雑なタスクにおけるモデルのパフォーマンスをサポートするために、多様性と精度が綿密に設計されています。
- 推論プロセス実際のアプリケーションでは、RoboBrainはまず視覚入力を感知し、入力された指示を実行可能なサブタスクの連続に分解し、次に動作可能領域の認識と軌道予測を行います。この段階的な処理アプローチにより、モデルは抽象的な指示を具体的なロボット動作に効率的に変換することができます。
RoboBrainのプロジェクトアドレス
- プロジェクト公式サイト:https://superrobobrain.github.io/
- GitHubリポジトリ:https://github.com/FlagOpen/RoboBrain
- ハギングフェイスモデルライブラリ:https://huggingface.co/BAAI/RoboBrain
- arXiv技術論文:https://arxiv.org/pdf/2502.21257
RoboBrainの応用事例
- 複数ロボットによる協働RoboBrainは、複数の異なるタイプのロボット間の効率的な連携を可能にする、クロスオントロジーの具現化された小脳コラボレーションフレームワークであるRoboOSの中核となる脳モデルです。
- 複雑なタスク計画RoboBrainは、複雑な操作指示を「植物に水をやる」「鉢を引出しに入れる」「同じ色のブロックを異なる隅に配置する」といった、管理しやすいサブタスクに分解できます。また、RoboBrainは詳細な計画手順を生成することも可能です。
- 作戦可能領域の認識RoboBrainは、インタラクティブなオブジェクトの操作可能な領域を識別し、解釈することができます。例えば、「同じ色のブロックを異なる角にクラスタリングする」というタスクでは、RoboBrainは異なる色のブロックの操作可能な領域を識別し、合理的な操作経路を計画することができます。
- リアルタイムフィードバックと最適化RoboBrainは、RoboOSのエッジクラウド連携機能と組み合わせることで、実行に関するフィードバックをリアルタイムで受信し、環境の変化に応じて戦略を動的に調整し、タスク計画を継続的に最適化し、堅牢性を向上させることができます。