project
RoboBrain Orca - Zhiyuanが発表した、マルチモーダル表現による世界モデル。
RoboBrain Orcaは、人工知能アカデミーが発表した、マルチモーダルな世界表現モデルです。従来の次の単語/フレーム/アクションの予測を次の状態の予測に置き換えることで、AIが内部的に統一された世界の可能性表現を構築できるようにします。
RoboBrain Orcaとは何ですか?
北京人工知能研究院(BAAI)が開発したRoboBrain Orcaは、従来の次の単語/フレーム/アクション予測を次の状態予測に置き換えるマルチモーダルな世界表現モデルであり、AIが内部的に統一された世界潜在表現を構築することを可能にします。12万5000時間のビデオと1億6000万件のイベント注釈に基づき、このモデルは無意識的な学習によって自然な状態遷移を捉え、意識的な学習によって意味的因果関係をモデル化し、世界状態を統一された潜在空間に凝縮します。テキスト生成、画像予測、身体化された動作など、マルチモーダルな読み出しをサポートしています。
RoboBrain Orcaの主な機能
- 世界情勢モデルマルチモーダルな世界信号(視覚、言語)を、統一された世界潜在表現空間に符号化する。
- テキスト生成世界の潜在的な表現に基づいて、テキストによる回答と視覚的な質問がLMヘッドを通して出力される。
- 画像予測現在の画像と指示に基づいて、単に美的感覚に優れた画像を生成するのではなく、現実世界でのインタラクション後の次の状態画像を予測する。
- 具現化された行動生成ロボットの動作シーケンスを世界空間表現から読み取ることができ、双腕操作などのOODタスクをサポートする。
RoboBrain Orcaの技術原理
- エンコーダ・デコーダアーキテクチャエンコーダは、統一された世界潜在表現を学習する役割を担い、デコーダはその表現を特定のモード出力に読み込む役割を担います。
- 無意識の学習この手法は、人間のラベル付けに頼ることなく、連続する動画から密で自然な状態遷移を学習し、次のフレームの潜在表現を予測します。
- 意識的な学習言語で記述されたイベントとVQAデータを用いて、疎ではあるが意味的に意味のある状態遷移を学習し、因果関係と意図をモデル化する。
- デュアルパス事前学習これは、観測のみの状態遷移、イベント条件付きの状態遷移、およびVQA応答生成という3つの目標を組み合わせたものです。
- トランクを凍結 + 軽量読み取り事前学習後、Orcaのバックボーンは固定され、MLPアダプタ、LoRA、アクションエキスパートなどの軽量モジュールのみが下流で学習されます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
RoboBrain Orcaの使い方
- リソースを入手するオープンソースコードと事前学習済みモデルの重みファイルは、GitHubリポジトリ(https://github.com/orca-wm)からダウンロードしてください。
- データの準備連続ビデオ、言語イベントの説明、視覚的な質疑応答ペアなど、マルチモーダルな世界信号データを収集する。
- アクセスモジュールOrcaのバックボーンネットワークを固定し、ターゲットシナリオに応じて軽量読み出しモジュール(LMヘッド、画像デコーダ、またはアクションエキスパート)を接続します。
- アプリケーションをデプロイするロボット操作、視覚的な質問応答、状態予測などの下流タスクで推論を実行したり、少数のドメイン内軌跡を使用してトレーニング後の微調整を実行したりします。
RoboBrain Orcaの主な利点
- 統一表現空間言語、イメージ、そして行動は、もはや孤立した作業ではなく、世界という同じ潜在空間からの異なる出口なのである。
- 物理的粘稠度の予測画像予測は、従来の生成モデルによく見られる錯覚や、何もないところから物体が現れるといった現象を避けるため、実際の物理プロセスや状態遷移に重点を置いている。
- ゼロショット汎化能力動作生成タスクでは、事前学習に動作ラベルを一切使用せず、ドメイン内の軌跡200個のみを用いた学習で、専用のベースラインを上回ることができた。
- 継続的な規模拡大の可能性訓練損失は、データ量とモデルサイズが増加するにつれて減少し続けます。現在、使用されているデータは約1割に過ぎず、今後大幅な改善の余地があります。
RoboBrain Orcaのプロジェクトアドレス。
- プロジェクト公式サイト:https://orca-wm.github.io/
- GitHubリポジトリ:https://github.com/orca-wm/Orca
- ハギングフェイスモデルライブラリ:https://huggingface.co/papers/2606.30534
- arXiv技術論文:https://arxiv.org/pdf/2606.30534
RoboBrain Orcaの競合製品との比較
| 寸法 | Orca | V-JEPA 2.1 |
|---|---|---|
| 機構 | BAAI(人工知能のバランス) | Meta AI |
| コアパラダイム | 次状態予測(状態遷移モデリング) | 次フレーム予測(ビデオ予測) |
| 学習パス | 無意識的学習+意識的学習(二重経路) | 自己教師ありビデオ特徴学習 |
| データスケール | 12万5000時間の動画+1億6000万件のイベント注釈 | 大規模なラベルなし動画 |
| 下流サポート | テキスト、画像、アクションの3つのモードによる読み出し | 主に視覚と運動表現をサポートする |
| 行動創出 | メインブランチを固定することで、わずか200の軌跡でOODの一般化を実現できます。 | 微調整のためには、より多くのロボットデータが必要です。 |
| 状態遷移の理解 | イベントレベルの因果関係と意味状態遷移の明示的なモデリング | ピクセルレベルおよびフィーチャレベルの一貫性を重視 |
RoboBrain Orcaの応用事例
-
ロボット操作計画世界の状態遷移に関する理解に基づき、引き出しを開けたり服を畳んだりといった複雑な対話型タスクを完了させるための、ロボットアームの物理的な動作を生成する。
-
自動運転の決定交通状況における車両と歩行者の状態変化を予測することで、潜在的なリスクを事前に予測し、安全な運転ルートを計画することができる。
-
具現化されたエージェントのトレーニング汎用的な世界表現インターフェースとして、さまざまなロボットプラットフォーム向けに事前学習済みの知識を提供し、新しいタスクのためのデータ取得コストを削減します。
-
インタラクティブビデオの理解自然言語による指示に基づいて動画のその後の展開を予測し、因果推論、質問応答、および事象展開の推論をサポートします。
-
物理シミュレーションとデジタルツイン産業用仮想環境シミュレーションおよび物理プロセスシミュレーションのための、合理的かつ予測可能な世界状態モデルを構築する。