project
LingBot-VA 2.0 - Ant Lingboによってリリースされたネイティブワールドアクションモデル。
LingBot-VA 2.0は、Ant Lingbo社が発表した業界初の、身体化されたネイティブワールド動作モデルです。自己回帰アーキテクチャに基づいており、ゼロから事前学習されているため、ロボットは「推論と行動を同時に行う」という汎用的な制御能力を備えています。
LingBot-VA 2.0とは何ですか?
LingBot-VA 2.0は、AntLingboが発表した業界初の具現化されたネイティブワールドアクションモデルです。自己回帰アーキテクチャに基づいてゼロから事前学習されており、ロボットが「推論と動作を同時に行う」という汎用的な制御能力を備えています。このモデルは、因果的DiT+スパースMoEアーキテクチャを採用し、合計153億個のパラメータと推論時のわずか25億個のアクティベーションで構成されています。RoboTwin 2.0ベンチマークのデュアルアームタスクで93.6%の成功率を達成し、シングルGPUでの推論は150Hzに達します。
LingBot-VA 2.0の主な機能
-
視覚運動関節予測将来の世界情勢と次のロボットの行動を同時に予測することで、「予測制御」を実現する。
-
長期ミッション計画高次元プランナーは、複雑な目標を構造化されたサブタスクに分解し、両方の処理アームと状態メモリによる並列実行をサポートします。
-
リアルタイム閉ループ制御先見推論は、現在のアクションを実行しながら次のステップを事前に計算する非同期推論メカニズムであり、逐次的な遅延を排除します。
-
ドメイン横断的な一般化クリーンなシナリオとドメインランダム化シナリオの両方において93%以上の成功率を維持し、現実世界の環境の変化にも適応します。
-
精密な操作ポテトチップスなどの薄くて壊れやすい物体を、高精度な力制御で把持することをサポートします。
LingBot-VA 2.0の技術的原則
- セマンティックビジョン - アクションセグメンターピクセル再構成のみを追求する従来のVAEとは異なり、ワードセグメンターは視覚圧縮において意味情報と動作情報の整合を強制します。逆動力学モデルと順動力学モデルを通して連続フレームから動作監視情報を暗黙的に抽出し、ラベル付けされていないネットワーク動画から学習信号を提供することを可能にします。
- 因果的事前訓練パラダイム双方向ビデオ生成モデルに対する後処理による修正を放棄し、モデルは自己回帰因果アーキテクチャを使用して初日からトレーニングされます。これにより、モデルは過去しか見ることができないタイムラインに厳密に従って学習し、ロボットの閉ループ制御の一方向の物理的現実と自然に一致します。
- スパースMoEアーキテクチャビデオバックボーンはMixture-of-Expertsを使用しており、合計約130億個のパラメータがありますが、推論に利用されるのは19億個のみです。一貫性蒸留や低精度コンパイルなどの高速化技術と組み合わせることで、推論レイテンシは965msから142ms/チャンクに短縮されます。
- 先見推論:非同期推論この設計では、閉ループの予測、実行、および修正が行われます。ロボットが現在の動作を実行している間、モデルは並行して次のステップを予測し、実際の観測データが返されたときに再較正を行うことで、単なる推測による物理的なドリフトを回避します。非同期制御周波数は225Hzに引き上げられています。
LingBot-VA 2.0の使い方
-
公式ウェブサイトをご覧くださいモデルのアーキテクチャ、デモビデオ、技術的な詳細については、https://technology.robbyant.com/lingbot-va-v2 をご覧ください。
-
コードを取得GitHubリポジトリにアクセスして、オープンソースコードと技術レポートをダウンロードし、因果的DiT、スパースMoE、および予測推論の実装の詳細について理解を深めてください。
-
環境展開高性能GPUを搭載したサーバーまたはワークステーション上で推論環境を構成し、依存関係をインストールし、モデルの重みを読み込みます。
-
ハードウェアアクセスモデルをロボット本体に接続し、カメラの観測ストリームをロボットアーム/グリッパーアクチュエータに接続し、センサーデータのリアルタイム入力を確保する。
-
非同期パイプラインを構成するフォアサイト推論の非同期推論メカニズムを有効にし、モデルが現在のアクションセグメントを実行しながら、次の状態を並行して予測できるようにします。
-
閉ループ校正実際の観測フィードバックチャネルを設定することで、新しい観測データが返されるたびにモデルが予測値を再調整し、物理的なドリフトを回避できるようにする。
-
タスク適応新しいタスクを実行する必要がある場合、少量のロボット動作データが収集され、そのデータは事前学習済みの重みに基づいて微調整されます。
LingBot-VA 2.0の主な利点
-
化身アーキテクチャやデータからトレーニング目標に至るまで、すべてがデジタルビデオ生成モデルの微調整ではなく、現実世界に合わせてカスタマイズされている。
-
リアルタイムかつ効率的シングルGPUによる150Hzの推論は、リアルタイム閉ループ制御の要件を満たします。
-
原因と結果の一貫性厳密な一方向性時間モデリングは、双方向性注意によって引き起こされる動作精度の低下や壊滅的忘却を回避する。
-
データ効率MCPマルチステップターゲット予測は、トレーニングの収束速度を2.3倍向上させ、ロボットのラベル付きデータへの依存度を低減します。
-
フルスタックコラボレーションこれは、LingBot-Depth、LingBot-VLA、LingBot-Videoなどと連携して、知覚・予測・実行の完全な閉ループを形成します。
LingBot-VA 2.0のプロジェクトアドレス
- プロジェクト公式サイト:https://technology.robbyant.com/lingbot-va-v2
- 技術論文:https://github.com/Robbyant/lingbot-va/blob/main/LingBot_VA2_paper.pdf
LingBot-VA 2.0と類似の競合製品との比較
| 寸法 | LingBot-VA 2.0 | ACE-Ego |
|---|---|---|
| 出版社 | 蟻凌波 | DaXiao Robotics × CUHK MMLab |
| モデルの位置特定 | エンボス加工を施したネイティブワールドアクションモデル(VA) | 「一つの脳、複数の形態」エンボス加工オペレーションVLAモデル |
| アーキテクチャロードマップ | 自己回帰因果関係 DiT + 疎な MoE | Qwen3-VL-4B + Flow-Matching Diffusion Action Expert |
| 事前学習方法 | デジタルビデオ生成モデルに頼らず、ゼロベースのネイティブ事前学習から | ハイブリッド型人間一人称視点ビデオ+ロボット/シミュレーションデータ共同事前学習 |
| コアメカニズム | 先見推論:非同期推論、意味論的ビジョン・アクションセグメンター | カメラの空間的動きのアライメント、形態学的条件付きエンコーディング、時間的アライメントブロック、および信頼性を考慮した損失関数。 |
| 総パラメータ数 / 活性化パラメータ数 | 15.3B / 2.5B (スパース活性化) | VLM 4B + Action Expert、約600MB(完全アクティベート済み) |
| 推論速度 | シングルGPU 150Hz(非同期時 225Hz) | 具体的な周波数は明らかにされていないが、4段階のフローマッチング復号処理に基づいている。 |
| RoboTwin 2.0の平均成功率 | 93.6%(Clean 93.8% / Randomized 93.4%) | Easy 91.12% / Hard 90.62% |
LingBot-VA 2.0のアプリケーションシナリオ
-
家庭用サービスロボット机の上を片付けたり、物を元の場所に戻したり、食器を並べたりといった、長期的な家事を行う。長期記憶と腕の協調運動能力を活用して、複雑な日常作業をこなす。
-
産業ダイナミクスキャプチャこの技術により、コンベアベルトや組立ライン上の移動対象物をリアルタイムで把持することが可能になります。このモデルは対象物の将来の位置を予測し、動作のリズムを同期させることで、従来の光電式トリガー方式に取って代わります。
-
精密組立作業このシステムは、材料の完全性を保護するために高精度な視覚サーボ制御を利用することで、チップ、ウェハー、および壊れやすい部品の柔軟な力制御による把持と組み立てを可能にする。
-
人間とコンピュータのインタラクションによるエンターテイメントアイスホッケーの試合やテーブルゲームなど、相手の動きをリアルタイムで予測する必要のある、高頻度のインタラクティブなシナリオをサポートし、ミリ秒単位での反応と戦略調整を可能にします。
-
倉庫物流仕分けこの装置は、変化の激しい倉庫環境において、商品の仕分け、取り扱い、パレット積みを行うことができ、様々なサイズや形状の荷物の一般的な把持ニーズにも対応できる。