project
Lingbot-VA - Ant Lingbo Technologyによるオープンソースのビデオおよびアクションワールドモデル。
LingBot-VAは、AntLingbo Technologyがオープンソース化した、汎用ロボット制御のための世界初の因果的ビデオアクションワールドモデルです。このモデルは、ビデオワールドモデリングとポリシー学習を自己回帰フレームワークに統合し、ロボットが同時に予測することを可能にします。
Lingbot-VAとは何ですか?
LingBot-VAは、Antminer Technologyがオープンソース化した、汎用ロボット制御のための世界初の因果的ビデオアクションワールドモデルです。このモデルは、ビデオワールドモデリングとポリシー学習を自己回帰フレームワークに統合することで、ロボットが将来の状態を予測し、同時に高精度な閉ループ制御を実行できるようにします。わずか30~50回の実世界でのデモンストレーションで新しいスキルを学習でき、長期タスク、データ効率の高い事後学習、汎化能力において、主流のベンチマークモデルを大幅に上回ります。
lingbot-VAの主な機能
- 統合型ビデオモーションモデリングこれは、視覚的な動的予測と行動実行を単一のフレームワークに統合することで、「想像と行動を同時に行う」閉ループ制御を実現する。
- 長期的なタスク実行このモデルは、朝食の準備や荷物の開梱など、複数のステップからなる計画を必要とする複雑なタスクの処理に優れており、長期記憶能力を備え、ループ状態に惑わされることもありません。
- 高効率な研修後新しいスキルは、わずか30~50回の実際のデモンストレーションで習得でき、成功率はベースラインモデル(π₀.₅など)よりも約20%高くなります。
- シナリオ横断的な一般化このモデルは、精密な操作(試験管の挿入、ネジのピックアップ)、柔軟な物体の操作(衣服の折りたたみ)、および関節のある物体の制御(引き出しの開閉)に対応しています。
lingbot-VAの技術原理
- 自己回帰拡散アーキテクチャLingBot-VAは、視覚的な動的予測と行動推論を単一のインターリーブされたシーケンスに統合する自己回帰拡散フレームワークを採用しており、ロボットが将来の状態について推論し、正確な閉ループ制御を実行することを可能にし、ビデオ生成と行動決定の深い融合を実現しています。
- 3段階処理フレームワークこのフレームワークは3つの段階で構成されています。自己回帰型ビデオ生成モジュールは、現在の観測と言語コマンドに基づいて将来のフレームを予測します。逆動力学モデル(IDM)は、予測されたビデオから特定のアクションをデコードします。アクションが実行された後、ビデオKVキャッシュは実際の観測に置き換えられ、モデルが実際の結果に固定され、閉ループ制御が形成されます。
- 逆動力学モデルIDMは予測された動画から動作を正確に解読することができ、異なる環境や異なるロボット本体間で優れた汎化能力を発揮し、「想像」と「実行」をつなぐ重要な架け橋としての役割を果たします。
- 実データによる事前学習このモデルは、大規模なロボットの動画・動作データセットで事前学習されており、豊富な視覚的ダイナミクスを学習することで、物理世界の進化がどのように機能するかを理解するための確固たる基盤を築いています。
lingbot-VAのプロジェクトアドレス
- プロジェクト公式サイト:https://technology.robbyant.com/lingbot-va
- GitHubリポジトリ:https://github.com/Robbyant/lingbot-va
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/robbyant/lingbot-va
- 技術論文:https://github.com/Robbyant/lingbot-va/blob/main/LingBot_VA_paper.pdf
lingbot-VAの応用シナリオ
- 家族の長期的な課題LingBot-VAは、朝食の準備や荷物の開梱など、複数の手順を要する計画と長期記憶を必要とする複雑な家庭内の作業を実行できます。
- 高精度産業オペレーションこのモデルは、試験管の挿入やネジのピックアップなど、サブミリメートルレベルの制御精度が求められる精密な産業用途に適しています。
- フレキシブルオブジェクト処理LingBot-VAは、折り畳まれた衣服などの変形可能な物体を扱い、材料特性を理解し、動的な変形プロセスに適応することができます。
- ヒンジ付きオブジェクトとの相互作用このモデルは、引き出しを開けるなどの機械的な動作をサポートし、拘束条件と運動学の関係を正確に処理します。
- 少数のサンプルで迅速な適応が可能このモデルは、わずか30~50回のデモンストレーションで新しいスキルを習得できるような、データ集約型のシナリオに特に適しています。