project
LingBot-VLA 2.0 - AntLingboによってオープンソース化された、新世代の具現化されたインテリジェントベースモデル。
LingBot-VLA 2.0は、AntLingbo Technologyがオープンソース化した新世代の具現化されたインテリジェントベースモデルです。50,000時間の実機データと10,000時間の人間操作データを含む、60,000時間分の事前学習データに基づいており、17ブランドの20種類のロボットを網羅しています。
LingBot-VLA 2.0とは何ですか?
LingBot-VLA 2.0は、Antminer Technologyがオープンソース化した新世代の具現化されたインテリジェントベースモデルです。50,000時間の実機データと10,000時間の人間操作データを含む60,000時間の事前学習データに基づいており、17ブランドの20種類のロボット構成をカバーし、シングルアーム/デュアルアーム、二足歩行/車輪、および頭部、腰部、シャーシなどの多自由度動作をサポートしています。このモデルは、疎なMoEアーキテクチャと統一されたモーション空間を採用しており、GM-100デュアルアーム評価と長距離移動操作タスクの両方でπ0.5とGR00T N1.7を上回り、RTX 4090での推論時間は130ミリ秒未満です。
LingBot-VLA 2.0の主な機能
-
20種類以上の構成の一般化17のブランドから提供される20種類のロボット構成に対応しており、単腕型、双腕型、二足歩行型、車輪型など、様々な形態を網羅しています。
-
多自由度制御頭部、腰部、エンドエフェクター、シャーシ、アーム、グリッパーなど、全身の自由な動きをサポートします。
-
両腕の協調動作GM-100評価において、タスク進捗スコアと成功率で競合他社をリードしている。
-
長距離移動作戦冷蔵庫の整理やコンロの掃除など、さまざまな分野にわたる長時間の作業の進行を支援します。
-
効率的な推論展開学習済みのバージョンでは、RTX 4090上で推論時間を130ミリ秒未満に抑えることができた。
LingBot-VLA 2.0の技術的原理
- 大規模な異種データを用いた事前学習90,000時間分の生データから、60,000時間分の高品質データが抽出された。これには、20種類のロボット構成による50,000時間分の実際の機械操作データと、さまざまな物理的相互作用シナリオを網羅した10,000時間分の人間による一人称視点操作ビデオが含まれる。
- 統一された行動空間表現20種類の異なるロボット構成を、アーム、EEF、グリッパー、ムーブ、ウエスト、ヘッド、ハンドなどの共通の動作次元に整合させることで、オントロジー全体にわたる拡張可能なトレーニングを実現します。
- スパースMoEアーキテクチャ本モデルは、合計16億個のパラメータと6億個の活性化パラメータを持つ疎なハイブリッドエキスパートアーキテクチャを採用しています。同じ活性化パラメータ予算の下で、トレーニング損失と検証アクションエラーは、密な6億パラメータモデルよりも大幅に低く、パフォーマンスと推論効率のバランスが取れています。
- 二重クエリ蒸留知覚予測デュアルクエリ蒸留メカニズムは、現在および将来のRGB、深度マップ、およびDINOの視覚表現を同時に予測し、動的な環境の時間的シーケンスを理解するモデルの能力を向上させます。
- 多段階データクリーニングパイプライン生データはロボットストリームと自己中心ストリームに分割され、トレーニングデータは、動作と状態の平滑化フィルタリング、高品質ビデオスクリーニング、VLMフィルタリング、手の軌跡の再構築と標準化などの段階を経て段階的に洗練されます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
LingBot-VLA 2.0 の使い方
- モデルの重みを取得するLingBot-VLA 2.0の事前学習済みモデルをダウンロードするには、Hugging FaceまたはModa Communityにアクセスしてください。
- オープンソースコードのクローンGitHubから推論およびデプロイ用のコードを入手し、READMEを読んで環境の依存関係を理解してください。
- ロボット本体の設定公式にサポートされている20種類の構成リストに基づいて、対応するロボットのハードウェアとセンサーを準備してください。
- 導入理由モデルをRTX 4090、またはSunrise S600、Jetson Thor/Orinなどの適応型エッジコンピューティングプラットフォームにロードします。
- 運用タスクを実行する統合モーションインターフェースを介してロボットにコマンドを送信し、両腕操作や長距離移動タスクを実行します。
LingBot-VLA 2.0の主な利点
-
最も強力なクロスコンフィギュレーション汎化能力これは20種類のロボット構成に対応しており、業界で最も多くの種類のボディをサポートするオープンソースのVLAモデルの一つです。
-
デュアルアームとモバイルオペレーションをリードGM-100デュアルアーム評価と長距離移動運用クロスドメイン評価の両方において、π0.5とGR00T N1.7を上回った。
-
推論効率の最適化疎なMoEアーキテクチャにより、1.6Bモデルで0.6Bパラメータのみをアクティブ化することが可能になり、RTX 4090上で130ms未満の推論時間を実現できるため、エッジチップに適しています。
-
生態系への適応は完璧です当社は、Digua Sunrise S600やNVIDIA Jetson Thor/Orinといった主流チップの対応を完了し、LejuやTitanium Tigerなどのチップメーカーとの協力関係を構築しました。
LingBot-VLA 2.0のプロジェクトアドレス
- プロジェクト公式サイト:https://technology.robbyant.com/lingbot-vla-v2
- GitHubリポジトリ:https://github.com/robbyant/lingbot-vla-v2
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/robbyant/lingbot-vla-v2
- arXiv技術論文:https://arxiv.org/pdf/2607.06403
LingBot-VLA 2.0と類似の競合製品との比較
| 比較対象寸法 | LingBot-VLA 2.0 | GO-2 |
|---|---|---|
| 開発者 | アント・リンボ・テクノロジー | AgiBot (智元机器人) |
| モデルアーキテクチャ | スパースMoE、総パラメータ数16億、活性化パラメータ数06億 | ViLLAアーキテクチャ、非同期デュアルシステム(低周波の低速システム計画+高周波の高速システム実行) |
| コアイノベーション | 統合アクション空間+デュアルクエリ蒸留による知覚予測 | 行動思考連鎖:行動空間内における直接的な推論と計画。 |
| 事前学習データ | 60,000時間(機械の実稼働時間50,000時間+人間の操作時間10,000時間) | 数万時間(AgiBot Worldのデータセットに基づくと、GO-1ステージは100万回以上の軌跡を描いている)。 |
| 構成サポート | ロボットの構成は20種類、ブランドは17種類(単腕型/双腕型/二足歩行型/車輪型) | 主にLogic Source社独自のプロトタイプ(G1/G2など)との互換性があり、他社製品との互換性は限定的です。 |
| デュアルアーム操作 | GM-100の評価では、進捗スコアと成功率の両方がπ0.5およびGR00T N1.7よりも優れていた。 | GM-100のデータは一般には公開されていません。LIBEROのベンチマーク平均成功率は98.5%です。 |
| 長距離移動作戦 | 複数のドメインにわたるタスクの進捗スコアと成功率でトップ | 焦点は計画から実行までの閉ループにあり、長距離移動に関する一般的なデータは明示的に開示されていない。 |
LingBot-VLA 2.0の応用シナリオ
-
小売サービス薬局やスーパーマーケットなどの場所で、棚の整理、商品の取り出し、在庫数のカウントといった、両腕を使った作業を実行できます。
-
物流倉庫小包の仕分け、貨物の取り扱い、長距離移動式積み下ろしなどの作業を行い、車輪付き移動式シャーシにも対応しています。
-
工業生産これは、精密部品の組み立て、工具のピッキングと配置、機器の検査など、高い精度と多自由度協調を必要とする作業を完了するために使用されます。
-
ホームサービス冷蔵庫の整理、コンロの掃除、共同作業など、日常的な家事をサポートします。
-
科学研究開発これは、大学や研究機関が、具現化された知能アルゴリズムやオントロジー適応研究の反復開発を加速するためのオープンソースのVLAプラットフォームを提供するものです。