project
LingBot-Video - AntLingbo オープンソースビデオモデル(身体化された知能向け)
LingBot-Videoは、Antminerが開発した、世界初のオープンソースのMoE(Mountained Intelligence)ビデオ生成基盤モデルです。DiT(Diuntain Data)とMoEアーキテクチャをベースとしたこのモデルは、合計300億個のパラメータを持ち、そのうち約30億個のみが有効化されており、大容量と効率的な推論のバランスが取れています。
LingBot-Videoとは何ですか?
LingBot-Videoは、Antminerが開発した、世界初のオープンソースのMoE(Mountained Intelligence)ビデオ生成モデルです。DiT(Diuntain Intelligence)とMoEを組み合わせたアーキテクチャを採用し、合計300億個のパラメータのうち、約30億個のみをアクティブ化することで、大容量と効率的な推論を両立させています。7万時間分のインターネットおよびロボットデータを統合し、多次元強化学習報酬を用いて物理的な妥当性とタスク完了を整合させることで、RBenchとPhysics-IQの両ベンチマークで1位を獲得しています。現実世界の物理法則に準拠したロボットの動作やインタラクションのビデオを生成できます。
LingBot-Videoの主な機能
-
テキスト/画像からビデオへの変換オープンワールドシナリオと身体化されたタスクを網羅し、T2V、TI2V、T2Iの統一的な生成をサポートします。
-
ロボットの動作予測ロボットアーム、ヒューマノイドロボット、四足歩行ロボットなどの動作シーケンスと接触状態を生成します。
-
物理シミュレーションビデオ生成物質の変形、流体の動き、光の反射など、実際の物理現象をシミュレートします。
-
シミュレーションデータの合成ロボットの戦略訓練向けに、大規模かつ低コストで、物理的に適切なビデオデータを提供する。
-
ワールドモデルリサーチ物理シミュレーターとして、戦略評価と行動計画策定を支援する。
LingBot-Videoの技術原理
- DiT + スパースMoEアーキテクチャこのモデルは、シングルストリーム拡散トランスフォーマーを使用して視覚潜在コードと条件トークンを均一に処理し、Dense FFN を MoE に置き換えています。合計 30B 個のパラメータのうち、約 3B 個のみがアクティブ化され、推論速度が約 3 倍向上します。128 個のきめ細かいルーティングエキスパートが共有エキスパートと連携して、トップ K ルーティングによりさまざまな物理パターンを捉え、サブタスクからの干渉を回避します。
- データプロファイリングエンジンと7万時間分の蓄積データ膨大な量のインターネット動画に基づき、VLA、VLN、Egoなどのロボットデータが導入され、器用な操作、ナビゲーション、一人称視点でのインタラクションを網羅することで、モデルが動作と環境変化の間の本質的な関係を学習できるようになる。
- 多次元強化学習報酬アライメントトレーニング段階では、美観、指示への追従、動作の一貫性に加えて、物理的な妥当性とタスク完了に対する報酬が導入され、生成された結果が実際の物理法則とロボットのタスク要件に適合するように、現実世界のビデオが選好シグナルとして使用されます。
- 統合入力と3D RoPET2I/T2V/TI2Vタスクは、単一のシーケンストークンに統合されます。条件付きトークンとビジュアルトークンは、マルチモーダル3D MM-RoPEを介して重複しない時空間座標にマッピングされ、タスク固有のアーキテクチャ要件を排除しつつ、空間的な局所性と時間的な順序を維持します。
- カスケード生成と安定トレーニングこのモデルは、ベースジェネレータとリファイナーをカスケード接続した設計を採用しています。ベースジェネレータはコンパクトな潜在コードを生成し、リファイナーは詳細を強調します。QK-ノルム、AdaLN-Single変調、および補助損失のないシーケンスレベルの負荷分散戦略と組み合わせることで、長いシーケンスと高解像度の安定した学習を実現します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
LingBot-Videoの使い方
- 環境準備ローカル環境またはサーバー上で、Python 3.10以降およびCUDA環境が正しく構成されていること、そして十分なビデオメモリが確保されていることを確認してください。
- リポジトリのクローン作成LingBot-Videoの公式コードリポジトリをGitHubからローカルの作業ディレクトリにプルしてください。
- 依存関係をインストールしますプロジェクトのrequirements.txtファイルに従って、必要な深層学習および推論ライブラリをインストールしてください。
- ダウンロード重量HuggingFaceまたはModelScopeから、対応するサイズのモデルチェックポイントファイルを取得します。
- 準備に関するヒントテキストによる説明、参照画像、または構造化された制御信号を、モデルがサポートする入力形式に整理します。
- 推論を実行中モデルをロードし、生成スクリプトを実行して、具現化された知能またはオープンワールドビデオを出力します。
LingBot-Videoの主な利点
-
世界初のオープンソースの具現化されたビデオMoEモデルロボット向けオープンソースビデオインフラモデルのギャップを埋める。
-
容量と効率の分離パラメータ規模が30Bの場合、実際にアクティブになるのは3Bのみであり、その結果、推論速度は同規模のDenseアーキテクチャと比較して約3倍高速になり、リアルタイムのインタラクション要件を満たします。
-
物理的合理性が主導しているRBench(0.620)とPhysics-IQ Verifiedの両方で1位を獲得し、Wan2.6、Seedance 1.5 Pro、Cosmos 3などを上回った。
-
データ特殊化7万時間分のロボットデータの注入により、モデルは単なる視覚的なスタイルだけでなく、動作と環境の因果関係を理解できるようになった。
-
統合タスクフレームワークT2I/T2V/TI2Vの単一モデル統合処理により、マルチタスク展開のコストが削減されます。
LingBot-Videoのプロジェクトアドレス
- プロジェクト公式サイト:https://technology.robbyant.com/lingbot-video
- GitHubリポジトリ:https://github.com/Robbyant/lingbot-video
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/robbyant/lingbot-video
- arXiv技術論文:https://arxiv.org/pdf/2607.07675
LingBot-Videoと類似の競合製品との比較
| 寸法 | LingBot-Video | NVIDIA Cosmos 3 Super |
|---|---|---|
| 研究開発の背景 | 身体性を重視したインテリジェントなビデオ生成に特化したオープンソース技術であるRobbyantが、オープンソースコードを公開した。 | NVIDIAが2026年6月に発表したこのモデルは、物理AIやロボットのトレーニングのための、完全なモーダル世界モデルである。 |
| 建築設計 | DiTに基づくシングルストリームスパースMoEは、T2I/T2V/TI2Vの統一処理を提供する。 | 混合型トランスフォーマー(MoT)デュアルタワーアーキテクチャは、テキスト処理に自己回帰型トランスフォーマーを、連続的なモダリティ処理に拡散型トランスフォーマーを使用します。 |
| パラメータサイズ | パラメータ総数は30Bで、そのうち約3Bがアクティブであり、容量と効率の分離を実現している。 | 合計パラメータ数は64B(スーパー版)、ナノ版は16Bで、すべてのパラメータが有効になっています。 |
| モーダルサポート | テキスト、画像、動画。視覚生成と動作条件モデリングに焦点を当てる。 | テキスト、画像、動画、音声、アクションシーケンスは一律に処理され、あらゆるモードの入出力に対応します。 |
| トレーニングデータ | 7万時間分のインターネット動画データに加え、VLA/VLN/Egoロボットのデータを用いて、動作や環境に関する動的な事前知識を組み込む。 | 約10億枚の画像、4億本の実写および合成動画、環境音を含む20兆個のトークン。ロボット工学、運転、倉庫管理などのシナリオを網羅している。 |
| オープンソースレベル | モデルの重み付け、コード、技術レポートはすべてオープンソースであり、コミュニティによる二次開発のために自由にダウンロードして使用できます。 | モデルの重みとコードはOpenMDW 1.1ライセンスの下でオープンソースとして公開されており、商用利用が可能です。また、合成データセットとベンチマークが付属しています。 |
| RBenchのパフォーマンス | 0.620というスコアで、公開されている比較の中で1位にランクインしている。 | 0.581というスコアは、いくつかの評価において、オープンソースモデルの中でトップクラスにランクインしている。 |
| Physics-IQ | 物理学IQ検証評価で1位を獲得した。 | I2Vスコアが43.8、V2Vスコアが59.7という結果で、それぞれのリーダーボードにおいて最先端(SOTA)のランキングを獲得した。 |
| 推論効率 | 合計300億個のパラメータのうち、実際にアクティブ化されるのはわずか30億個であるため、同規模のDenseアーキテクチャと比較して推論速度は約3倍高速化されます。 | 64Bの全パラメータを有効にするには、H100レベルのハードウェアサポートが必要です。Nanoバージョンは、推論速度の向上に最適化されています。 |
LingBot-Videoの応用シナリオ
-
ロボットシミュレーション訓練高価な実データ収集に代わり、ロボットアームやヒューマノイドロボット向けに、物理的に妥当な動作動画を生成する。
-
シミュレーションデータの合成政策事前学習およびデータ拡張のために、多様なシーンと行動軌跡をバッチ処理で生成する。
-
ワールドモデルリサーチ物理世界の予測器として、想像力に基づいたロボットの計画立案と意思決定を支援する。
-
自動運転シミュレーション知覚アルゴリズムの検証に使用するため、物理法則に準拠した道路との相互作用および自己視点の動画を生成する。
-
サービスおよび製造倉庫業務、医療、ホームサービスなどのシナリオにおける人間とコンピュータの相互作用プロセスをシミュレーションし、タスク戦略を最適化する。