project
LingBot-World - AntLingbo Technologyによるオープンソースのインタラクティブな世界モデル
LingBot-Worldは、Ant Lingbo Technologyが開発したオープンソースのインタラクティブな世界モデルです。このモデルは、スケーラブルなデータエンジンを通して大規模なゲーム環境から物理法則と因果関係を学習し、正確なアクション駆動型生成を可能にします。
LingBot-Worldとは何ですか?
LingBot-Worldは、AntLingbo Technologyが開発したオープンソースのインタラクティブワールドモデルです。このモデルは、スケーラブルなデータエンジンを通して大規模なゲーム環境から物理法則と因果関係を学習し、正確なアクション駆動型生成を実現します。約10分間の連続かつ安定した生成をサポートし、応答速度は16FPS、レイテンシは1秒以内に制御されています。また、ゼロショットシーン汎化機能も備えています。このモデルは、希少で高価な実世界トレーニングデータの課題を効果的に解決し、ロボットトレーニング、自動運転シミュレーション、ゲーム開発などに幅広く活用できます。これにより、インテリジェントエージェントは仮想環境での試行錯誤を通して安全かつ効率的に学習することが可能になります。
LingBot-Worldの主な機能
-
高忠実度インタラクティブ生成動きに基づいたきめ細かな生成をサポートし、ユーザーのコマンドに正確に応答し、物理的なリアリズムに準拠した動的なシーンをレンダリングします。
-
長期的な一貫性このモデルは、約10分間連続的かつ安定した生成を実現し、オブジェクトの永続性とシーン構造の完全性を維持することで、「長期的なドリフト」問題を解決します。
-
リアルタイム閉ループ制御このモデルは、1秒あたり16フレームの生成スループットと1秒未満のエンドツーエンド遅延を実現し、キーボードとマウスによるキャラクターと視点のリアルタイム制御をサポートしています。
-
世界規模のイベントが引き金となるテキストコマンドを通じて、天候やスタイルなどの環境変化を動的に調整しながら、幾何学的な関係性を一貫して維持することができます。
-
ゼロショット一般化特定のシナリオに向けたトレーニングを必要とせず、単一の画像を入力するだけで、インタラクティブなビデオストリームを生成できる。
LingBot-Worldの技術原理
-
スケーラブルなデータエンジンこのシステムは、ネットワークビデオのクリーニング機能をUnreal Engineの合成パイプラインと統合し、レンダリングレイヤーからUIの干渉を受けないクリーンな画像を抽出します。同時に、操作コマンドとカメラの姿勢を記録し、モデルが「行動によって環境がどのように変化するか」を学習するための、正確に位置合わせされたトレーニング信号を提供します。
-
多段階トレーニング戦略このモデルは、段階的な最適化と並列化による高速化によってコンテキストメモリ機能を強化し、オブジェクトの永続性とシーン構造の整合性を維持しながら、約10分間の連続的かつ安定した生成を実現します。
-
因果蒸留このモデルは、物理法則と因果関係の論理をその中核に凝縮することで、行動と結果の間の因果関係を深く理解することを可能にすると同時に、16 FPSのリアルタイム推論性能を維持します。
LingBot-Worldプロジェクトのアドレス
- プロジェクト公式サイト:https://technology.robbyant.com/lingbot-world
- GitHubリポジトリ:https://github.com/Robbyant/lingbot-world
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/robbyant/lingbot-world
- 技術論文:https://github.com/robbyant/lingbot-world/blob/main/LingBot_World_paper.pdf
LingBot-Worldの応用シナリオ
- 身体知能トレーニングこれはロボットに低コストで高精度の仮想「訓練場」を提供し、複雑で長期的なタスクにおける試行錯誤学習を支援するとともに、実世界のデータ収集に伴う高コストとリスクという課題を解決します。
- 自動運転シミュレーションこのモデルは、照明や天候などの要素を動的に変化させることで汎化能力を向上させ、実車試験のコストと安全リスクを低減することができる。
- ゲーム開発プレイ可能なリアルタイムシミュレーターとして、開発者がインタラクティブなコンテンツを迅速に生成し、動的なワールドイベントや様式化されたレンダリングを実現できるよう支援します。
- VR/ARシミュレーションこれは、仮想トレーニング、デジタルツイン、および人間とコンピュータのインタラクション研究のための、低遅延かつ高忠実度の没入型環境を提供する。