project
LiveWorld - アデレード大学などが開発した、生成型ビデオワールドモデル。
LiveWorldは、アデレード大学、オーストラリア国立大学、その他の機関が共同開発した生成型ビデオワールドモデルです。その中核機能は、視野外ダイナミクスの問題を解決することです。従来のモデルでは、オブジェクトがカメラの視野から外れると、その状態が固定されてしまいます。
LiveWorldとは何ですか?
LiveWorldは、アデレード大学、オーストラリア国立大学、およびその他の機関が共同開発した生成型ビデオワールドモデルです。その核となるソリューションは、視野外のダイナミクスの問題に対処することです。従来のモデルでは、オブジェクトがカメラの視野から外れると、その状態が固定されてしまいます。LiveWorldは、ワールドの進化を観測やレンダリングから明示的に分離することで、動的なエンティティが視界外であっても前進し続けることを可能にし、真の4Dワールドシミュレーションを実現します。
LiveWorldの主な機能
-
動的エンティティ検出Qwen3-VLとSAM3に基づいて、動画内の人、動物、車両などの動く物体を自動的に識別します。
-
仮想モニター登録新たに発見された動的エンティティごとに、固定視点のモニターを登録し、その状態変化を継続的に追跡します。
-
視野外における動的な進化カメラが移動した後も、モニターは状態を固定するのではなく、バックグラウンドで物理的な動作(犬が食事を終えて立ち去るなど)を継続して実行します。
-
静的環境蓄積Stream3R SLAMフレームワークは、静的な背景を段階的に融合してグローバルな3D点群を作成し、空間的な基盤を提供するために使用されます。
-
状態認識レンダリング進化させた動的4D点群と静的3D点群は、ターゲットカメラの軌跡に投影され、一貫性のある観測フレームが生成される。
-
外観の一貫性を維持する: 外観LoRAを使用して過去の参照フレームを取得し、長いシーケンス内でエンティティの識別情報やテクスチャがずれないようにします。
LiveWorldの技術原則
-
世界国家のデカップリングこれは、2Dフレームを直接予測するのではなく、静的な3D背景と動的な4D要素の構造化された近似として世界を表現する。
-
進化 - 分離の表現ワールドはまず進化演算子によってグローバルな状態を更新し、次にカメラの姿勢とレンダリング演算子を組み合わせることによって観測結果を生成する。これにより、2つのプロセスが分離される。
-
監視機構仮想モニターを固定アンカーポイントに配置し、Evolution Engineを使用してローカルイベントを自律的に実行します。
-
SLAM空間記憶このシステムは、フィードフォワードSLAMフレームワークであるStream3Rを使用して、静止した背景をリアルタイムで融合し、長期的な再訪や視点の変化をサポートします。
-
状態注入生成投影されたジオメトリは、ステートアダプタを介してビデオ拡散モデルに注入され、オブジェクトの位置、構造、および動きを制約します。
-
クローズドループ生産ラインこのプロセスは、新しい領域を観察し、動的なイベントを記録し、バックグラウンドの進行状況を監視し、最新の状態を表示するという一連の動作から成り、継続的なループを形成します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
LiveWorldの使い方
- 環境準備GitHubからLiveWorldのコードリポジトリをクローンし、PyTorch、Stream3R、Qwen3-VL、SAM3、Wan2.1-14B-T2Vなどの必要な依存関係をインストールします。
- 入力構成先行するビデオフレームを初期観測として指定し、ターゲットカメラの軌跡と、動的エンティティのその後の動作を説明するテキストプロンプトを定義します。
- 動的検出このシステムはQwen3-VLとSAM3を呼び出し、直前のフレームを自動的にスキャンして、人、動物、車両などの動的な対象物を識別します。
- モニター登録新たに発見された各エンティティは、その場所に固定された視点を持つ仮想モニターを登録し、それが視野外におけるその後の進化のアンカーポイントとして機能する。
- 視野外の進化カメラが軌道に沿って移動するにつれて、モニターはバックグラウンドで進化エンジンを引き続き使用してその領域の次のビデオを生成し、状態を固定するのではなく物理的な動きを進めます。
- 静的メモリの構築このシステムはStream3R SLAMを並列実行し、履歴で観測された増分的な背景領域を統合して、グローバルな静的3D点群を作成します。
- 状態レンダリングカメラが目標位置に到達すると、システムは進化させた動的4D点群と静的3D点群を目標の視点に投影し、ステートアダプタとアピアランスLoRAを介して最終的な観測フレームを生成します。
LiveWorldの主な利点
-
静的な世界という前提を打ち破るこれは、「視野外のダイナミクス」という問題が初めて定式化され解決されたものであり、視野内でのみ進化する既存のモデルの限界を打ち破るものである。
-
長期連続イベントの一貫性LiveBenchベンチマークの2回目の再テストでは、VQA-Accは54.620に達し、Spatiaなどの競合他社を大きく上回りました。
-
複数イベントの並行進行視野外のさまざまなイベントを同時に発生させる複数のモニターをサポートし、26%の完全成功率を達成します。
-
新しい視点 幾何学的一貫性動的点群の面取り距離は0.135に縮小され、新しい視点から再訪した場合でも正しい空間位置が維持されます。
-
モジュール式で拡張可能静的メモリ、動的進化、状態レンダリングの3つのモジュールは連携して動作し、それぞれ独立して最適化および置換が可能です。
LiveWorldのプロジェクトアドレス
- プロジェクト公式サイト:https://zichengduan.github.io/pages/LiveWorld/index.html
- GitHubリポジトリ:https://github.com/ZichengDuan/LiveWorld
- ハギングフェイスモデルライブラリ:https://huggingface.co/ZichengD/LiveWorld
- arXiv技術論文:https://arxiv.org/pdf/2603.07145
LiveWorldの類似製品の比較
| 比較対象寸法 | LiveWorld | Matrix-Game-2.0 |
|---|---|---|
| 視野外のダイナミクス | 継続的な進歩を支援します。システムは、対象者が視界から消えた後も、バックグラウンドで進化し続けます。 | これはサポートされていません。状態は最後に観測された時点で固定されます。 |
| 世界は言う | 明示的な3D静的点群 + 4D動的立体点群 | 暗黙的な3D表現。これは、過去の2Dフレームから直接予測される。 |
| 同じポーズでVQA-Accに2回目の訪問 | 54.620 | 5.012 |
| 異なるポーズ - VQA-Accへの2回目の訪問 | 49.478 | 4.132 |
| 動的エンティティ一貫性(DINO₂ₙᵈ) | 0.721 | 0.122 |
| 動的点群空間一貫性(CD₂ₙᵈ) | 0.135 | 6.236 |
| 技術アーキテクチャ | 進化処理とレンダリング処理は明確に分離されており、閉ループのパイプラインが構築されている。 | この2つは連動しており、単一のビデオジェネレーターが直接予測を行います。 |
| マルチイベント並列処理 | 複数のモニターの同時進行をサポートします。 | 独立した進化メカニズムを欠いているため、並行処理は不可能である。 |
| 静的な背景の一貫性 | 優秀(SLAM増分蓄積) | 一般的に(暗黙的記憶に依存し、ドリフトしやすい) |
LiveWorldの応用シナリオ
-
エージェントトレーニングこれは、身体を持つ知能エージェントのための、進化し続けるインタラクティブな仮想環境を提供し、エージェントの視野外の出来事に関する推論を支援する。
-
自動運転シミュレーション交通状況における死角などの見えない領域の動的な変化をシミュレートすることで、意思決定の安全性を向上させます。
-
インタラクティブゲームプレイヤーがゲームを終了した後も、NPCやイベントが論理的に進行し続けるオープンワールドゲームを制作すること。
-
合成データ生成長期的な時間的一貫性と複雑なイベントロジックを備えた大規模なトレーニングデータを生成する。
-
ロボットナビゲーション計画これは、ロボットが探索プロセス中に、未観測領域の動的な状態に関する認識を維持することを支援する。