project
Lyra 2.0 - NVIDIAのオープンソース探索型生成3Dワールドフレームワーク
Lyra 2.0は、NVIDIAが開発した探索可能な生成型3Dワールドフレームワークです。このフレームワークは、1枚の画像から始まり、カメラ制御によるビデオ生成とフィードフォワード3D再構築技術を組み合わせ、反復的な「取得-生成-更新」ループを通して探索可能な生成型3Dワールドを構築します。
Lyra 2.0とは何ですか?
Lyra 2.0は、NVIDIAが開発した探索可能な生成型3Dワールドフレームワークです。単一の画像から出発し、カメラ制御によるビデオ生成とフィードフォワード3D再構成技術を組み合わせることで、反復的な「取得-生成-更新」ループを通して継続的に探索できる大規模な3Dシーンを構築します。このシステムは、空間メモリの取得のために各フレームごとに独立した3Dジオメトリキャッシュを使用し、時間的ドリフトを抑制する自己強化型トレーニング戦略を導入することで、数百フレームにわたって一貫した3D生成を実現します。Lyra 2.0で生成された結果は、高忠実度の3Dガウススプラッティングとサーフェスメッシュに再構成でき、NVIDIA Isaac Simなどの物理エンジンに直接エクスポートすることで、身体性を重視したインテリジェントトレーニングのためのインタラクティブなシミュレーション環境を提供します。
Lyra 2.0の主な機能
-
長距離3D一貫性ビデオ生成ユーザーが定義したカメラ軌道に沿って、数百フレームの移動ビデオを生成し、広角撮影やエリアの再訪をサポートします。
-
空間記憶検索各フレームの3Dジオメトリに基づいて空間キャッシュが構築され、ターゲットの視点に最も関連性の高い過去のフレームが条件として自動的に取得されます。
-
時間ドリフト耐性のある生成自己強化型の学習戦略を採用することで、このモデルは自己回帰推論中のエラー蓄積を積極的に修正し、長期的な視覚的一貫性を維持する。
-
インタラクティブ3Dエクスプローラーこのシステムは、蓄積された点群を視覚化するためのGUIを提供し、ユーザーが探索済みのエリアを再訪したり、未探索のエリアに入ったりするための経路を計画することを可能にする。
-
フィードフォワード3D再構成生成されたビデオは、精密に調整されたフィードフォワードモデルを使用して、表面メッシュを備えた高忠実度の3Dガウススプラッティングに再構築されます。
-
シミュレーション資産のエクスポートロボットのナビゲーションやインタラクションのトレーニングのために、NVIDIA Isaac Simなどの物理エンジンへの直接エクスポートをサポートしています。
-
加速推論バージョンこれは、分布マッチング蒸留に基づく4段階のノイズ除去学生モデルを提供し、推論速度を約13倍向上させます。
Lyra 2.0の技術的原理
-
生成再構築パラダイムカメラ制御によるビデオ拡散モデルの視覚的な忠実度とフィードフォワード3D再構成技術を組み合わせることで、単一の画像と軌跡をリアルタイムでレンダリング可能な3D出力に変換します。
-
ジオメトリルーティングと外観構成の分離各フレームごとに独立した3Dキャッシュ(深度マップ+点群)を保持し、これは過去のフレームの取得と高密度な3D対応関係の確立にのみ使用されます。実際のピクセル合成は、レンダリングアーティファクトの伝播を回避するために、ビデオ拡散モデルの生成前段階で引き続き実行されます。
-
正規化座標ワープインジェクション取得された過去のフレームは、ターゲットの視点に順方向ワープされ、正規化された座標マップと深度マップが生成されます。位置エンコーディングとMLP処理の後、これらのマップはDiTの自己注意層に注入され、正確な幾何学的アライメント信号を提供します。
-
自己強化型ドリフト防止トレーニングトレーニングにおける過去の潜在変数は確率を用いてノイズが加えられ、単一ステップのノイズ除去によって近似的な再構成に置き換えられます。これにより、モデルは不完全な条件下でもクリーンなターゲットを復元するように強制され、トレーニングと推論の分布の差が低減されます。
-
FramePackコンテキスト圧縮: 可変カーネルパッチ化を使用して時間履歴を圧縮し、近いフレームにはきめ細かいパッチを、遠いフレームには粗いパッチを適用することで、固定トークン予算内で有効なコンテキストウィンドウを拡張します。
-
フィードフォワード再構成の微調整Depth Anything v3をベースに、高解像度におけるガウス予測密度をLyra 2.0で生成されたデータに基づいて改良および微調整し、生成されたアーティファクトに対する堅牢性を向上させた。
Lyra 2.0の使い方
-
リポジトリのクローン作成GitHubリポジトリからコードを取得し、READMEに従って環境依存関係を設定してください。
-
モデルをダウンロードLyra 2.0の事前学習済み重みデータは、Hugging Faceまたはプロジェクトページから入手できます。
-
入力準備完了単一のシーン画像を提供し、生成スタイルをガイドするためのオプションのテキストプロンプトを表示します。
-
エクスプローラーを起動します対話型GUIを実行して画像を読み込み、カメラの巡回経路を計画します。
-
反復生成システムは空間メモリから関連する過去のフレームを自動的に取得し、セグメントごとに長距離ビデオを生成します。
-
3Dの再構築: 微調整されたフィードフォワードモデルを呼び出して、ビデオシーケンスを3Dガウススプラッティングに変換します。
-
メッシュを抽出このスクリプトは、層状疎メッシュの抽出をサポートするサーフェスメッシュを出力します。
-
輸出展開身体感覚に基づく知能トレーニングのために、NVIDIA Isaac Simなどの物理エンジンに3Dアセットをインポートします。
Lyra 2.0に関する重要な情報と使用要件
- プロジェクトの位置付けNVIDIAのオープンソースで探索可能な生成型3Dワールドフレームワークは、単一の画像から永続的で移動可能な大規模3Dシーンを反復的に構築することをサポートします。
- コアテクノロジーこの動画拡散モデルは、Wan 2.1 VAE + DiTをベースとしており、「検索-生成-更新」の自己回帰ループを採用しています。空間的忘却は各フレームごとに独立した3D幾何学的キャッシングによって解決され、時間的ドリフトは自己強化学習によって抑制されます。
- 入力/出力入力は、オプションでテキストプロンプトとカメラ軌跡を含む単一のRGB画像です。出力は長距離カメラ制御ビデオであり、これはさらに3Dガウススプラッティングと表面メッシュに再構築することができ、物理エンジンにエクスポートすることもできます。
- パフォーマンス最適化これは、分布マッチング蒸留に基づく4段階の高速化モデルを提供し、推論速度を約13倍向上させます。
- ハードウェア環境NVIDIA製GPU(長時間の動画生成と3D再構成をサポートするため、高容量のVRAMを推奨)が必要であり、CUDA環境が必須です。
- ソフトウェアの依存関係PyTorch、ディフューザー、トランスフォーマー、FramePack、Depth Anything V3、OpenVDBなど。具体的なバージョンはリポジトリで確認できます。
requirements.txt標準として。
Lyra 2.0の主な利点
-
グローバルな空間持続性フレームごとに独立したジオメトリキャッシュと可視性取得を用いることで、長距離生成における空間忘却問題が解決され、再訪された領域の構造的一貫性が維持される。
-
長期的な視覚的安定性自己強化トレーニングは、自己回帰誤差の蓄積を効果的に抑制し、ベースラインと比較して色のずれや幾何学的歪みを大幅に軽減する。
-
高品質な3D出力フィードフォワード再構成モデルは、生成されたデータに合わせて微調整されており、複数のビュー間でのわずかな不整合を許容し、クリーンで一貫性のある3DGSとメッシュを生成します。
-
インタラクティブに制御可能ユーザーはリアルタイムで任意の長さのカメラ軌道を計画でき、システムは一度限りのブラックボックスを生成するのではなく、シーンを段階的に拡張していく。
Lyra 2.0プロジェクトのアドレス
- プロジェクト公式サイト:https://research.nvidia.com/labs/sil/projects/lyra2/
- GitHubリポジトリ:https://github.com/nv-tlabs/lyra
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/Lyra-2.0
- arXiv技術論文:https://arxiv.org/pdf/2604.13036
Lyra 2.0と類似の競合製品との比較
| 寸法 | Lyra 2.0 | GEN3C | Wonderland |
|---|---|---|---|
| テクニカルルート | 動画生成+フィードフォワード3D再構成、ジオメトリルーティングと外観合成の分離 | 動画生成+グローバル3D表現条件付き生成、密結合設計 | カメラ制御ビデオ拡散+専用フィードフォワードネットワーク予測3DGS |
| メモリ機構 | 各フレームには独立した3Dキャッシュがあり、情報ルーティングと対応関係の確立のみに使用されます。 | 生成条件としてグローバル点群/深度レンダリングマップを蓄積する | 明示的な空間記憶はなく、ビデオモデル自体の時間的文脈に依存する。 |
| 長距離での安定性 | 数百フレームにわたる広範囲な視点変更や領域の再訪に対応し、時間ずれにも強い。 | グローバルな3D表現の品質に限界があるため、エラーが容易に増幅される。 | 視野が狭く、長期的な整合性の問題に対処できていない。 |
| 相互作用方法 | 明示的なカメラ軌道計画 + オプションのテキストヒント | 明示的なカメラ軌道 + 3D条件 | 明示的なカメラ軌道制御 |
| 出力形式 | 3Dガウススプラッティング+サーフェスメッシュ、物理エンジンからのエクスポートをサポート | ビデオおよび3D出力 | 3D Gaussian Splatting |
| トレーニングデータ | DL3DV リアルな長尺動画、自己啓発戦略 | 詳細なトレーニング計画は非公開 | 詳細なトレーニング計画は非公開です。 |
| 推論効率 | 4段階の蒸留モデルを採用し、処理速度を13倍向上させます。 | 標準拡散サンプリング | 標準拡散サンプリング |
Lyra 2.0の応用シナリオ
-
エンボス加工されたインテリジェントシミュレーションロボットのトレーニング用に、インタラクティブな3D屋内/屋外環境を生成し、コストのかかる実世界のシーンデータ収集を不要にします。
-
仮想世界の構築単一のコンセプトアートから、探索可能なゲームレベルやメタバースシーンのプロトタイプを迅速に生成します。
-
建築とインテリアデザイン間取り図やレンダリングに基づいて3Dウォークスルーを生成し、顧客が空間レイアウトを事前に確認することで、没入感のある体験を提供します。
-
映画・テレビ番組のプリプロダクションこれは、監督に対し、静的なコンセプトアートから動的なシーンウォークスルーまで、迅速な視覚化ソリューションを提供する。