project
Hunyuan 3Dワールドモデル2.0 - テンセント Hunyuan オープンソース マルチモーダルワールドモデル
HY-World 2.0は、Tencent Hunyuanが開発したオープンソースのマルチモーダルワールドモデルです。テキスト、単一画像、複数ビュー、またはビデオから、移動可能な3Dガウススパッタリング(3DGS)シーンの生成をサポートしています。このモデルは4つの要素を使用しています...
Hunyuan 3D World Model 2.0とは何ですか?
HY-World 2.0は、テンセントのHunyuanプラットフォームが開発したオープンソースのマルチモーダルワールドモデルです。テキスト、単一画像、複数ビュー、またはビデオから、移動可能な3Dガウススパッタリング(3DGS)シーンの生成をサポートしています。このモデルは、パノラマ生成→軌道計画→ワールド拡張→3D再構築という4段階のアーキテクチャを採用しており、「テキスト/画像からの3Dワールド生成」と「ビデオからの3Dワールド再構築」を統一的に実現しています。HY-World 2.0で生成されたシーンは、物理的な衝突判定とキャラクター探索をサポートし、Unity/UEエンジンにエクスポート可能で、クローズドソースの商用製品であるMarbleと同等のパフォーマンスを発揮します。
Hunyuan 3D World Model 2.0の主な機能
-
ワールド・ジェネレーションテキストまたは単一の画像に基づいて、360°自由に動き回れる3DGS/メッシュの没入型シーンを生成します。
-
世界復興複数の視点からの画像またはビデオ入力から、高精度の3Dデジタルツイン空間を再構築します。
-
パノラマ画像の生成あらゆる視点からの画像やテキストを360°パノラマ画像に変換します(HY-Pano 2.0)。
-
軌道インテリジェントプランニング: シーンの意味を分析し、壁を通り抜けるなどの不合理な動作を回避するための探索経路を計画します (WorldNav)。
-
ロールプレイングアドベンチャーモード生成されたシーン内で、キャラクターが自由に歩き回ったり探索したりすることをサポートします。
-
複数の形式でエクスポート3DGS、メッシュ、点群、ビデオなどの様々なフォーマット、および主要なエンジンとの統合をサポートします。
Hunyuan 3Dワールドモデル2.0の技術原理
- パノラマ画像生成(HY-Pano 2.0)エンドツーエンドの暗黙的学習アプローチを採用した本システムは、カメラのメタデータを必要とせずに、マルチモーダル拡散変換器(MMDiT)を用いて、透視図から360°等角円筒投影(ERP)への空間マッピングを自律的に学習します。ERP境界における不連続性の問題に対処するため、円形パディングとピクセルブレンド技術が導入され、実際のパノラマ画像とユーザー生成(UE)合成データを組み合わせたハイブリッドアプローチを用いてトレーニングが実行されます。
- 軌道計画(WorldNav)幾何学的および意味的なシーン分析(点群、メッシュ、セマンティックセグメンテーション、NavMesh)を通じて空間構造を理解し、情報カバレッジを最大化する移動経路をインテリジェントに計画し、自然な経路を確保して障害物を回避し、通常、周囲、再構築知覚、移動、空中など、多様な経路タイプをサポートします。
- ワールドステレオ 2.0連続的な動画生成ではなくキーフレーム生成に基づき、グローバルな幾何学的メモリと空間ステレオメモリのメカニズムを導入することで、複数の視点間での一貫性を確保しています。モデルの蒸留によって効率が向上し、計画された経路に沿ったシーンの拡張と詳細の補完が可能になります。
- ワールドミラー2.0フィードフォワード3D予測モデルを採用し、正規化位置エンコーディング、明示的な法線監視、および深度マスク予測によって幾何学的精度を最適化しています。最終的なシーン融合と最適化には3Dガウススパッタリング(3DGS)を組み合わせ、生成されたビューと実際の入力の両方から堅牢な再構成をサポートします。
Hunyuan 3Dワールドモデル2.0の使い方
- アクセスプラットフォームTencent Hunyuan 3Dの公式サイトにアクセスし、アカウントでログインしてください。
- 入力方法を選択してください画像を1枚アップロードするか(どの角度でも可)、テキストによる説明を入力してください(例:「ネオンライトが点滅するサイバーパンク風の街並み」)。
- パラメータ設定生成モード(ワールド生成/ワールド再構築)、シーンスタイル、移動範囲などのパラメータを選択します。
- 生成と探査「生成」をクリックすると、システムは自動的に4段階のプロセス(パノラマ→軌跡→拡大→再構成)を実行します。
- 輸出3DGS/メッシュファイルのダウンロード、またはUnity/UEエンジンにインポート可能なアセットパッケージの直接生成をサポートします。
Hunyuan 3D World Model 2.0の主要情報と使用要件
- 開発チームTencent Hunyuanが開発され、サービスが開始されました。
- オープンソースの状況モデルの重み、トレーニングコード、および完全な技術レポートは完全にオープンソース化されており、無料でダウンロードして閲覧できます。
- 入力モードテキスト入力、単一画像、複数ビュー画像、ビデオストリームの4つの入力方法をサポートしています。
- 出力形式3Dガウススパッタリング(3DGS)、メッシュモデル、点群データ、360°パノラマ画像、ビデオシーケンスをエクスポートできます。
- エンジンサポート生成されたアセットはUnityおよびUnreal Engine(UE)とネイティブに互換性があり、二次編集のために直接インポートできます。
- ハードウェア要件ローカル展開にはNVIDIA製GPUが必要であり、生成効率を確保するためには16GB以上のビデオメモリを搭載した環境を使用することを推奨します。
Hunyuan 3D World Model 2.0の主な利点
-
統一発電・復興「無から何かを生み出す」と「現実から再構築する」という両方のパラダイムをサポートする、初のオープンソースフレームワーク。
-
物理的にインタラクティブ生成されたシーンは、空間的な論理と物理的な衝突検出機能を備えており、キャラクターによる探索をサポートしています。
-
カメラパラメータは不要ですパノラマ生成段階では、焦点距離や視野角などのメタデータは不要で、実際のシーン画像に適応します。
-
高品質な境界処理360°パノラマのシームレスな統合により、従来のERP画像における左右の境界の途切れの問題を解消します。
-
メモリの一貫性世界拡張フェーズでは、長距離移動中の視覚的な連続性を確保するための記憶メカニズムが導入される。
-
工業グレード互換主要なゲームエンジンをネイティブにサポートしており、ゲーム開発やロボットシミュレーションに直接使用できます。
Hunyuan 3D World Model 2.0 のプロジェクトアドレス
- プロジェクト公式サイト:https://3d-models.hunyuan.tencent.com/world/
- GitHubリポジトリ:https://github.com/Tencent-Hunyuan/HY-World-2.0
- ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/HY-World-2.0
- 技術論文:https://3d-models.hunyuan.tencent.com/world/world2_0/HY_World_2_0.pdf
Hunyuan 3D World Model 2.0と類似競合製品との比較
| 比較対象寸法 | Hunyuan 3Dワールドモデル2.0 | WonderWorld | Marble |
|---|---|---|---|
| 開発者 | テンセント・フンユアン | Snap Research / UC Berkeley | ワールドラボ (リー・フェイフェイ) |
| オープンソースのステータス | 完全オープンソース(重量+コード) | オープンソース(研究用コード) | クローズドソース/限定的なオープンソース |
| 入力モード | テキスト/単一画像/複数ビュー/ビデオ | 画像/テキスト1つ | 画像/テキスト1つ |
| コア出力 | 3DGS/Mesh | 3DGS | 3DGS |
| 生成と再構築 | 統合サポート | 世代への重点 | 世代への重点 |
| 身体的な相互作用 | キャラクターの移動と衝突検出をサポートします | 基本ローミング | 基本的な探究 |
| エンジン輸出 | Unity/UEネイティブサポート | 変換が必要です | 限定的なサポート |
| パノラマ生成 | HY-Pano 2.0(カメラパラメータの要件なし) | カメラのポーズは把握しておく必要がある | 依存関係の深さの推定 |
Hunyuan 3Dワールドモデル2.0の応用シナリオ
-
ゲーム開発分野開発者はこのモデルを使用することで、物理的な衝突を伴うインタラクティブな3Dシーンのプロトタイプを迅速に生成でき、従来のレベルデザインにおける時間と技術的な障壁を大幅に軽減できます。
-
仮想現実アプリケーションこのシステムは、高精細な没入型VR/AR空間を構築することができ、エンドユーザーは生成された環境内をリアルタイムで自由に歩き回り、探索することができる。
-
デジタルツイン構築ユーザーは数枚の写真または短い動画を提供するだけで、現実世界の高精度な3Dデジタルコピーを自動的に再構築できます。
-
ロボットシミュレーション訓練これは、身体化された知能および自動運転システム向けに、物理的に一貫性のあるインタラクティブな仮想トレーニング環境を提供し、アルゴリズムのセキュリティ検証をサポートします。
-
バーチャル映画制作このモデルは、映画のプリビジュアライゼーション、バーチャルスタジオ撮影、ポストプロダクションにおける特殊効果合成のための360°パノラマ仮想背景アセットを生成できます。