project
GigaWorld-1 - 優れたビジョンを備えたオープンソースの具現化された世界モデル。
Excellent Vision社が開発したGigaWorld-1は、WorldArenaランキングでトップに輝いた、具現化された世界モデルです。このモデルは、明示的なモーションモデリングと微分可能な物理法則を組み合わせたAC-WM(モーション制御世界モデル)アーキテクチャを採用しています。
GigaWorld-1とは何ですか?
Excellent Vision社が開発したGigaWorld-1は、WorldArenaランキングでトップに輝いた、具現化された世界モデルです。このモデルは、AC-WM(モーション制御世界モデル)アーキテクチャを採用し、明示的なモーションモデリングと微分可能な物理エンジンを組み合わせることで、幾何学的に一貫性があり、物理的に正確なビデオ生成を実現しています。3D精度(97.02ポイント)や物理法則への適合性といった主要指標において、GoogleやNVIDIAを大きく上回る性能を発揮し、数万時間に及ぶ実際のロボットデータに基づいて学習されています。
GigaWorld-1の主な機能
- 高忠実度ビデオ生成これは、動作コマンドに基づいて幾何学的に一貫性があり、物理的に正確な、具現化されたインタラクティブなビデオを生成し、ロボットアームの操作などの複雑なシナリオのシミュレーションをサポートします。
- 動作条件制御明示的なモーションモデリングを用いることで、生成されるビデオが入力されたモーション軌跡と物理的な相互作用ロジックに厳密に従うことを保証します。
- 3D空間理解このモデルは高精度な三次元空間認識能力を備えており、3D精度評価においてほぼ満点(97.02点)を獲得した。
- 物理法則シミュレーションこのモデルには、物体の衝突や掴み合いといった物理的な相互作用をリアルに再現する、微分可能な物理エンジンが内蔵されています。
- データ生成とデータ拡張「デジタルサンドボックス」プラットフォームとして、多様な合成データを生成し、ロボット戦略モデルの汎化能力を向上させることができる。
ギガワールド1の技術原理
- AC-WMアーキテクチャGigaWorld-1は、身体化された知能シナリオ向けに特別に設計された、アクション条件付き世界モデルアーキテクチャを採用しています。このアーキテクチャは、アクションコマンドをコアとなる条件付き入力として使用し、特定のロボット動作に基づいて将来の視覚的観測を予測することを可能にし、動作と知覚の間の閉ループ相互作用を実現します。
- 明示的なモーションモデリングこのモデルは、明示的なモーションモデリング機構を導入し、モーション情報を構造化された方法でビデオ生成プロセスに組み込みます。これにより、生成されるビデオの幾何学的空間における一貫性が根本的に保証され、従来の暗黙的なモデリングでよく見られるモーションとビジュアルのずれの問題を回避できます。
- 微分可能な物理エンジンGigaWorld-1は、革新的な微分可能な物理エンジンを統合することで、ロボットアームの正確な物理パラメータを取得し、複雑な物理的相互作用をシミュレートすることを可能にします。これにより、モデルは視覚的にリアルな動画を生成し、物理法則に厳密に従うことで、衝突、摩擦、把持などの動的プロセスを正確にモデル化できます。
- 大規模な実データを用いたトレーニングこのモデルは、Excellent Visionが長期間にわたり蓄積してきた数万時間に及ぶ高品質な実機ロボット動作ビデオデータに基づいて学習されています。このデータは、広範囲にわたるオープンシーンと詳細な動作を網羅しており、実環境におけるモデルの汎化能力と動作追従精度を大幅に向上させています。
GigaWorld-1の使い方
- オープンソースプラットフォームへのアクセスコードとデータセットを入手するには、公式のHuggingFaceまたはGitHubリポジトリにアクセスしてください。
- リソースをダウンロードするモデルの重み、推論コード、およびCVPR-2026-WorldModel-Trackデータセット(数万時間に及ぶ実際のロボット動作動画を含む)をダウンロードしてください。
- 環境設定公式ドキュメントに従って依存関係をインストールし、ディープラーニング推論をサポートするハードウェア環境を構成してください(GPUアクセラレーションを推奨します)。
- モデル提供されているインターフェースを使用して、事前学習済みのGigaWorld-1モデルの重みをローカルサーバーまたはクラウドサーバーにロードします。
- アクションコマンドを入力するロボットアームの動作軌跡または操作指示は、モデルが認識できる形式にエンコードされ、生成のための入力として使用される。
- 予測ビデオを生成する推論スクリプトを実行すると、モデルは入力されたアクションに基づいて将来のフレームのビデオ予測を生成し、幾何学的に一貫性があり物理的に正確なインタラクティブなシーンを出力します。
- 評価と微調整WorldArenaの評価ツールを使用して、生成されたデータの品質を検証したり、独自のデータに基づいてドメイン適応のためのモデルを微調整したりできます。
- 統合アプリケーションこのモデルは、合成データ拡張や動作計画検証などの下流タスクのために、ロボットシミュレーションシステムまたは戦略トレーニングプロセスに統合されます。
GigaWorld-1の主要情報と使用要件
-
位置身体化された知能のために特別に設計されたAC-WM(モーションコントロールワールドモデル)は、WorldArenaの評価において総合スコア62.34を獲得し、世界ランキングでトップに立った。
-
中核的な利点3D精度スコアは97.02点で満点に近く、物理的適合性は2位よりも16%優れており、その視覚品質は業界トップクラスである。
-
テクニカルルートEmbodiedDreamerのアーキテクチャを継承し、明示的なモーションモデリングと微分可能な物理エンジンを統合し、数万時間に及ぶ実際のロボットデータで学習されています。
-
開発チームExcellent Vision(清華大学関連企業であり、中国で初めてグローバルモデルを開発した企業)は、清華大学で自動化の博士号を取得し、Horizon Roboticsで知覚技術部門の責任者を務めた経験を持つ黄冠氏によって設立された。
-
ハードウェア環境GPUアクセラレーションによる深層学習推論環境を構成する必要があります。GPUのメモリ要件の詳細については、公式ドキュメントを参照してください。
-
データ基盤事前学習済みモデルは直接推論に使用できます。微調整が必要な場合は、フォーマット要件を満たすロボット動作ビデオデータを準備する必要があります。
-
技術的能力応募者は、ディープラーニングフレームワーク(PyTorchなど)の使用経験があり、身体化された知能や世界モデルに関連する研究背景に精通している必要があります。
GigaWorld-1の主な利点
-
評価結果で世界一WorldArenaは総合スコア62.34を獲得し、60点台を突破した唯一の具現化された世界モデルとなり、GoogleやNvidiaといった巨大企業を凌駕した。
-
業界最高水準の3D精度このモデルは97.02点という満点に近いスコアを獲得し、高精度な三次元空間認識と幾何学的整合性を実現した。
-
物理的適合性機能のフォールトリード2位の製品と比較して16%向上しており、衝突や掴み合いといった複雑な物理的相互作用プロセスを現実的にシミュレートできる。
-
視覚品質においてトップクラスまた、画質面でも競合製品を大きく凌駕し、リアルかつ安定した画像を生成する。
-
技術アーキテクチャの革新微分可能な物理エンジンと組み合わせた明示的なモーションモデリングを先駆的に採用し、モーションとビジュアルのずれの問題を根本的に解決した。
GigaWorld-1プロジェクトの住所
- GitHubリポジトリ:https://github.com/open-gigaai/CVPR-2026-Workshop-WM-Track
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/open-gigaai/cvpr-2026-worldmodel-track
GigaWorld-1と類似の競合製品との比較
| 比較対象寸法 | ギガワールド1(絶景) | Ctrl-World | ABot_PhysWorld |
|---|---|---|---|
| 総合スコア | 62.34(1位) | 59.98(2位) | 58.47(5位) |
| 視覚的な品質 | 63.04(1位) | 57.42 | 50.85 |
| 運動の質 | 39.16 | 50.91(1位) | 49.63 |
| コンテンツの一貫性 | 65.17 | 62.25 | 63.26 |
| 物理法則 | 64.68(1位) | 55.41 | 43.26 |
| 3D精度 | 97.02(1位) | 88.46 | 90.00(2位) |
| 制御可能性 | 57.28 | 53.42 | 59.25 |
GigaWorld-1の応用シナリオ
- ロボット戦略トレーニング高忠実度シミュレーターとして、多様な合成データを生成してVLAモデルを訓練し、新しいテクスチャ、新しい視点、新しいオブジェクト位置に対する汎化性能を約300%向上させることに成功した。
- 動作計画の検証仮想環境を利用することで、ロボットアームの軌道のリハーサル、動作の実現可能性の検証、実際のハードウェアの摩耗の回避が可能になり、研究開発効率を10~100倍向上させることができる。
- 身体化された知能研究これは学術界にグローバルなモデル基準を提供し、動作予測、物理的推論、長期タスク計画などの最先端の研究テーマを支援する。
- シミュレーションから現実への移行物理的に正確な動画を生成することで、Sim2Real(シミュレーターと実機を繋ぐ架け橋)が構築され、実機ロボットの導入コストとリスクが削減される。
- データ不足シナリオの強化収集が困難な実世界のシナリオに対応した高品質な訓練データを生成することで、ロボットデータ収集におけるボトルネック問題を解決します。