project
Ctrl-World - 清華大学とスタンフォード大学が共同開発した具現化された世界モデル
Ctrl-Worldは、清華大学の陳建宇氏とスタンフォード大学のチェルシー・フィン氏のチームが共同開発した、具現化された世界モデルです。WorldArenaによる権威ある評価において、具現化されたタスク能力で世界第1位、ビデオ生成品質で世界第2位を獲得しました。
Ctrl-Worldとは何ですか?
清華大学の陳建宇氏とスタンフォード大学のチェルシー・フィン氏のチームが共同開発した、具現化された世界モデル「Ctrl-World」は、権威あるWorldArenaの評価において、具現化されたタスク能力で世界第1位、ビデオ生成品質で世界第2位を獲得しました。このモデルは、モーション条件付きアーキテクチャと物理エンジンの制約を採用し、ロボットアームのモーションパラメータを生成プロセスに明示的に組み込んでいます。これにより、センチメートルレベルの軌道精度、0.986のポリシー評価の一貫性、0.93の深度精度を実現し、仮想テストを実機テストとほぼ同等にしています。ロボットポリシーのトレーニングと評価のための高忠実度「デジタルツイン」環境を提供し、開発コストを大幅に削減します。
Ctrl-Worldの主な機能
- 戦略評価本システムは仮想環境でのロボット戦略のテストをサポートしており、評価結果は実際の物理環境と最大0.986の整合性を示しています。開発者は高価な実環境を構築することなく、戦略の検証を完了できます。
- 動作計画物理的に正確な軌道生成に基づいて、ロボットの実行可能な動作シーケンスを計画し、閉ループ制御下での精密な操作タスクをサポートする。
- データ合成これは、物理的に妥当なビデオモーションデータの生成をサポートしており、実際のロボット戦略のトレーニングに直接使用できるため、従来の合成データにおける「仮想トレーニング、現実の失敗」という問題点を解決します。
- マルチビュー予測このシステムは、マルチビューRGBビデオ、深度マップ、点群を統合的に生成することで、ロボットに完全な空間認識能力を提供する。
Ctrl-Worldの技術的原則
- アクション条件付けアーキテクチャロボットの関節角度、グリッパーの開閉角度、その他の物理パラメータは生成プロセスに明示的に組み込まれ、動作と状態変化の因果的な物理的連鎖の学習を強制することで、物体の貫通や空気の吸引など、物理法則に違反するエラーを根本的に回避します。
- 物理エンジンの制約埋め込みトレーニング中、プロセスを監視するために物理エンジンが導入され、ニュートンの力学法則を生成のための厳密な制約として内部化することで、モデルの出力が視覚的にリアルであるだけでなく、質量、摩擦、衝突といった物理的な保存法則にも準拠するようにします。
- メモリ強化型マルチビュー予測疎な過去のフレームを取得し、姿勢条件付き投影を使用することで、長期的な時間的一貫性が維持されます。同時に、マルチビューRGB、深度マップ、点群構造が共同で予測され、正確な3D空間認識とセンチメートルレベルの軌跡精度が実現されます。
Ctrl-Worldのプロジェクトアドレス
- プロジェクト公式サイト:https://ctrl-world.github.io/
- GitHubリポジトリ:https://github.com/Robert-gyj/Ctrl-World
- arXiv技術論文:https://arxiv.org/pdf/2510.10125
Ctrl-Worldのユースケース
- 仮想シミュレーションテスト開発者は、高価な実際の物理環境を構築する必要なく、Ctrl-World上でロボット戦略の性能を直接評価できるため、開発コストと時間を大幅に削減できます。
- 戦略トレーニングデータの統合このモデルは、物理的に妥当なビデオアクションシーケンスを生成し、それを直接使用して実際のロボットの戦略を訓練できるため、実データ収集における高コストと低効率の問題を解決します。
- 動作計画と閉ループ制御Ctrl-Worldは、ロボットアームの精密な動作シーケンスを生成し、把持、積み重ね、挿入などの精密な操作をサポートするとともに、実行中のリアルタイムフィードバックに基づいて計画を調整することができます。
- ロボット工学のスキル学習多様なシーンや物体との相互作用データを生成することで、ロボットは高度に汎用的な操作スキルを学習し、馴染みのない物体の形状、空間的な位置、およびタスク指示に適応できるようになる。