project
Cosmos 3 Edge - NVIDIAのオープンソース40億パラメータ世界モデル
Cosmos 3 Edgeは、NVIDIAが開発した40億パラメータのオープンソース世界モデルであり、ロボット工学やエッジAIにおけるリアルタイム推論向けに設計されています。このモデルはNemotronアーキテクチャに基づいており、自己回帰型と拡散型の両方のTransformerタワーを組み込んでいます。
Cosmos 3 Edgeとは何ですか?
Cosmos 3 Edgeは、NVIDIAが提供する40億パラメータのオープンソース世界モデルで、ロボット工学やエッジAIにおけるリアルタイム推論向けに設計されています。Nemotronアーキテクチャをベースとし、自己回帰型および拡散型のデュアルTransformerタワーを統合し、マルチモーダルなアテンションレイヤーを共有しています。Jetson Thor、RTX GPU、DGXなどのデバイス上でローカルに実行でき、15Hzのリアルタイム制御を実現します。開発者は、約1日でモデルを特定のロボットや環境に適合させることができ、クラウドに頼ることなく、知覚、推論、および行動ポリシーの生成が可能になります。
Cosmos 3 Edgeの主な特徴
-
世界国家理解自己回帰タワーを通して視覚トークンとテキストトークンを処理することで、エッジ環境におけるオブジェクト、空間関係、シーンの意味をリアルタイムで解析し、後続の推論のための共有された世界表現を提供する。
-
将来の状態予測このアルゴリズムは、拡散タワーを使用してノイズを除去し、視覚、音声、および動作トークンを生成し、特定の動作を実行した後の視覚的な結果をシミュレートします。
-
行動戦略の策定このシステムは、ロボットアーム、車両、カメラなどのさまざまな物理的形状を、並進、回転、および動作状態を表すコンパクトな幾何学的ベクトルに符号化します。各推論は32個の連続した動作を生成し、15Hzの周波数で制御コマンドを出力します。
-
エッジにおけるリアルタイム推論Jetson Thor、RTX PRO、Jetson T2000/T3000などのメモリ制約のあるデバイス上で、クラウドアクセスなしのクローズドループ動作により、高スループットかつメモリ効率の高い推論を実現します。
-
迅速な領域適応このツールは、トレーニング後のスクリプトとDROIDデータセットのポリシーチェックポイントを完備しており、開発者は約1日でベースモデルを特定のロボットや環境に合わせて微調整できます。
Cosmos 3 Edgeの技術的原理
- デュアルタワー共有アーキテクチャこのモデルは、自己回帰タワーと拡散タワーで構成されています。自己回帰タワーは、因果的アテンションを使用して、シーンの理解と推論のために視覚トークンとテキストトークンを処理します。拡散タワーは、双方向アテンションを使用して、予測、生成、およびニューラルシミュレーションのために、視覚トークン、音声トークン、およびアクショントークンを処理します。各タワーは独自のLayerNormとMLPを持ちますが、言語、ビデオ、音声、およびアクション情報を統一された表現空間に整列させるためのマルチモーダルアテンションレイヤーを共有しています。
- 一般的な訴訟代理これは、さまざまな物理システムの動作をコンパクトな幾何学的ベクトルにマッピングし、並進、回転、および動作状態を統一的に符号化し、ピクセルの変化と物理的な動き、空間的な関係、および制御入力との間に直接的なつながりを確立します。
- 世界行動モデル(WAM)戦略として使用する場合、モデルは現在の観測状態を受け取り、実行すべきアクションとその期待される視覚的結果を出力し、世界モデリングとロボットポリシーのトレーニングを直接的に連携させます。アクションはモデル内で双方向に流れることができ、アクションの効果を予測したり、その効果に基づいてアクションを駆動したりすることができます。
- エッジ最適化推論Nemotronアーキテクチャをベースとした4Bパラメータコンパクト設計は、4段階の知識蒸留とvLLM最適化フレームワークを組み合わせることで、出力品質を維持しながら最大25倍の推論速度向上を実現し、Jetsonシリーズなどのエッジコンピューティングプラットフォームのメモリと計算能力の制約に適応しています。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Cosmos 3 Edgeの使い方
- 環境準備NVIDIA Container Toolkitをインストールして公式のDockerイメージをプルするか、Conda環境を設定してPyTorch、Diffusers、Transformersなどの依存関係をインストールしてください。
- モデルをダウンロードHugging Faceからダウンロード
nvidia/Cosmos3-Edge重みを取得し、トレーニング後のスクリプトとDROIDデータセットのポリシーチェックポイントも取得します。 - トレーニング後の微調整小型のH100クラスターまたはDGXステーションを使用すれば、オープンソースのCosmos Frameworkに基づいて特定のロボット、センサー、または環境を微調整するのに約1日かかります。
- 導入理由微調整されたモデルは、Jetson T2000/T3000、RTX PRO、DGXなどのエッジデバイスに展開され、vLLMまたはNIMマイクロサービスを介して15Hzのリアルタイムモーション生成が実現されます。
Cosmos 3 Edgeの主な利点
- エッジにおけるリアルタイム推論40億個のパラメータを備えた軽量設計により、Jetson Thor上で15Hzのリアルタイム制御を実現し、クラウドの遅延を排除します。
- 素早い適応開発者は、基本モデルを特定のロボットや環境に合わせて約1日で微調整できるため、導入サイクルを大幅に短縮できます。
- 統合マルチモーダルアーキテクチャ自己回帰タワーと拡散タワーは同じアテンションレイヤーを共有し、言語、ビデオ、オーディオ、アクションを均一に処理することで、「理解→シミュレーション→アクション」という閉ループを実現します。
- オープンエコシステムモデルの重み、トレーニングスクリプト、トレーニング後の処理手順、および4段階の知識蒸留チェックポイントはすべてオープンソースであり、ハギングフェイスディフューザーとvLLMの展開をサポートしています。
- ベンチマークをリードする同規模のモデル(4B)の中で、VANTAGE-Benchは視覚分析において第1位にランクされ、そのロボットポリシー学習は業界最高水準に達している。
Cosmos 3 Edgeのプロジェクト比較
- プロジェクト公式サイト:https://huggingface.co/blog/nvidia/cosmos3edge
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3の優位性(競合製品との比較)
| 寸法 | Cosmos 3 Edge | SmolVLA |
|---|---|---|
| 出版社 | NVIDIA | ハギングフェイス / コミュニティ |
| パラメータサイズ | 4B | 450M |
| 建築タイプ | ワールド・アクション・モデル(WAM)ツインタワー建築 | 視覚・言語・運動(VLA)モデル |
| コアメカニズム | 自己回帰タワーと拡散タワーは注目を集め、世界理解と行動創出を統合する。 | SigLIP+DinoV2デュアルビジョンエンコーダ、セグメント化された動き予測 |
| オープンソースレベル | 完全オープンソース(重み、トレーニングスクリプト、トレーニング後処理スキームを含む) | 完全オープンソース(重み付けデータ、コード、評価スクリプトを含む) |
| エッジ展開 | Jetson Thor / RTX PRO / T2000 / T3000、15Hzリアルタイム制御 | シングルRTX 4090、15~30Hzの推論 |
| 微調整コスト | 小型H100クラスターまたはDGXステーション、約1日 | 単一のA100またはコンシューマーグレードのGPU、数時間 |
| アクション出力 | 各推論は、一般的な幾何学的ベクトルで表される32個のアクションを生成する。 | 毎回50個のアクションブロックを予測することで、計算呼び出し回数を50分の1に削減できます。 |
| ワールドモデリング | 行動の視覚的な結果を予測するための組み込み型世界モデル。 | 組み込みのワールドモデルがないため、観測結果を直接アクションにマッピングします。 |
| 適用可能なシナリオ | 因果推論とシミュレーションを必要とする複雑な操作と動的な環境 | 構造化された環境における迅速な反応的な把持と配置 |
Cosmos 3 Edgeの応用シナリオ
-
産業用ロボットアームの制御工場生産ライン上のワークピースの位置をリアルタイムで検知し、クラウドとのやり取りをすることなく、把持や組み立て動作を生成できる。
-
倉庫・物流ロボット倉庫内の通路を自律的にナビゲートし、リアルタイムで障害物を回避し、最適なピッキングルートを計画することができ、15Hzでの動的な意思決定をサポートします。
-
自動運転エッジ認識車載Jetsonプラットフォーム上でのリアルタイムの路面状況推論、他車両の軌道予測、および自車両に対する制御戦略の生成。
-
医療支援ロボット病院環境においては、周囲の状況の変化を認識し、手術や看護ケアを支援するためにロボットアームの動きをリアルタイムで調整することができる。
-
農業の自動化圃場端の機器で作物の状態をリアルタイムで識別し、収穫や散布などの作業を自動的に実行できるほか、屋外の防虫ネットが薄い環境にも適応できる。