AB
AiBoss
project

Cosmos-Reason1 - NVIDIAが発表したマルチモーダル大規模言語モデルシリーズ

Cosmos-Reason1は、NVIDIAが開発したマルチモーダルな大規模言語モデルシリーズで、物理ベースの応答を生成できます。Cosmos-Reason1には、Cosmos-Reason1-7BとCosmos-Reason1-5の2つのモデルが含まれています。

Cosmos-Reason1とは何ですか?

Cosmos-Reason1は、NVIDIAが提供するマルチモーダル大規模言語モデルシリーズで、物理的な現実に基づいた応答を生成できます。Cosmos-Reason1には、Cosmos-Reason1-7BとCosmos-Reason1-56Bの2つのモデルが含まれています。これらのモデルは、視覚事前学習、一般的なSFT、物理AI SFT、強化学習の4つの段階を経て学習されます。ビデオ入力とテキストプロンプトを組み合わせることで、長い推論チェーンを持つ応答を出力し、物理常識と具現化された推論のベンチマークにおいて優れた性能を発揮し、他の類似モデルを大幅に上回ります。これらのモデルは、物理常識と具現化された推論のオントロジーを定義し、マルチモーダルLLMの物理AI推論能力を評価するための対応するベンチマークを構築します。

Cosmos-Reason1の主な機能

  • 基本的な物理学を理解する空間、時間、基本的な物理法則など、物理世界の基礎知識を理解し、出来事の合理性を判断すること。
  • 身体化された推論物理学に関する常識に基づき、ロボットや自律走行車などの具現化されたエージェントに対して、合理的な意思決定と行動計画を生成する。
  • ロングチェーン思考これは、思考連鎖に基づく詳細な推論プロセスを生成し、意思決定の透明性と説明可能性を向上させる。
  • マルチモーダル入力処理動画入力に対応し、視覚情報と言語コマンドを組み合わせて推論を行い、自然言語による応答を生成する。

Cosmos-Reason1の技術的原理

  • 階層的オントロジー: 物理的な常識の階層的なオントロジーを定義し、空間、時間、基礎物理学という 3 つの主要カテゴリを網羅し、さらに 16 のサブカテゴリに細分化します。
  • 二次元オントロジー:5つの具現化されたエージェントの4つの主要な推論能力を包含する、具現化された推論のための2次元オントロジーを設計する。
  • マルチモーダル建築デコーダのみのマルチモーダルアーキテクチャに基づいて、入力ビデオはビジュアルエンコーダによって処理され、テキストタグ埋め込みと位置合わせされた後、LLMに入力されます。
  • このモデルには4つのトレーニングフェーズがあります。
    • 視覚的事前学習視覚情報とテキスト情報を整合させる。
    • 教師ありファインチューニング(SFT)一般的な視覚言語タスクにおけるモデルの性能を向上させる。
    • 物理学 AI SFT専門的なデータを用いて、身体的な常識と身体感覚に基づく推論能力を強化します。
    • 物理学におけるAI強化学習(RL)): ルールベースの報酬に基づいて、モデルの推論能力をさらに最適化します。
  • 強化学習多肢選択式問題に基づくルールベースの報酬メカニズムを設計し、強化学習に基づいて、物理の常識と身体感覚に基づく推論タスクにおけるモデルのパフォーマンスを向上させる。

Cosmos-Reason1プロジェクトのアドレス

Cosmos-Reason1の応用シナリオ

  • ロボット操作これは、ロボットがタスクの目的を理解し、作業計画を作成し、把持や組み立てなどの複雑な動作を完了するのに役立ちます。
  • 自動運転このシステムは道路の映像を処理し、交通状況を予測して、回避行動や車線変更といった安全運転のための判断を下します。
  • インテリジェントモニタリングこのシステムは、人が転倒したり機器が故障したりするなど、ビデオ映像で異常な行動をリアルタイムで監視し、タイムリーに警報を発することができる。
  • 仮想現実(VR)/拡張現実(AR)仮想環境からの入力に基づいて、ユーザーの没入感を高めるためのインタラクティブな応答を生成する。
  • 教育と訓練物理現象や操作手順に関するビデオ解説に基づき、教育や職業技能訓練を支援する。