AB
AiBoss
project

DreamGen - NVIDIAの新しいロボット学習技術

DreamGenは、NVIDIAが開発した革新的なロボット学習技術で、AIビデオワールドモデルに基づいて合成データを生成し、ロボットが「夢」のような環境で新しいスキルを学習できるようにします。DreamGenは少量の実際のビデオデータのみを必要とし、大量のデータを生成できます。

DreamGenとは何ですか?

DreamGenは、NVIDIAが開発した革新的なロボット学習技術で、AIビデオワールドモデルに基づいて合成データを生成し、ロボットが夢の中で新しいスキルを学習することを可能にします。DreamGenは、少量の実際のビデオデータのみで大規模かつ現実的なトレーニングデータを生成し、ロボットが新しい環境で自身の行動や環境を一般化できるようにします。DreamGenの4段階プロセスには、ビデオワールドモデルの微調整、仮想データの生成、仮想アクションの抽出、および下流ポリシーのトレーニングが含まれます。DreamGenは、ロボットが実際のデータサポートなしでテキストコマンドに基づいて複雑なタスクを完了することを可能にし、学習効率と一般化能力を大幅に向上させます。

DreamGenの主な機能

  • 行動の一般化これにより、ロボットは新しい行動ごとに大量の現実世界のデータを収集する必要なく、新しい行動を学習し実行できるようになる。
  • 環境一般化これにより、ロボットは馴染みのない環境でも作業を実行できるようになります。単一の環境で収集されたデータに基づいて、ロボットはさまざまな新しい環境で作業を成功裏に実行できます。
  • データ拡張複雑なタスクにおけるロボットの成功率を向上させるため、大規模な合成訓練データを生成する。
  • マルチロボットシステムのサポートFranka、SO-100などの様々なロボットシステムや、拡散ポリシー、GR00T N1などの様々な戦略アーキテクチャをサポートしており、幅広い適用性があります。

DreamGenの技術原則

  • ビデオワールドモデルの微調整対象ロボットの遠隔操作軌道データを用いて、ビデオワールドモデル(Sora、Veoなど)を微調整することで、ロボットの運動学的特性と動的特性を捉えます。低ランク適応(LoRA)技術に基づき、モデルが元のデータを忘れるのを軽減し、ロボットの新たな特徴にも適応します。
  • 仮想データ生成初期フレームと言語指示が与えられると、ビデオワールドモデルは、期待される動作を記述したロボットビデオの大規模なシーケンスを生成します。これらのビデオには、既知の動作だけでなく、新しい環境における新しい動作も含まれます。生成されたデータの品質は、指示に適合しない「悪夢」のようなビデオを除外することで保証されます。
  • 仮想モーション抽出生成されたビデオシーケンスは、潜在動作モデル(LAPA)または逆動力学モデル(IDM)を用いて解析され、擬似動作シーケンスが抽出され、神経軌跡が形成される。これらの擬似動作シーケンスは、下流の視覚運動戦略のトレーニングに使用される。
  • 戦略トレーニング生成されたビデオ動作シーケンス(すなわち、ニューラル軌跡)は、下流の視覚運動戦略のトレーニングに使用されます。これらのニューラル軌跡に基づいて、ロボットは実世界のデータなしで新しいタスクを学習し、ゼロショット汎化を実現します。

DreamGenのプロジェクトアドレス

DreamGenのアプリケーションシナリオ

  • 工業生産これにより、ロボットは組み立てや溶接といった複雑な作業を迅速に習得できるようになり、生産効率と品質の向上につながります。
  • ホームサービスロボットがさまざまな家庭環境に適応し、掃除や片付けといった多様な家事をこなせるようにするため。
  • 医療医療ロボットの精密な操作を支援し、手術やリハビリテーションなどの医療処置の効率と安全性を向上させる。
  • 物流倉庫これは、ロボットがさまざまな物品を効率的に仕分け、輸送するのに役立ち、物流プロセスを最適化する。
  • 農業生産これは、農業ロボットが複雑な環境下で植え付けや収穫などの作業を完了するのを支援し、それによって農業生産量を増加させる。