AB
AiBoss
project

GR00T N1 - NVIDIAのオープンソースのヒューマノイドロボット基本モデル

GR00T N1は、汎用ヒューマノイドロボット向けに特別に設計されたNVIDIA初のオープンソース基盤モデルです。言語や画像などのマルチモーダル入力に基づいて、多様な環境での操縦タスクを可能にします。GR00T N1は大規模な...

GR00T N1とは何ですか?

GR00T N1は、汎用ヒューマノイドロボット向けに特別に設計された、NVIDIA初のオープンソース基盤モデルです。言語や画像などのマルチモーダル入力に基づいて、多様な環境での操縦タスクを可能にします。GR00T N1は、実世界、合成、インターネットビデオデータを組み合わせた大規模なヒューマノイドロボットデータセットでトレーニングされ、その後、特定のロボットの形状、タスク、環境に適応するように事後トレーニングされます。GR00T N1はデュアルシステムアーキテクチャを採用しており、ビジョン言語モデルが推論と計画を処理し、拡散トランスフォーマーが精密な動作を生成します。GR00T N1は、シミュレーションと実世界の両方でのテストで非常に優れたパフォーマンスを発揮し、複雑なマルチステップタスクと精密な操作において大きな優位性を示し、マテリアルハンドリング、パッケージング、検査などのアプリケーションに効率的なソリューションを提供します。

GR00T N1の主な機能

  • 一般的な運用タスクの実行把持、運搬、両腕の協調動作など、多様な環境下で様々な作業を実行できる。
  • マルチモーダル入力処理このシステムは言語コマンドと視覚画像を同時に処理するため、ロボットは自然言語による指示に基づいて複雑なタスクを実行できる。
  • ロボット間の形態適応性様々なタイプのロボットプラットフォーム(Fourier GR-1や1X Neoなど)に対応することで、汎用性を実現しています。
  • 複雑なタスクの推論と計画継続的な状況理解と複数のスキルの統合を必要とする、複雑で多段階のタスクを実行する。
  • 効率的なデータ活用とトレーニングインターネット規模のデータ、合成データ、および実機ロボットデータを組み合わせて事前学習を行うことで、性能と汎化能力が大幅に向上し、大規模なラベル付きデータへの依存度が低減される。

GR00T N1の技術原理

  • デュアルシステムアーキテクチャ
    • 視覚言語モデル(システム2)NVIDIA-EagleとSmolLM-1.7Bをベースに構築されたこのシステムは、視覚的および音声的なコマンドを使用して環境を理解し、推論と計画を実行し、行動計画を出力する役割を担っています。
    • 拡散変換器(システム1)モーションモデルとして、視覚言語モデルの計画を、ロボットの動きを制御するための正確で連続的な動作に変換する。
  • データ戦略事前学習データには、インターネット動画データ(人間の動作パターンとタスクの意味情報を提供)、合成データ(NVIDIA Omniverseプラットフォーム上で生成され、モーション制御信号を補完)、および実機ロボットデータ(遠隔操作によって収集され、モデルが実世界の環境に適応することを保証する)が含まれます。教師なし学習は、大規模なラベルなし人間動画データから動作パターンを抽出し、ロボットの学習効率を向上させます。
  • モデルのトレーニングと最適化大規模データを用いた事前学習により、モデルは一般的な動作パターンと操作パターンを学習します。その後、特定のロボットプラットフォーム、タスク、環境に合わせて微調整を行い、モデルの適応性と性能をさらに向上させます。推論段階では、拡散ステップを削減することで計算効率を最適化し、リアルタイム性能を確保します。

GR00T N1のプロジェクトアドレス

GR00T N1の応用シナリオ

  • 物流と倉庫管理商品の掴み、移動、仕分け、自動在庫管理、商品保管および管理の最適化に使用されます。
  • 製造部品の精密な組み立て、製品の品質検査、生産効率および品質管理の向上を行う。
  • 小売業界棚の整理と在庫補充を自動で行い、顧客への情報照会や商品推奨サービスを提供し、ショッピング体験を向上させます。
  • 健康管理患者のリハビリテーション訓練を支援し、医療用品の輸送と管理を行い、医療スタッフの負担を軽減する。
  • 産業検査およびメンテナンス機器の定期点検を実施し、異常があれば特定して報告する。また、人件費削減のため、簡単な保守作業を行う。