AB
AiBoss
project

iDP3 - スタンフォード大学が他の複数の大学と共同で開発した、改良された3Dビジュアルモーション戦略。

iDP3(Improved 3D Diffusion Policy)は、スタンフォード大学が他の複数の大学と共同で開発した3Dビジョンベースのモーション戦略です。多様な環境におけるヒューマノイドロボットの自律動作能力を向上させます。従来の3D戦略とは異なり、iDP3は…

iDP3とは何ですか?

iDP3(Improved 3D Diffusion Policy)は、スタンフォード大学が複数の大学と共同で開発した、改良された3Dビジョン・モーター戦略(3D拡散戦略と同様)です。多様な環境におけるヒューマノイドロボットの自律動作能力を向上させます。従来の3D戦略とは異なり、iDP3は自己中心的な3D視覚表現に基づいており、精密なカメラキャリブレーションや点群セグメンテーションが不要となるため、ロボットは現実世界で柔軟にタスクを実行できます。iDP3は、視点の変化、新しい物体の認識、新しいシーンへの適応において優れた汎化能力を発揮し、未知の環境におけるヒューマノイドロボットの実用性と柔軟性を大幅に向上させます。

iDP3の主な機能

  • 自己中心的な3D視覚表現自己中心的な3D視覚表現を用いることで、3Dデータはカメラフレーム内で直接処理され、カメラのキャリブレーションや点群のセグメンテーションが不要になる。
  • 一般化能力
    • 表示一般化訓練時の特定の視点に制約されることなく、視点が大きく変化した場合でも、対象物を正確に把握することができる。
    • オブジェクトの一般化3D表現を用いることで、訓練中に見たことのない物体も処理でき、特定の物体の特徴に依存しない。
    • シナリオの一般化訓練環境とは複雑さや騒音レベルが異なる場合でも、未知の環境でタスクを実行する。
  • 高効率トレーニングと展開において高い効率性を示し、大規模データセットへの依存度を低減し、新しい環境にも迅速に適応します。

iDP3の技術原則

  • 3D視覚入力LiDARカメラから取得した3D点群データに基づいて、このデータはロボットの周囲環境に関する詳細な空間情報を提供する。
  • 自己中心的な視点従来の3D戦略とは異なり、iDP3は自己中心的な視点に基づいており、カメラフレーム内の3D表現を直接利用する。
  • 視覚入力を拡大するサンプリングポイントの数を増やすことで、シーン全体を捉えることができ、シーン全体の理解度を向上させることができる。
  • 改良されたビジュアルエンコーダー従来の多層パーセプトロン(MLP)ビジュアルエンコーダーをピラミッド型畳み込みエンコーダーに置き換えることで、人間のデモンストレーションから学習する際の滑らかさと精度が向上する。
  • より長い予測視野人間の専門家の判断のばらつきやセンサーノイズに対処するため、予測視野を拡大することで学習性能の向上を目指します。
  • 最適化と推論トレーニング中はAdamWオプティマイザが使用され、拡散プロセスの最適化と推論にはDDIM(Denoising Diffusion Implicit Models)が使用されます。

iDP3プロジェクトのアドレス

iDP3の応用シナリオ

  • ホームオートメーション人型ロボットは家庭内で掃除や片付けを行う。
  • 産業オートメーション人型ロボットは、組立ライン上で精密な組立作業を行う。
  • 医療支援人型ロボットは、看護ケアの補助や患者の移動を支援するために病院で使用されている。
  • 捜索救助人型ロボットは、災害現場で捜索救助活動を行う。
  • 教育と訓練人型ロボットは、複雑な操作手順を実演する教育補助者としての役割を果たす。