AB
AiBoss
project

VPP - 清華大学と興東時代が共同開発した初の大型AIGCロボットモデル

VPP(Video Prediction Policy)は、清華大学と興東時代が共同開発した初の大規模AIGCロボットモデルです。事前学習済みの動画拡散モデルに基づき、インターネット上の膨大な動画データから学習し、将来のシーンを直接予測します。

VPPとは何ですか?

VPP(Video Prediction Policy)は、清華大学とStar Eraが共同開発した初のAIGC(AI生成集団)ロボットモデルです。事前学習済みの動画拡散モデルに基づき、インターネット上の膨大な動画データから学習し、将来のシーンを直接予測してロボットの動作を生成します。VPPは、将来を事前に予測し、高頻度の予測と動作実行を実現し、ヒューマノイドロボットのボディ切り替えをサポートし、高品質な実機ロボットデータへの依存度を大幅に低減します。VPPは、Calvin ABC-Dベンチマークテストでほぼ満点に近いスコアを獲得し、実世界における複雑かつ器用な操縦タスクで優れた性能を発揮しました。VPPのオープンソース性は、具現化されたインテリジェントロボットの開発に強力な技術的サポートを提供します。

VPPの主な機能

  • 将来のシナリオを予測するこれにより、ロボットは行動を起こす前に未来を「予見」できるようになり、汎化能力が向上する。
  • 高頻度予測と行動実行予測周波数は6~10Hz、制御周波数は50Hz以上を実現し、動作の滑らかさを向上させています。
  • ロボット間オントロジー学習: 人間の操作データを含む、さまざまな形態のロボットのビデオデータを直接学習することで、データ取得コストを削減します。
  • マルチタスク学習と汎化掴む、置く、積み重ねる、水を注ぐ、道具を使うといった、現実世界における複雑な作業において優れた性能を発揮します。
  • 説明可能性とデバッグの最適化予測ビデオに基づいて、障害シナリオを事前に特定できるため、開発者はより的確な最適化を行いやすくなります。

VPPの技術原理

  • 動画拡散モデル(VDM)の予測的な視覚表現これは、事前学習済みのビデオ拡散モデル(Stable Video Diffusionなど)に基づいて将来のシーンを予測することを学習するものです。ビデオ拡散モデルは、単一ステップのノイズ除去に基づいて予測的な視覚表現を生成し、これには現在のフレームが含まれ、将来のフレームを明示的に表現することができます。
  • 運動学習Video Formerは、予測的な視覚表現を集約し、時空間情報を抽出するために使用されます。ロボットの動作は拡散ポリシーに基づいて生成され、予測から実行へのシームレスな移行を実現します。
  • 最適化と一般化VPPはインターネット上の動画データとロボットの動作データを用いて学習されるため、高品質な実機データへの依存度を低減できます。また、異種エンティティ学習に基づいて、VPPは形状の異なるロボットの動画データから直接学習できるため、モデルの汎化能力が向上します。

VPPプロジェクトの住所

VPPアプリケーションシナリオ

  • ホームサービス家事(水を注ぐ、物を取ってくるなど)、高齢者や子供の世話(物を届けるなど)を行う。
  • 工業生産部品のピッキング、貨物の取り扱い、積み重ねなどに使用され、生産効率の向上に役立ちます。
  • 医療支援手術器具の配送、リハビリテーション訓練、病棟備品の配送を支援する。
  • 教育と研究これは、学生が複雑な操作手順を理解し、それを実験室での実験に応用するのに役立ちます。
  • サービス業サービス内容には、レストランからのデリバリー、ホテルでの荷物運搬、公共施設でのガイド付きツアーなどが含まれます。