AB
AiBoss
project

RynnVLA-001 - Alibaba DAMO Academyによるオープンソースの視覚・言語・行動モデル

RynnVLA-001は、アリババDAMOアカデミーが開発した視覚・言語・動作モデルです。このモデルは、多数の一人称視点動画を用いた事前学習を通して人間の操作スキルを学習し、それをロボットアームの制御に暗黙的に応用します。

RynnVLA-001とは何ですか?

RynnVLA-001は、アリババDAMOアカデミーが開発した視覚・言語・動作モデルです。このモデルは、多数の一人称視点動画を用いた事前学習によって人間の操作スキルを学習し、これらのスキルをロボットアームの操作に暗黙的に転移させます。動画生成技術と変分オートエンコーダー(VAE)を組み合わせることで、人間の動きにより近い、一貫性のある滑らかな動作シーケンスを生成できます。また、「次フレーム予測」と「次動作予測」を単一のTransformerアーキテクチャに統合することで、複雑なタスクにおけるロボットの成功率とコマンド遵守率を大幅に向上させています。

RynnVLA-001の主な機能

  • 言語指示の理解「赤い物体を青い箱の中に移動させてください」といった自然言語による指示を受け取ります。
  • アクションシーケンスを生成する指示と現在の視覚環境に基づいて、ロボットアームを駆動してタスクを完了させるための、一貫性のある滑らかな一連の動作を生成する。
  • 複雑なシナリオに適応する複雑な掴み動作や配置動作、長時間を要する動作にも対応でき、動作の成功率を向上させることができます。
  • 人間の操作を模倣する一人称視点の動画から学習することで、生成される動作はより自然な人間の動作に近づく。

RynnVLA-001の技術原理

  • フェーズ1大規模な一人称視点ビデオデータで事前学習された一人称視点ビデオ生成モデルは、人間の動作における視覚パターンと物理的ダイナミクスを学習します。自己回帰型Transformerアーキテクチャに基づき、将来のフレームを予測することで、ロボット動作の視覚的推論プロセスをシミュレートします。
  • フェーズ2変分オートエンコーダー(VAE)は、動作セグメントをコンパクトな埋め込みベクトルに圧縮することで、計算負荷を軽減します。VAEデコーダーは、これらの埋め込みベクトルを整合性のある動作シーケンスに復元することで、動作予測の滑らかさを向上させます。
  • フェーズ3Vision-Language-Motion(VLA)モデルは、事前学習済みの動画生成モデルをVLAモデルに微調整し、「次のフレーム予測」と「次の動作予測」を統合します。Transformerアーキテクチャを使用し、視覚入力と言語コマンドを組み合わせてモーション埋め込みベクトルを生成し、ロボットにタスクを実行させます。

RynnVLA-001のプロジェクトアドレス

  • プロジェクト公式サイト:https://huggingface.co/blog/Alibaba-DAMO-Academy/rynnvla-001
  • GitHubリポジトリ:https://github.com/alibaba-damo-academy/RynnVLA-001
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Alibaba-DAMO-Academy/RynnVLA-001-7B-Base

RynnVLA-001の応用シナリオ

  • 産業オートメーション工業生産においては、ロボットは複雑な組み立て作業や品質検査作業を遂行するために活用され、それによって生産効率と製品品質が向上している。
  • サービスロボット家庭向けサービスやケータリングサービスでは、ロボットは自然言語による指示に基づいて、片付けや食事の配達といった日常的なサービス業務を行うことができる。
  • 物流と倉庫管理物流倉庫では、ロボットを誘導して商品の仕分けや取り扱いを完了させ、在庫管理プロセスを最適化する。
  • 健康管理医療分野では、外科手術やリハビリテーション訓練を支援し、医療サービスの精度と効率性を向上させる。
  • 人間と機械の協働人間と機械が協働する場面では、ロボットは人間の指示をよりよく理解し、自然で円滑な人間と機械の相互作用を実現できる。