AB
AiBoss
project

RynnEC - アリババDAMOアカデミーが立ち上げた世界理解モデル

RynnECは、アリババDAMOアカデミーが開発した世界理解モデル(MLLM)であり、身体化された認知タスク向けに特別に設計されています。このモデルは、位置、機能、数量など11次元からシーン内のオブジェクトを包括的に分析し、オブジェクト理解、空間認識などをサポートします。

RynnECとは何ですか?

RynnECは、アリババDAMOアカデミーが開発した世界理解モデル(MLLM)であり、特に身体化された認知タスク向けに設計されています。このモデルは、位置、機能、数量など11次元からシーン内のオブジェクトを包括的に分析し、オブジェクト理解、空間理解、ビデオオブジェクトセグメンテーションをサポートします。RynnECは、3Dモデルを必要とせず、ビデオシーケンスのみを使用して連続的な空間認識を確立でき、柔軟なインタラクションをサポートします。RynnECは、身体化された知能のための強力な意味理解機能を提供し、ロボットが物理世界をよりよく理解するのに役立ちます。

RynnECの主な機能

  • 対象理解RynnECは、シーン内のオブジェクトを複数の次元(位置、機能、数量など)から分析することができ、オブジェクトの詳細な説明と分類をサポートします。
  • 空間認識これは、ビデオシーケンスに基づいて連続的な空間認識を確立し、3D認識をサポートし、物体間の空間的な関係を理解する。
  • ビデオオブジェクトセグメンテーションテキストによる指示に基づいて動画内の対象物をセグメント化でき、特定の領域やオブジェクトを正確に注釈付けすることをサポートします。
  • 柔軟なインタラクション自然言語による対話に対応しており、ユーザーはコマンドを通じてモデルとリアルタイムでコミュニケーションを取り、フィードバックを得ることができる。

RynnECの技術原則

  • マルチモーダル融合この手法では、マルチモーダル融合技術を用いて、動画データ(画像や動画シーケンスを含む)と自然言語テキストを組み合わせ、モデルが視覚情報と言語情報を同時に処理できるようにします。動画の特徴は動画エンコーダ(SigLIP-NaViTなど)を用いて抽出され、その後、言語モデルを用いて意味理解が行われます。
  • 空間認識このモデルは、ビデオシーケンスに基づいて連続的な空間認識を確立するため、追加の3Dモデルは不要です。時系列情報と空間関係モデリング技術を用いることで、空間内の物体の位置と動きをモデルが理解できるようにします。
  • ターゲットセグメンテーションこれは、テキストコマンドによる動画オブジェクト分割技術です。このモデルは、ユーザーの指示に従って動画内の特定のオブジェクトを識別し、分割することができます。マスキングと領域ラベリングの技術を用いて、動画フレーム内の特定領域を正確に分割します。
  • トレーニングと最適化RynnECは、画像質問応答、動画質問応答、動画オブジェクト質問応答など、さまざまな形式の大規模なラベル付きデータで学習されています。段階的な学習戦略を採用し、モデルのマルチモーダルな理解力と生成能力を段階的に最適化します。また、LORA(Low-Rank Adaptation)技術をサポートしており、重みマージに基づいてモデルのパフォーマンスをさらに最適化します。

RynnECのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/alibaba-damo-academy/RynnEC/

RynnECの応用シナリオ

  • 家庭用サービスロボットこれは、家庭用ロボットがコマンドを理解し、「リモコンを取ってきて」といった家庭環境内のアイテムを正確に特定して操作するのに役立ち、それによってホームオートメーションのレベルを向上させます。
  • 産業オートメーション産業現場において、この技術はロボットが生産ライン上の物体を識別・操作し、「赤い部品を青いトレイに置く」といった複雑な作業を完了させるのに役立ち、それによって生産効率を向上させる。
  • スマートセキュリティ「赤い車両の監視」など、ビデオ監視によるターゲットのリアルタイム追跡は、セキュリティシステムのインテリジェンスと応答性を向上させる。
  • 医療支援これにより、医療ロボットは「302号病棟に薬を届ける」といった指示を理解し、タスクを実行できるようになり、医療サービスの精度と効率が向上する。
  • 教育と訓練動画分割技術は、「細胞構造の表示」など、教育を支援するために活用でき、学生の複雑な概念の理解と学習体験を向上させることができる。