AB
AiBoss
project

Magma - マイクロソフトリサーチがワシントンD.C.の大学やその他の機関と共同で開発した、マルチモーダルAIの基盤モデル。

Magmaは、Microsoft Researchが開発した新しいマルチモーダルAI基盤モデルであり、マルチモーダルAIエージェントに汎用的な機能を提供します。Magmaは、デジタル環境と物理環境の両方を網羅するマルチモーダル入力を用いてタスクを理解し、実行することができます。

マグマとは何ですか?

Magmaは、Microsoft Researchが開発した新しいマルチモーダルAI基盤モデルであり、マルチモーダルAIエージェントに汎用的な機能を提供します。Magmaは、デジタル環境と物理環境の両方を網羅するマルチモーダル入力によるタスクを理解し、実行できます。膨大な量の視覚言語データとモーションデータで事前学習されたMagmaは、言語的、空間的、時間的な知能を組み合わせ、UIナビゲーションからロボット操作まで、複雑なタスクを実行します。実験では、Magmaはゼロショット環境とファインチューニング環境の両方で優れたパフォーマンスを発揮し、ロボット操作とマルチモーダル理解タスクにおいて既存の専用モデルを凌駕しました。

マグマの主な機能

  • マルチモーダルな理解画像、動画、テキストなど、複数の形式のデータを処理し、それらの意味情報、空間情報、時間情報を理解できます。単純な画像認識から複雑な動画理解まで、幅広いタスクに対応しています。
  • 行動計画と実行複雑なタスクを、実行可能な一連のアクションシーケンスに分解します。UIナビゲーション(Webページ操作やモバイルアプリケーション操作など)から、物理環境におけるロボット操作(物体の把持、配置、移動など)まで、あらゆる操作をサポートします。
  • 環境適応性UIナビゲーション、ロボット操作、マルチモーダル理解など、ゼロショット機能を備えた様々な下流タスクに適応できます。

マグマの技術原理

  • 事前学習済みアーキテクチャこの手法では、畳み込みニューラルネットワーク(ConvNeXtなど)をビジュアルエンコーダーとして使用し、画像データや動画データを処理します。エンコードされたビジュアル情報は、言語タグとともに大規模言語モデル(LLM)に入力され、動作シーケンスや言語記述が生成されます。
  • Set-of-Mark (SoM)これは、画像内のインタラクティブな視覚オブジェクト(GUIのボタンやロボットアームのターゲット位置など)にラベルを付ける作業です。これらのラベルの位置を予測することで、モデルは動作を理解し、実行できるようになります(動作のグラウンディング)。
  • Trace-of-Mark (ToM)この機能は、動画内の物体の動きの軌跡(ロボットアームの動きなど)に注釈を付けます。予測される将来の軌跡に基づいて、モデルが動作シーケンスを理解し計画するのに役立ち、時間的なダイナミクスを理解する能力を高めます。
  • マルチモーダルデータ融合事前学習データには、画像、動画、ロボット操作データ、およびマルチモーダル理解タスクからのデータが含まれます。SoMおよびToM技術に基づき、これらの異なる種類のデータは単一の事前学習フレームワークに統合され、モデルの汎用性と適応性が向上します。
  • ゼロサンプルおよび微調整機能事前学習済みのモデルは、未知のタスク(サンプル数ゼロ)にも直接適用でき、高い汎化能力を発揮します。少量のデータで微調整を行うことで、パフォーマンスをさらに向上させ、特定のタスクのニーズに適応させることができます。

Magmaのプロジェクトアドレス

Magmaの応用シナリオ

  • ウェブおよびモバイルアプリケーションの運用検索、アプリケーションのインストール、フォームへの入力といった作業を自動的に完了させることができます。
  • ロボット操作ロボットを制御して、物体をつかむ、配置する、移動させるなどの作業を実行させる。
  • 動画の理解動画コンテンツを分析し、関連する質問に答えてください。
  • スマートアシスタント仮想アシスタントとして、指示を理解し、対話型のタスクを完了します。
  • 教育と訓練教育を支援し、運用上の指導やフィードバックを提供する。