project
MMSkills - 上海交通大学と小紅書が共同で立ち上げた、マルチモーダルなスキルフレームワーク。
MMSkillsは、上海交通大学とXiaohongshuが共同で開発した、汎用ビジュアルエージェント向けのマルチモーダルスキルフレームワークです。プレーンテキストのステップから、テキストフロー、ランタイム状態カード、マルチビュー機能などを含む、再利用可能なスキルの拡張をサポートしています。
MMSkillsとは何ですか?
MMSkillsは、上海交通大学とXiaohongshuが共同で開発した、汎用ビジュアルエージェント向けのマルチモーダルスキルフレームワークです。プレーンテキストの手順から、テキストフロー、ランタイム状態カード、マルチビューキーフレームを含むマルチモーダルな手続き型知識へと、再利用可能なスキルを拡張することをサポートします。ブランチローディングメカニズムにより、実行時にビジュアルエビデンスを効率的に呼び出し、Gemini、Qwen、Kimi、GLMなどの複数のモデルファミリーに対し、GUIタスクやOSWorld、macOSWorld、VAB-Minecraftなどのゲームタスクにおいて、安定した改善をもたらします。
MMSkillsの主な機能
- マルチモーダルスキルパックの構築テキストフロー、ランタイムステータスカード、およびマルチビューキーフレームを統合して、再利用可能な視覚的手続き型知識ユニットを形成する。
- 自動スキル生成公開されている非テストのインタラクション軌跡に基づいて、タスククラスタリング、スキルプランニング、統合と一般化、視覚的監査という5つの段階を経て、マルチモーダルなスキルライブラリが自動的に抽出されます。
- ブランチの読み込みメインエージェントは実行時に一時的にスキルブランチを開き、完全なコンテキストを一度に注入するのではなく、必要に応じてスキルを呼び出すことで、視覚的な証拠が主要な意思決定プロセスを汚染することを防ぎます。
- 選択を表示現在のスクリーンショット、過去のアクション、およびステータスカードに基づいて、スキルパックから最も関連性の高いキーフレームと視点をインテリジェントに選択し、位置合わせを行います。
- 構造化された意思決定ガイダンスブランチが視覚的なアライメントを完了すると、適用可能な項目、サブゴール、計画、実行すべきでない項目、検証項目などを含む、簡潔な意思決定支援情報をメインエージェントに返します。
- ドメイン横断的なタスクカバレッジGUIデスクトップの自動化と、Minecraftやスーパーマリオブラザーズなどのビジュアルゲームタスクの両方をサポートしており、シーンをまたいだマルチモーダルスキルの転送と再利用を可能にします。
MMSkillsの技術的原則
- マルチモーダルスキルパックの定義MMSkillsは、従来のテキストスキルを、SKILL.mdテキストフロー、State_cards.jsonランタイム状態カード、およびImagesマルチビューキーフレームを含む完全なユニットに拡張し、エージェントが視覚的な状態に基づいてスキルを使用するタイミングと進捗状況を確認する方法を判断できるようにします。
- 自動スキル生成単に元のプレゼンテーションを保存するのではなく、タスククラスタリング、クラスタ内スキルプランニング、スキル統合と一般化、テキストドラフト生成、ビジュアルグラウンディング、監査という5つの段階を経て、公開された軌跡から再利用可能な診断状態の知識を自動的に抽出します。
- 分岐ロード実行時メカニズムメインエージェントがスキルが有用であると判断した場合、一時的にスキルブランチを開き、ビュー選択を実行して主要な状態視点を選択します。その後、ブランチプランニングが視覚的な証拠を現在の環境に合わせ、圧縮された構造化意思決定支援を返します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MMSkillsの使い方
- スキルライブラリにアクセス「ハグ顔」データセットにアクセスして、事前に生成されたマルチモーダルスキルパックをダウンロードしてください。
- 統合メインエージェントMMSkillsの分岐読み込みメカニズムを、既存のビジュアルエージェントの推論プロセスに統合する。
- トリガースキルコールメインエージェントは、実行時に現在のタスクが特定のスキルに合致するかどうかを判断し、ブランチ読み込み要求を開始します。
- 体系的なガイダンスを受ける一時的な分岐処理が視覚的な証拠の整合を完了すると、適用可能な項目、サブゴール、計画などの意思決定支援情報を返します。
- 実行して検証するメインエージェントは、返された指示に基づいてアクションを実行し、ステータスカードを通じてタスクの進捗状況を確認します。
MMSkillsの主な利点
- 国家を意識した意思決定スキルパックには実行時ステータスカードが含まれており、エージェントは現在のインターフェースがスキルの前提条件を満たしているかどうかを判断できます。
- 視覚的証拠の整合性マルチビューキーフレームは、エージェントがテキストの条件を実際のシーンに重ね合わせるのに役立ち、意図しない操作を回避します。
- 効率的なコンテキスト管理ブランチローディングは、スキルセット全体がメインコンテキストに直接注入されるのを防ぎ、参照イメージが現在の意思決定を汚染するのを防ぎます。
- 小型モデルには大きな利点がある。外部のマルチモーダルな手続き的知識は、Qwen3-VL-8Bのような小型モデルにおいて、内部プロセスにおける事前知識の不足を補い、パフォーマンスを2倍以上に向上させる。
- 行動パターン最適化無効なクリックや反復的な操作を大幅に削減し、エージェントが探索的な試行錯誤から状態認識型の実行へと移行することを可能にする。
MMSkillsプロジェクトの住所
- プロジェクト公式サイト:https://zkangning.github.io/MMSkills_for_Visual_Agents/
- GitHubリポジトリ:https://github.com/zkangning/MMSkills_for_Visual_Agents
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/zhangkangning/mmskills
- arXiv技術論文:https://arxiv.org/pdf/2605.13527
MMSkillsと類似製品との比較
| 寸法 | MMSkills | Text-only Skills |
|---|---|---|
| スキル表現 | テキストフロー + ステータスカード + マルチビューキーフレーム | プレーンテキストの手順またはアクション図 |
| 国家判断 | 実行時ステータスカードとスクリーンショットを使用して、現在のインターフェースの状態を判断します。 | テキストによる説明だけを頼りに推測すると、インターフェースの実際の状態を見落としやすい。 |
| ランタイム読み込み | ブランチローディング:視覚的な証拠を選択的に一時的なブランチにロードします。 | 通常、全文読解スキルはメインの文脈に直接組み込まれます。 |
| 文脈汚染 | ビュー選択フィルタリングにより、参照画像がメインエージェントを汚染するのを防ぎます。 | テキストには画像による干渉はないものの、視覚的な根拠に欠けている。 |
| 典型的な故障事例 | 現在アクティブなワークシートやボタンの利用状況などを識別できます。 | 間違ったワークシートにグラフを簡単に作成でき、グレーアウトされたボタンを誤ってクリックしてしまう可能性がある |
| OSWorldの総合的なパフォーマンス | Gemini 3.1 Pro: 50.11%;Qwen3-VL-235B: 39.17% | Gemini 3.1 Pro: 40.76%;Qwen3-VL-235B: 28.57% |
MMSkillsの応用事例
-
デスクトップGUI自動化Ubuntu/macOS環境で、LibreOfficeのグラフ作成やファイル権限の変更など、複雑なアプリケーション間操作を実行します。
-
ゲームAIエージェントMinecraftのサバイバルモードで、遠距離からのアイテム入手やクラフト計画を実行したり、プラットフォームゲームで視覚に基づいた意思決定を行ったりする。
-
エンタープライズRPAの機能強化既存のロボットプロセス自動化システムに視覚的な状態認識機能を追加することで、ソフトウェア間の連携動作の安定性を向上させる。
-
視覚的タスク指導手動操作の経験は、トレーニングや他のエージェントの学習支援に利用できる、再利用可能なマルチモーダルなスキルライブラリへと変換される。