Mobile-Agent - アリババが独自開発したオープンソースのマルチモーダルモバイルデバイス向けインテリジェントエージェント。
Mobile-Agentは、ネットワーク上のノード間を移動してユーザーや他のエージェントに代わって動作できる、モバイルでインテリジェントなエージェントソフトウェアです。状況に応じて、現在の実行を中断し、別のデバイスで再開することができます。
Mobile-Agentとは何ですか?
Mobile-Agentは、ネットワーク内のノード間を移動してユーザーや他のエージェントに代わってタスクを実行できる、モバイルでインテリジェントなエージェントソフトウェアです。現在の実行を中断し、別のデバイスに移動して処理を再開し、結果を迅速に返すことができます。このモビリティは、プログラムの実行をデータソースにできるだけ近づけることで、ネットワーク通信のオーバーヘッドを削減し、帯域幅を節約し、負荷分散を行い、タスク実行を高速化し、分散システムの処理効率を向上させることを目的としています。
モバイルエージェントアプリケーションは、特にモバイルデバイス操作の分野で急速に発展しています。例えば、アリババと北京交通大学が共同で提案したMobile-Agent-v2は、マルチエージェントの連携によって効率的なナビゲーションを実現するモバイルデバイス操作アシスタントです。マルチモーダル大規模言語モデル(MLLM)に基づいて、複雑なモバイルデバイス操作タスクを自律的に完了できます。Mobile-Agent-v2は、計画エージェント、意思決定エージェント、および反省エージェントという3つの専門的な役割を担っています。過去の操作に基づいてタスクを生成し、操作プロセス中に自己反省と調整を実行できます。また、Mobile-Agentは純粋に視覚的なソリューションをサポートしており、システムUIファイルを必要とせず、画像を分析することで電話を理解および操作します。これにより、さまざまなモバイルオペレーティングシステム環境での柔軟なアプリケーションが可能になります。
第3世代GUIインテリジェントエージェントフレームワークであるMobile-Agent-v3は、視覚的マルチモーダルモデルGUI-Owlをベースとしており、GUI自動化技術において大きなブレークスルーを達成しました。PC、Web、モバイルシステムに対応し、複数のプラットフォーム上でインターフェース要素を正確に識別し、操作を実行できます。
モバイルエージェントの主な機能
- 運用位置Mobile-Agentは、画面上の特定のアイコンやテキストを正確に識別してタップすることができます。テキストの位置を特定するためのOCRツールやアイコンを識別するためのアイコン検出ツールなど、検出モデルや視覚認識ツールを用いて、アクションの位置を特定します。
- 自己計画ユーザーの指示と現在の画面状態に基づいて、Mobile-Agentはタスクが完了するまで一連の手順を自動的に計画・実行します。スクリーンショットを繰り返し取得し、操作履歴やシステムプロンプトと組み合わせて次のステップを決定します。
- 自己反省操作中にエラーや無効な操作が発生した場合、Mobile-Agentはそれらを迅速に検知し、是正措置を講じます。例えば、操作後に画面が変化しない場合やエラーページが表示された場合、他の操作を試行したり、パラメータを調整したりします。
- マルチアプリケーション運用Mobile-Agentは、複数のアプリケーション間での自動操作をサポートしており、異なるアプリケーション間の切り替えや、タスクを完了するための共同作業などを可能にします。
- ピュアビジョンソリューションズシステムXMLファイルやその他のメタデータに依存せず、画像を分析することで電話機を理解し操作するため、その動作は制限されない。
モバイルエージェントの技術原理
- マルチモーダル大規模言語モデルMobile-Agentは、大規模な言語モデル(GPT-4Vなど)を組み合わせて、ユーザーの自然言語コマンドを理解し、実行します。このモデルは、スクリーンショットやユーザーコマンドを読み取ることで、対応する操作手順を生成できます。
- 視覚認識技術
- テキストとアイコンの検出このシステムは、光学文字認識(OCR)ツールを使用して画面上のテキストを検出し、アイコン検出ツールとCLIPモデルを使用してアイコンの正確な位置を特定します。これにより、モバイルエージェントは画面上の要素を正確に識別して位置を特定し、精密な操作を実行できます。
- スクリーンショット分析Mobile-Agentは、現在のスクリーンショットを分析することで、操作に必要な視覚情報を取得します。スクリーンショットを入力として使用し、操作履歴やユーザーコマンドと組み合わせて、次のステップを決定します。
- マルチエージェント協調メカニズムMobile-Agentは、視覚認識エージェント、意思決定エージェント、実行エージェント、反射エージェントなど、複数の専門エージェントで構成されるマルチエージェントアーキテクチャを採用しています。これらのエージェントはそれぞれ固有の機能を実行し、連携して複雑なモバイルデバイス操作タスクを完了します。
- 自律的なミッション計画と実行
- 自己計画Mobile-Agentは、ユーザーの指示と現在の画面状態に基づいて、一連の操作手順を自動的に計画および実行できます。スクリーンショットを繰り返し取得し、プロンプトと操作履歴を処理して、次のステップを生成します。
- 自己反省操作中にエラーや無効な動作が発生した場合、Mobile-Agentはそれらを迅速に検知し、是正措置を講じます。例えば、操作後に画面が変化しない場合やエラーページが表示された場合、Mobile-Agentは別の操作を試行したり、パラメータを調整したりします。
- プロンプト形式Mobile-AgentはReActのプロンプト形式を採用しており、エージェントは「観察」「思考」「行動」の3つの要素を出力する必要があります。これにより、エージェントはタスクをよりよく理解し、実行できるようになります。
モバイルエージェントプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/X-PLUG/MobileAgent
- arXiv技術論文:https://arxiv.org/pdf/2401.16158
- オンラインでデモを体験してください:https://huggingface.co/spaces/junyangwang0410/Mobile-Agent
モバイルエージェントの応用シナリオ
- モバイルデバイス操作アシスタントMobile-Agentは、ユーザーの指示に基づいて、アプリケーションの起動、ボタンのクリック、テキストの入力など、モバイルデバイス上でさまざまな操作を実行できるため、使いやすさが向上します。
- 複数アプリケーションによる協調操作異なるアプリケーション間での切り替えや共同作業をサポートしており、例えば、あるアプリケーションから情報をコピーして別のアプリケーションに貼り付けるといったことが可能です。
- 自動テストユーザー操作をシミュレートし、モバイルアプリケーションの自動テストを実行するために使用され、テストの効率と精度を向上させます。
- インテリジェントなナビゲーションとタスクプランニングユーザーの目標と現在の状況に基づいて、タスクが完了するまで一連の操作を自動的に計画および実行します。例えば、複雑なアプリケーション環境における特定の機能の検索と実行などです。
- 視覚認識に基づく操作純粋な画像認識ソリューションにより、画像のみを分析して携帯電話を理解・操作することができ、システムデータ構造に制約されることなく、さまざまなオペレーティングシステムに柔軟に適用できる。