AB
AiBoss
project

AGUVIS - 香港大学とSalesforceは共同で、統一された純粋にビジュアルなGUI自動化フレームワークを発表した。

AGUVISは、香港大学とSalesforceが共同開発した、統一された純粋なビジュアルフレームワークです。自律型GUIエージェント向けに設計されており、Web、デスクトップ、モバイルデバイスなど、さまざまなプラットフォームで動作します。AGUVISは画像観察に基づいており、...

AGUVISとは何ですか?

香港大学とSalesforceが共同開発した、統合型純粋ビジョンフレームワークであるAGUVISは、自律型GUIエージェント向けに設計されており、Web、デスクトップ、モバイルデバイスなど、さまざまなプラットフォームで動作します。AGUVISは、画像観察と自然言語コマンドと視覚要素の関連付けに基づいて、一貫したアクション空間を使用してクロスプラットフォームの汎化を実現します。明示的なプランニングと推論を組み合わせることで、AGUVISは複雑なデジタル環境におけるエージェントの自律的なナビゲーションとインタラクション機能を強化します。大規模なデータセットと2段階のトレーニングプロセスを通じて、このフレームワークはオフラインとオンラインの両方のシナリオで既存の手法を上回るパフォーマンスを実現し、外部のクローズドソースモデルに頼ることなくタスクを独立して完了できる初の純粋ビジョンGUIエージェントとなります。

AGUVISの主な機能

  • クロスプラットフォームの自律的なGUIインタラクション: さまざまなプラットフォーム(Webサイト、デスクトップ、モバイルデバイスなど)上で、GUIタスクを自律的に実行する。
  • 画像観察と自然言語コマンドの関連付け自然言語コマンドを視覚的なインターフェース要素にマッピングすることで、画像ベースのインタラクションが可能になります。
  • 明確な計画と推論これは計画立案能力と推論能力を統合しており、エージェントが環境を分析し、効果的な運用手順を生成することを可能にする。
  • 大規模データセットの構築マルチモーダル推論と基礎原理を含む、大規模なGUIエージェント軌跡データセットを作成する。

AGUVISの技術原理

  • 純粋なビジュアルフレームワークこのシステムは純粋に視覚的なアプローチを採用し、インターフェースの観察を画像として統一し、指示を画像座標に基づいて行うことで、環境を超えた汎用性を向上させている。
  • 統合行動空間標準化されたアクションスペースとプラグインシステムを使用することで、異なるプラットフォーム間で一貫した学習とインタラクションが実現されます。
  • 視覚言語モデル(VLM)VLMは、Qwen2-VLなどの基盤となるもので、任意の解像度の高解像度画像を処理し、動的にビジュアルトークンに変換します。
  • 2段階トレーニングパラダイム
    • フェーズ1:基礎訓練: 単一のGUIスクリーンショット内のオブジェクトをモデルが理解し、操作できるようにすることに重点を置きます。
    • フェーズ2:計画立案と推論の訓練基本的なトレーニングを土台として、より複雑な意思決定および推論プロセスを導入し、多様なエージェントの軌跡データに基づいてモデルをトレーニングします。
  • 内なる独白訓練中に、観察、説明、反省、低レベルのアクション指示などを含む詳細な内省的な独白を生成し、エージェントの思考プロセスをシミュレートして、計画能力を向上させる。
  • プラグインシステムこれは、既存のアクション空間に直接マッピングできないアクションに対して柔軟性を提供し、モデルが新しい環境やタスクに適応することを可能にする。

AGUVISプロジェクトの住所

AGUVISの応用事例

  • 自動テストソフトウェア開発において、Webサイト、デスクトップアプリケーション、モバイルアプリケーションなど、さまざまなグラフィカルユーザーインターフェースのテストを自動化し、ソフトウェアの安定性と信頼性を確保する。
  • バーチャルアシスタント仮想アシスタントとして、スケジュール管理、メール処理、データ入力といった日常的なコンピューター作業を自動化するのに役立ちます。
  • ビジネスプロセス自動化財務報告書の作成や顧客データの管理など、企業内の特定の業務プロセスを自動化することで、業務効率が向上します。
  • 教育と訓練教育・訓練目的で、現実世界のGUI操作をシミュレートするインタラクティブな教育ソフトウェアを作成する。
  • 顧客サービス自動化顧客サービス分野においては、顧客からの要望を自動的に処理し、GUIインターフェースに基づいて迅速な対応と解決策を提供する。