AB
AiBoss
project

ScreenAgent - 視覚言語モデルに基づいた、コンピュータ制御のインテリジェントエージェント

ScreenAgentは、吉林大学人工知能学部の研究チームによって開発された、コンピュータ制御のインテリジェントエージェントです。このエージェントは、ビジュアル言語モデル(VLM)に基づいており、実際のコンピュータ画面と対話することができます。

ScreenAgentとは何ですか?

ScreenAgentは、吉林大学人工知能学部の研究チームが開発した、コンピュータ制御型のインテリジェントエージェントです。ビジュアル言語モデル(VLM)に基づき、実際のコンピュータ画面と対話することができます。研究者らは、エージェントがコンピュータ画面と継続的に対話できるよう、「計画・実行・反映」のワークフローを構築しました。ScreenAgentのコア機能は、スクリーンショットを観察し、対応するマウスとキーボードの操作を出力することで、グラフィカルユーザーインターフェース(GUI)を操作し、複雑な多段階タスクを実行することです。

ScreenAgent公式サイトへの入り口

ScreenAgentの運用プロセス

  • 画面表示ScreenAgentは、コンピュータ画面上のスクリーンショットを観察し、理解することができます。この機能はVNCプロトコルによって実現されており、エージェントはデスクトップオペレーティングシステムのリアルタイム画像を表示できます。
  • 行動創出ScreenAgentは、観測されたスクリーンショットに基づいて、対応するマウスおよびキーボード操作を生成できます。これらの操作は、マウスの移動、クリック、ダブルクリック、スクロール、ドラッグ、キーボード入力などを含む、JSON形式のコマンドシーケンスとして出力されます。
  • タスク計画ScreenAgentは、ユーザーのタスク指示に基づいて複雑なタスクを複数のサブタスクに分解し、各サブタスクに対応するアクションシーケンスを計画することができます。これには、タスクを理解し、分解し、戦略を策定することが含まれます。
  • アクションを実行する計画段階の後、ScreenAgentはマウスとキーボードのコマンドをコンピュータに送信することで、計画されたサブタスクを実行し、ユーザーの目的を達成します。
  • 振り返りと評価ScreenAgentはアクションを実行した後、結果を評価し、現在のサブタスクを再試行するか、次のサブタスクの実行を続行するか、またはプラン全体を調整するかを決定します。

ScreenAgentの技術原則

  • ビジュアル言語モデル(VLM)
    • VLMは、視覚処理と言語処理の機能を組み合わせたモデルであり、画像の内容を理解し、それに対応する自然言語による説明を生成することを可能にする。
    • ScreenAgentでは、VLMを使用してスクリーンショットを解析し、ユーザーのタスクプロンプトを理解し、タスクを完了するための一連のアクションを計画します。
  • 学習環境を向上させる
    • ScreenAgentはVNCプロトコルを介して実際のコンピュータ画面と対話し、強化学習環境を構築します。この環境において、エージェントは画面の状態(状態空間)を観察し、行動(行動空間)を実行し、パフォーマンス結果に基づいて報酬(報酬関数)を受け取ります。
  • 制御プロセス
    • 計画エージェントは、現在のスクリーンショットとタスクプロンプトに基づいて、タスクを細分化し、一連のサブタスクとそれに対応するアクションシーケンスを計画します。
    • 実行インテリジェントエージェントは、計画フェーズの出力に基づいてマウスとキーボードのコマンドを送信することにより、コンピュータインターフェースを操作する。
    • 振り返るエージェントは実行されたアクションの結果を評価し、再試行するか、続行するか、または計画を調整するかを決定します。
  • データセットと評価
    • ScreenAgentデータセットには、モデルのトレーニングと評価に使用される、さまざまな日常的なコンピュータ作業のスクリーンショットとアクションシーケンスが含まれています。
    • CCスコア(Vision Language Computer Control Score)は、コンピュータ制御タスクにおけるエージェントのパフォーマンスを測定するために使用される、きめ細かな評価指標です。
  • モデルトレーニング
    • ScreenAgentモデルは、ScreenAgentデータセットを用いて、複雑なコンピュータ制御タスクを効果的に計画、実行、そして振り返る方法を学習します。学習には、教師あり学習、強化学習、人間フィードバックループ(RLHF)など、さまざまな手法が用いられます。