project
コンピュータ利用プレビュー - GoogleのオープンソースAIブラウザ自動化ツール
Computer Use Previewは、Googleが提供するオープンソースのAI搭載ブラウザ自動化ツールです。Geminiモデルの視覚認識機能を基に、「スクリーンショット→分析→アクション」のプロセスを通じて、固定されたモデルに頼ることなく、ウェブページに対する人間の操作をシミュレートします。
コンピュータ使用プレビューとは何ですか?
Computer Use Previewは、Googleが提供するオープンソースのAI搭載ブラウザ自動化ツールです。Geminiモデルの視覚認識機能に基づき、要素の固定配置に頼ることなく、「スクリーンショット→分析→アクション」のプロセスを通して、ウェブページとの人間によるインタラクションをシミュレートします。このツールは、ウェブサイト間のデータ転送や視覚的なインタラクションといった複雑なタスクにも対応でき、タスク完了テストでは69%という優れたスコアを記録し、類似ツールを凌駕しています。Gemini APIとVertex AIを統合したComputer Use Previewは、強力なタスク理解能力を備えており、ウェブテスト、データ収集、日常業務など、幅広い用途に適しています。コーディング経験のない初心者にも最適なツールです。
コンピュータ使用プレビューの主な機能
- 自然言語駆動型ユーザーは簡単な自然言語でタスクを説明するだけで、AIが複雑なスクリプトを作成する必要なく、自動的に作業を計画・実行するため、参入障壁が大幅に低下します。
- インテリジェントなインタラクションナビゲーション、クリック、フォーム入力、スクロールといった複雑なブラウザ操作の処理をサポートします。Geminiモデルは、ページ内の動的な変化を理解し、さまざまなシナリオに適応できます。
- デュアル環境サポート
- 劇作家(地元で活動)Chromeブラウザのインスタンスをローカルで制御することは、ローカルでのデータ処理が必要なシナリオに適しています。
- Browserbase(クラウド環境)Browserbaseインスタンスに接続します。クラウドのリソースサポートや分散運用が必要なシナリオに適しています。
- デバッグしやすいスクリーンショット機能とマウスカーソル位置表示機能をサポートしており、ユーザーは実行プロセスをリアルタイムで監視できるため、デバッグや最適化が容易になります。
- AI大規模モデルアンサンブルGemini APIとVertex AIを統合することで、強力なタスク理解機能と、複雑な指示や動的なウェブページコンテンツを処理する能力を提供します。
コンピューターの使用プレビューの使い方
- 準備コンピュータ使用プレビューのGitHubページからプロジェクトファイルをダウンロードし、ローカルマシンに解凍してください。
- 動作環境をセットアップするPythonをインストールし(3.8以上を推奨)、プロジェクトの依存関係を分離するための仮想環境を作成してアクティブ化します。
- 依存関係をインストールしますプロジェクトフォルダ内で、プロジェクトの依存関係とPlaywrightブラウザをインストールするコマンドを実行します。
- APIキーの設定Google CloudからGemini APIキーを取得し、環境変数に追加してください。
- ツールを実行する「Google にアクセスして『Hello World』と入力してください」のように、自然言語コマンドを使用してツールを実行します。
- オプション設定実行環境(PlaywrightやBrowserbaseなど)を指定し、必要に応じて関連するパラメータを設定します。
コンピュータ使用プレビューのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/google-gemini/computer-use-preview
- オンライン体験アドレス:Browserbase
コンピュータ使用プレビューの応用シナリオ
-
Web自動テストウェブページの機能を迅速にテストし、ボタンのクリック、フォームの送信、その他の操作が正しく機能しているかどうかを確認するために使用されます。
-
データ収集このツールは、ニュースや製品情報などのウェブページから、手動操作を必要とせずにデータを自動的に抽出できます。
-
サイト間データ転送あるウェブサイトから別のウェブサイトへデータを自動的に移行することで、データ移行プロセスを簡素化します。
-
日々のタスクの自動化このツールは、自動ログインやスケジュールされたクエリなど、定型的で反復的なタスクの実行をサポートし、時間と労力を節約します。
-
視覚的インタラクションタスクこのツールは、ウェブページ要素の識別と分類、ドラッグアンドドロップ操作の実行など、複雑な視覚的インタラクションを処理できます。