project
BrowserAct Skills - オープンソースのAIエージェントブラウザ自動化CLIツール
BrowserAct Skillsは、AIエージェント向けのブラウザ自動化CLIツールであり、エージェントがブラウザを制御する際に生じる主要な課題、例えばCookieのない環境、スクレイピング対策、CAPTCHAのブロック、人間とコンピュータの連携におけるギャップなどに対処します。
BrowserActスキルとは何ですか?
BrowserAct Skillsは、AIエージェント向けのブラウザ自動化CLIツールです。エージェントがブラウザを制御する際に直面する主要な課題、例えばCookieのない環境、スクレイピング対策、CAPTCHAブロック、人間とコンピュータの連携におけるギャップなどに対応します。このツールは、環境層、実行層、人間層という3層構造の先進的なアーキテクチャを採用しており、エージェントが実際のブラウザ環境でタスクを安定して実行できるようにします。
BrowserAct Skillsの主な機能
-
検出防止環境コマンドライン制御モードとビジュアル制御モードの両方をサポートし、アンチクローリング機構を回避してボットとして識別されることを防ぎます。
-
三層構造環境層は、フィンガープリントの偽装、TLSローテーション、プロキシ切り替えを担当します。実行層は、CAPTCHAを自動的に解読し、保護されたページを密かに抽出します。人間層はリモートアシスタンスリンクを生成し、ユーザーが任意のデバイスから操作を引き継いだ後、エージェントはタスクをシームレスに継続します。
-
3つのブラウザモード:
chromeモード再利用ローカルログイン状態、stealthプライバシーモードは、ログインせずに一括でデータをスクレイピングするために使用されます。stealth固定IDモードは、ログイン済みの複数のブラウザを同時に実行する場合に使用されます。 -
複数アカウントの分離Stealth BrowserとStatic Proxyを使用することで、各アカウントは独立したブラウザ環境で実行され、それぞれ独立したログイン状態とネットワーク環境に紐づけられます。
-
同時ゼロ干渉複数のブラウザで並行して動作する場合、Cookie、フィンガープリント、プロキシは完全に独立しています。同じブラウザ内で複数のセッションで動作する場合、ログイン状態は共有されますが、実行は互いにブロックされません。
-
Skill-Forge拡張機能ターゲットWebサイトのAPIとデータパスを自動的に探索し、再利用可能なスキルパッケージを生成します。エージェントは、検証済みのパスを直接再利用してバッチタスクを実行できます。
BrowserActスキルの技術的原則
-
環境カモフラージュ動的なブラウザフィンガープリンティング、TLSフィンガープリントのローテーション、および住宅用プロキシの切り替えを使用することで、各セッションは実際のユーザーのネットワーク特性を示し、アンチボット検出を回避します。
-
実行層への侵入このシステムは、内蔵の自動CAPTCHA解析エンジンと隠しデータ抽出チャネルを備えており、エージェントが手動操作なしで保護されたページのコンテンツを直接取得できる。
-
人工層継続タスクの実行中に障害が発生した場合、リアルタイムのリモートコラボレーションリンクが生成されます。ユーザーが介入してタスクを完了すると、システムは自動的にセッションコンテキストを復元し、人間と機械のシームレスな引き継ぎを実現します。
-
インデックス付きインタラクションこれはページ要素をコンパクトな数値インデックスにマッピングすることで、エージェントがDOMを解析したりアクセシビリティツリーを読み込んだりすることなく、番号付きの命令によってブラウザを操作できるようにするものです。
-
意味記憶各ブラウザセッションは説明タグに紐付けられており、エージェントはタスクの意味に基づいて、操作を実行するのに最適なブラウザ環境を自動的に選択します。
BrowserActスキルの使い方
-
環境準備システムがWindows、macOS、またはLinuxであることを確認し、シェルコマンドをサポートするAIエージェントがインストールされていることを確認してください。
-
ワンクリックインストールエージェントに「browser-actをインストール」というコマンドを与え、GitHubスキルのソースアドレスを指定してください。エージェントが自動的にインストールと検証を完了します。
-
環境検出インストール後、エージェントは各セッションの開始時に、環境ステータス、ブラウザリスト、および利用可能なコマンドを自動的に取得します。
-
ページを抽出エージェントには、「ウェブページのコンテンツを抽出する」というタスクを実行するよう直接指示できます。BrowserActは、設定不要モードで保護されたページを自動的にクロールします。
-
セッションを作成するエージェントに特定のウェブサイトを開き、名前付きセッションを作成するように指示します。以降のすべての操作は、そのセッション内で独立して実行されます。
-
ステータスを確認するエージェントは現在のページ上のインタラクティブな要素のインデックス付きリストを返すため、ユーザーはDOMを解析することなくページ構造を理解できます。
-
操作を実行するエージェントは、インデックス付きの指示(例えば、3番目の要素をクリックしたり、2番目の入力ボックスにテキストを入力したりするなど)を通じて、ブラウザを正確に制御します。
-
モード選択タスクの要件に応じて、エージェントは3つのブラウザモードを切り替えることができます。ローカルのChromeログイン状態の再利用、プライバシーデータの一括取得、または固定IDを持つ複数のアカウントの並列操作です。
-
拡張機能をインストールする再利用可能なスキルを自動生成するには、エージェントにbrowser-act-skill-forge拡張機能をインストールさせ、対象のWebサイトとデータフィールドを説明するだけで済みます。
-
人間と機械のリレー認証コードまたはQRコードによるログインが発生すると、エージェントは自動的にリモートアシスタンスリンクを生成します。どのデバイスからでも操作が完了すると、エージェントはシームレスにタスクを続行します。
-
セキュリティ確認ブラウザの作成/削除、プロファイルのインポート、プロキシの変更など、機密性の高い操作を実行する場合は、各操作を個別に明示的に承認する必要があります。以前の承認は自動的に引き継がれません。
BrowserAct Skillsの主な利点
-
人間と機械の連携は途切れることなく継続される唯一の組み込み機能
remote-assistリモートコラボレーションリンクは、認証コードまたはQRコードが検出された時点でリアルタイム接続を生成します。ユーザーが任意のデバイスから操作を引き継ぎ完了すると、エージェントは中断やエラーなくタスクをシームレスに継続します。 -
3層構造のプログレッシブ逆検出このシステムは、環境層、実行層、および人間層で構成されており、完全に自動化されたシステムから人間の介入を必要とするシステムまで、あらゆる範囲を網羅しています。ほとんどのアンチクローリング機構は、エージェントに到達する前に無効化されます。
-
エージェントネイティブの高効率な相互作用インデックス作成手順を使用する
click 3/input 2 "..."エージェントはDOMを解析したり、アクセシビリティツリーをロードしたりする必要がなく、トークンは自然言語やJSON/HTML出力ソリューションよりもはるかに効率的です。 -
スキルの自己沈殿と再利用Skill-Forgeは、ターゲットWebサイトのAPIとデータパスを自動的に探索し、デプロイ可能なスキルパッケージを生成します。後続のバッチタスクは、検証済みのパスを直接再利用して実行できるため、エージェントは毎回ページ構造を再理解する必要がありません。
BrowserAct Skillsプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/browser-act/skills
BrowserActのスキルと類似製品との比較
| 比較対象寸法 | BrowserAct Skills | browser-use |
|---|---|---|
| 位置 | AIエージェント向けブラウザ自動化 CLI + スキルインフラストラクチャ「実行レベル」の補完に重点を置く | 最も活発なコミュニティ AIブラウザ自動化SDKフレームワーク(94,000以上の星を獲得)エンドツーエンドのエージェント自律的意思決定を重視している。 |
| 建築 | CLIツール+スキルパッケージ(エージェントはシェル経由でコマンドを実行します) | Python/TypeScript SDK + 自社開発 bu-ultra 専用モデル(LLM優先) |
| コアインタラクションパラダイム | インデックス作成手順(click 3 / input 2 "..."エージェントはDOM解析を必要とせず、トークンは非常に効率的です。 |
自然言語処理+DOM解析エージェントはアクセシビリティツリーまたはDOMを読み取り、クリックや入力に関する判断を自律的に行います。 |
| 探知回避機能 | 3段階の進捗環境層(フィンガープリント/TLS/プロキシローテーション)→実行層(自動CAPTCHAデコード/stealth-extract→ 手動レイヤー(リモートアシスタンス) |
内蔵のステルスブラウザ技術は基本的なスクレイピング対策を回避しますが、システムレベルの階層型アーキテクチャは存在しない。高度なCAPTCHAはご自身で処理する必要があります。 |
| 人間と機械の協働リンク | 内蔵 remote-assistリアルタイムリンクを生成します。ユーザーがスキャン/検証した後、エージェントは... シームレスな接続任務は中断されない。 |
人間と機械の協働機能が組み込まれていないCAPTCHA、QRコードスキャン、2FA、または外部からの介入を必要とするその他のプロセスに遭遇した場合、エージェントはエラーを直接報告するか、停止します。 |
| ブラウザモード | 3つのモード:chrome(ローカルログイン状態を再利用する)stealth プライバシー保護(残留物ゼロのバッチスクレイピング)stealth 固定ID(複数のアカウントを並行して使用) |
主にステルスモードを提供する。ローカルのChromeログイン状態の再利用機能はありません起動すると、通常は何もない状態からスタートします。 |
BrowserActスキルの応用シナリオ
-
自動データ収集これにより、ユーザーは既存のログイン状態を再利用して、公式アカウント、知乎、小紅書などのバックエンドにアクセスし、QRコードを繰り返しスキャンすることなく、記事データやユーザー情報を抽出できます。
-
アンチクローリング機構の回避通常は、小紅書(Xiaohongshu)のような厳格なスクレイピング対策が施されたプラットフォーム上のコンテンツをクロールし、動的ページを自動的に処理することができます。
-
人間と機械のリレー型コラボレーション認証コードまたはQRコードによるログインが発生すると、リモートアシスタンスへのリンクが生成されます。ユーザーが操作を完了すると、エージェントはタスクの流れを中断することなく、自動的に接続を再開します。
-
複数アカウントマトリックス操作電子商取引サイトとソーシャルメディアアカウントは、環境の相互汚染を避けるために、独立して運営されるべきである。
-
大量のスキル蓄積Skill-Forgeを使用すると、繰り返し発生するウェブサイト操作を再利用可能なスキルとして定着させ、後で一括実行できるようになります。