AB
AiBoss
project

BrowseComp - OpenAIが提供する、ウェブブラウジング機能を評価するためのオープンソースAIエージェントベンチマーク。

BrowseCompは、OpenAIが開発したオープンソースのベンチマークツールで、AIエージェントのウェブブラウジング能力を評価するために使用されます。映画、科学技術、芸術、歴史、スポーツ、音楽など、幅広い分野を網羅した1266問の非常に難易度の高い問題が含まれています。

BrowseCompとは何ですか?

BrowseCompは、OpenAIが提供するオープンソースのベンチマークで、AIエージェントのウェブブラウジング能力を評価するためのものです。映画、科学技術、芸術、歴史、スポーツ、音楽、ビデオゲームなど、さまざまな分野を網羅した1266の非常に難易度の高い問題が含まれています。AIエージェントはインターネットを検索し、特定のサッカーの試合やテレビのキャラクターを識別するなど、複雑な制約に一致させる必要があります。テストでは、OpenAIのGPT-40とGPT-4.5は極めて低い精度しか達成できませんでしたが、新たにリリースされたエージェントモデルであるDeep Researchは51.5%の精度を達成し、自律的な検索、情報統合、精度調整における優位性を示しました。

BrowseCompの主な機能

  • 複雑な情報検索能力の評価BrowseCompには、映画、科学技術、芸術、歴史、スポーツ、音楽、ビデオゲームなど、幅広い分野を網羅した1266の非常に難易度の高い問題が収録されています。これらの問題では、AIエージェントが広大なインターネットを徹底的に検索し、問題に提示された複雑な制約条件に合致する可能性のある回答を照合する必要があります。
  • 難易度を厳密に制御した問題設計問題の難易度を確実にするため、データサイエンティストは3つの主要なチェックポイントを通じてプロセスを厳密に管理しました。既存のモデル(OpenAIのGPT-40、GPT-4.5、およびDeep Researchの以前のバージョンなど)では問題を解決できないことを確認すること。簡単なGoogle検索を5回実行して、検索結果の最初のページに回答が表示されないようにすること。そして、他のデータサイエンティストが10分以内に解決できないほど問題が困難であることを確認することです。
  • 回答検証の信頼性問題の難易度は高いものの、解答は簡潔明瞭で、参照解答を使えば簡単に検証できる。この設計により、このベンチマークは難易度が高く、かつ公平なものとなっている。
  • AIブラウジングプロキシ技術の開発を促進するBrowseCompのオープンソース版は、AIブラウジングエージェントの研究に新たなツールと方向性を提供し、よりスマートで信頼性の高いブラウジングエージェントの開発を促進します。

BrowseCompの技術原則

  • 複雑な問題の設計BrowseCompには、AIエージェントがインターネット上の複数のウェブサイトにわたって多段階の推論と情報検索を実行する必要がある、非常に難易度の高い問題が1266問収録されています。これらの問題は、複雑な現実世界の情報検索シナリオをシミュレートするように設計されており、AIエージェントがアクセスが困難な相互接続された情報を処理することを要求します。
  • 複数ソースの情報統合AIエージェントは、質問に対する答えを見つけるために、複数のウェブサイトにアクセスし、さまざまな情報源からの情報を統合する必要があります。例えば、典型的な質問では、エージェントはスポーツイベントの記録や審判情報など、複数のウェブサイトにアクセスして正しい答えを導き出す必要があるかもしれません。
  • 推論と検索戦略単純な情報検索にとどまらず、AIエージェントには強力な推論能力も必要です。これにより、取得した情報に基づいて論理分析や包括的な処理を実行できるようになります。例えば、Deep Researchモデルは、検索結果に基づいて検索戦略を自律的に調整し、検索経路を動的に最適化できるため、BrowseCompにおいて非常に優れた性能を発揮します。
  • 動的な適応性AIエージェントは動的に適応できる必要があり、検索プロセス中に遭遇するさまざまな情報に基づいて迅速に反応し、検索戦略を調整できる能力が求められます。適応性によって、エージェントは複雑なネットワーク環境において、より効果的に目的の情報を見つけることができるようになります。
  • コンピューティングリソースの影響テスト結果によると、コンピューティングリソースを増やすことで、複雑なウェブブラウジングタスクにおけるAIエージェントのパフォーマンスを大幅に向上させることができる。コンピューティングリソースが増えることで、エージェントはより多くの検索経路を試行できるようになり、正解を見つける確率が高まる。

BrowseCompのモデルパフォーマンス

  • GPT-4oとGPT-4.5両モデルはBrowseCompにおいて、それぞれ0.6%と0.9%という低い精度しか得られず、性能は低かった。GPT-4oにブラウジング機能を追加した後でも、精度は0.6%から1.9%にしか向上しなかった。これは、モデルにブラウジング機能を与えるだけでは、BrowseCompの複雑な問題を効果的に解決できないことを示している。
  • OpenAI o1モデル閲覧機能は備えていないものの、このモデルは高い推論能力のおかげで9.9%の精度を達成しました。これは、ウェブ閲覧タスクにおいても推論能力が同様に重要であることを示しています。たとえウェブから直接情報を取得できない場合でも、既存の知識に基づいた深い推論によって、モデルはいくつかの質問に対する答えを見つけることができるのです。
  • 深層研究モデルこれはOpenAIの最新エージェントモデルで、BrowseCompテストにおいて51.5%という高い精度を達成し、非常に優れた性能を発揮しました。このモデルはブラウジングツールを効率的に活用し、取得した情報を詳細に分析・処理します。Deep Researchモデルは高い適応性を持ち、検索プロセス中に取得した様々な情報に基づいて、迅速に反応し、検索戦略を調整します。

BrowseCompのプロジェクトアドレス

BrowseCompの応用シナリオ

  • 企業知識ベースのインテリジェント検索これは、企業知識ベースのインテリジェントな検索に利用でき、例えば、大量の研究文書をインテリジェントな質疑応答システムに変換することで、研究開発担当者の情報検索効率を向上させることができる。
  • Eコマース製品ガイド電子商取引分野では、インテリジェントなショッピングガイドシステムを構築するために利用でき、ユーザーが複雑なニーズを満たす商品を迅速に見つけるのに役立つ。
  • 政府情報公開サービス政府機関はこの情報を利用して、より効率的な情報公開サービスを提供し、国民が必要な政策、規制、その他の情報を迅速に入手できるように支援することができる。
  • 研究開発研究者はこれを利用してAIモデルの推論および検索戦略をテストおよび改善することができ、それによって情報検索分野におけるAI技術のさらなる発展を促進することができる。