AB
AiBoss
project

WebSailor - Alibaba Tongyi Labsが開発したオープンソースのネットワークインテリジェントエージェント

WebSailorは、アリババ傘下のTongyi Labsが開発したオープンソースのネットワークエージェントで、複雑な情報検索と推論タスクに特化しています。革新的なデータ合成手法(SailorFog-QAなど)やトレーニング技術(拒否サンプリングによるファインチューニング、DUPなど)を活用しています。

WebSailorとは何ですか?

WebSailorは、アリババの同義研究所が開発したオープンソースのネットワークエージェントで、複雑な情報検索と推論タスクに特化しています。革新的なデータ合成手法(SailorFog-QAなど)とトレーニング技術(棄却サンプリングの微調整やDUPOアルゴリズムなど)により、難易度の高いタスクで優れた性能を発揮し、BrowseCompなどのベンチマークで多くの有名モデルを凌駕し、オープンソースネットワークエージェントのリーダーボードでトップに立っています。WebSailorの推論再構築技術は、複雑なタスクを効率的に処理し、簡潔かつ正確な推論チェーンを生成します。複雑なシナリオで非常に優れたパフォーマンスを発揮し、単純なタスクでも高い汎化能力を示します。

WebSailorの主な機能

  • 複雑なタスクデータの合成WebSailorは、SailorFog-QA手法を用いて、不確実性の高い複雑なタスクデータを生成し、現実世界における複雑な情報検索シナリオをシミュレートします。
  • 複数ターンにわたるツール呼び出しと推論のリファクタリングWebSailorは、オープンソースの推論モデルを活用することで、複数回のツール呼び出しを行い、推論プロセスをリファクタリングし、複雑な問題を効率的に処理することができます。
  • 強化学習アルゴリズムDUPOアルゴリズムを採用し、動的サンプリング戦略によって学習効率を最適化することで、モデルの意思決定能力を大幅に向上させる。
  • 情報検索と分析WebSailorは、複数のウェブページを積極的に検索・アクセスし、情報間の関係性を分析し、完全かつ正確な回答を提供することができます。

WebSailorの技術原則

  • データ合成(SailorFog-QA)WebSailorはまず、SailorFog-QAメソッドを用いて、不確実性の高い複雑なタスクデータを生成します。次に、「知識グラフランダムウォーク」手法を採用し、Wikipediaなどの知識ベースからあまり一般的でないエンティティを起点として、知識グラフをランダムに拡張し、複雑な非線形関係ネットワークを構築します。さらに、問題記述をファジー化することで(例えば、特定の年を期間に変更したり、一部の情報を隠したりするなど)、タスクの初期不確実性を高めます。
  • モデル学習(RFTコールドスタート)トレーニング段階では、WebSailorはコールドスタートのためにリジェクションサンプルファインチューニング(RFT)を使用します。RFTは、高品質な解の軌跡を選択することでモデルを初期調整し、モデルが基本的な推論とツール呼び出しの習慣を習得できるよう支援します。
  • 強化学習(DUPOアルゴリズム)コールドスタートが完了すると、WebSailorはDUPO(反復サンプリング最適化)アルゴリズムを用いた強化学習フェーズに入ります。DUPOの中核は、動的なサンプリング戦略にあります。トレーニング前に過度に単純なサンプルを除外し、トレーニング中は難易度の高い軌跡を繰り返しサンプリングします。これによりトレーニング効率が大幅に向上し、モデルは複雑なタスクにも迅速に対応できるようになります。

WebSailorプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/Alibaba-NLP/WebAgent

WebSailorアプリケーションのシナリオ

  • 複雑な情報検索WebSailorは、曖昧で複雑なクエリにも対応でき、多段階の推論と相互検証を通じて、膨大な情報の中から迅速に回答を見つけて検証します。
  • 複数回のジャンプを伴う質問と回答タスク複数段階の質問応答シナリオにおいて、WebSailorは複数のツール呼び出しと推論を用いることで、複雑な質問を分解し、回答を見つけることができます。
  • 科学研究とデータ分析WebSailorは、研究者やアナリストが複雑な情報ネットワークを迅速に精査し、複数の情報源から情報を統合し、完全かつ正確な結論を導き出すのに役立ちます。
  • 高難易度タスクのトレーニングと最適化WebSailor用のトレーニングデータセットであるSailorFog-QAは、複雑な現実世界の情報検索シナリオをシミュレートします。高い不確実性と複雑な関係ネットワークを構築することで、事前に定義された解決経路を持たない複雑なタスクにも対応できます。