project
BigSet - TinyFish、オープンソースのマルチエージェントリアルタイムWebスクレイピングツール
Bigsetは、アメリカのスタートアップ企業TinyFishが開発したオープンソースのマルチエージェントシステムで、AGPL-3.0ライセンスで提供されています。ユーザーは必要なデータを自然言語で記述するだけで、システムが自動的にテーブル構造を推論したり、リアルタイムネットワークからエージェントをディスパッチしたりすることができます。
BigSetとは何ですか?
Bigsetは、米国のスタートアップ企業TinyFishが開発したオープンソースのマルチエージェントシステムで、AGPL-3.0ライセンスで提供されています。ユーザーは必要なデータを自然言語で記述するだけで、システムが自動的にテーブル構造を推論し、エージェントを派遣してリアルタイムネットワークからデータを取得し、重複排除と検証を行い、最終的にエクスポート可能なCSV/XLSX形式の構造化データセットを生成します。このツールは、30分から週単位までのスケジュール更新に対応しており、データセットを常に最新の状態に保ちます。
BigSetの主な機能
-
自然言語テーブルの構築必要なデータを一文で記述するだけで、AIが列名、データ型、主キーを自動的に推論するため、手動でテーブル構造を設計する必要がなくなります。
-
マルチエージェントデータ収集オーケストレーターエージェントが対象エンティティを検出し、サブエージェントが並行して単一のデータ項目を取得します。各エージェントは最大6つのツール呼び出しを行うことができ、検出からデータ入力までの全プロセスを自動的に完了します。
-
自動重複排除とソース追跡プライマリキーに基づく自動重複排除機能により、各データ行にはソースURLが付随し、すべてのデータの追跡可能性と検証可能性が保証されます。
-
定期的に更新する30分、6時間、12時間、毎日、毎週の5つの頻度で自動更新をサポートし、データセットをリアルタイムで同期します。
-
フォーマットエクスポート生成された結果はCSV形式とXLSX形式の両方で直接ダウンロードできるため、Excelやデータ分析ツールとの連携が容易です。
-
事前構築済みデータセット厳選された9つの公開データセットが含まれており、すぐに使用できます。
BigSetの技術的原則
- マルチエージェントオーケストレーションアーキテクチャBigSetは、Mastraフレームワーク上に構築されたマルチエージェントシステムです。その中核は、オーケストレーターとワーカーエージェントで構成されています。オーケストレーターは、ターゲットエンティティの検出とクローリングタスクの生成を担当します。ワーカーエージェントは、単一のデータクローリングを並列実行し、各エージェントは最大6つのツール呼び出しを実行します。Claude SonnetモデルとQwenモデルは、Vercel AI SDKとOpenRouterを介して一律にスケジュールされます。
- テーブル構造は自動的に推論されます。自然言語による記述を受け取ると、システムはClaude Sonnetを使用して意味意図を分析し、列名、データ型、主キー制約を自動的に推論します。このプロセスではスキーマを手動で指定する必要はありません。LLMは記述内のエンティティ関係とデータ特性に基づいて構造化されたテーブル定義を生成し、これが後続のデータ収集の検証基準として機能します。
- データ収集と重複排除の検証オーケストレーターは、対象エンティティを独立したタスクに分割し、並列フェッチのためにサブエージェントに割り当てます。各サブエージェントは、TinyFish Search / Fetch / Browser APIを呼び出して、リアルタイムネットワークからデータを取得します。結果が返されると、システムはプライマリキーに基づいてデータを自動的に重複排除し、データのトレーサビリティを確保するために、各データ行にソースURLを追加します。
- セキュリティ保護メカニズムツールチップ挿入攻撃を防ぐため、データセットIDはシステムプロンプトを介してLLMに渡されるのではなく、JavaScriptクロージャを使用して実行時に挿入されます。LLMは処理全体を通してデータセット識別子に直接アクセスしたり漏洩させたりすることができないため、データ収集ロジックとデータ権限が分離されます。
BigSetの使い方
- 環境準備DockerとMakeをインストールし、TinyFish、OpenRouter、Clerkの公式サイトにアクセスしてアカウントを登録し、APIキーを取得してください。
- リポジトリのクローン作成:埋め込む
git clone https://github.com/tinyfish-io/bigset.gitプロジェクトコードをダウンロードして….env.exampleコピー.env書類。 - 設定キー:存在する
.envこのファイルには、TinyFish、OpenRouter、Clerkの3種類のAPIキーが含まれており、サービスがデータ収集、モデル呼び出し、およびID認証に必要な権限を持っていることを保証します。 - サービスを開始する:走る
make devシステムは依存関係を自動的にインストールし、PostgresおよびConvexデータベースを起動し、コマンドを実行することでサービスのデプロイを完了します。 - アクセス利用状況ブラウザを開いてアクセスしてください
localhost:3500登録とログイン後、入力ボックスに自然言語で必要なデータを入力すると、システムが自動的に構造化データセットを生成します。 - プリセットデータの読み込み(オプション):埋め込む
make seed-public-datasetsこのコマンドを使用すると、厳選された9つの組み込み公開データセットをワンクリックで読み込むことができ、主要な機能の概要を素早く把握できます。
BigSetの主な利点
-
ゼロコンフィギュレーションデータ収集構造化データセットは、クローラーやセレクターを作成したり、URLを指定したりすることなく、自然言語による記述のみを使用して自動的に生成できます。
-
安全な隔離データセットIDはJSクロージャを介して注入されるため、処理全体を通してLLMからアクセスできず、即時インジェクション攻撃を効果的に防止します。
-
オープンソースとセルフホスティングAGPL-3.0プロトコルを採用しており、ワンクリックでDockerを使ってデプロイでき、データは完全に自律的かつ制御可能です。
-
エンタープライズレベルのインフラストラクチャこれは、4000万件以上のエージェント操作を処理してきた実績があり、安定性と信頼性に優れたTinyFishのエンタープライズグレードの検索およびクローリングAPIに基づいています。
BigSetのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/tinyfish-io/bigset
BigSetの競合製品比較
| 比較対象寸法 | BigSet | Firecrawl |
|---|---|---|
| 製品ポジショニング | 自然言語による記述からエクスポート可能な構造化データセットまで、マルチエージェント駆動型のデータセット生成プラットフォーム。 | APIファーストのWebスクレイピングおよびクローリングプラットフォームは、WebサイトをLLM対応のMarkdownまたは構造化データに変換します。 |
| 入力方法 | 自然言語による記述には、データトピック(例:「AI採用企業情報」)が必要です。 | URLを指定してクロールするか、または... /agent エンドポイントは、自然言語を使用して要件を記述します(URLは不要です)。 |
| データソースの発見 | AIは、手動でリンクを指定する必要なく、テーブル構造を自動的に推論し、エンティティソースを識別します。 | /agent 自動検索とナビゲーションは可能ですが、通常モードでは、ユーザーが開始URLまたはサイトマップを指定する必要があります。 |
| テーブル構造の定義 | LLMはスキーマ(列名、データ型、主キー)を自動的に推論し、リレーショナルデータセットを生成します。 | JSONスキーマまたは自然言語による提案を使用して抽出構造を定義することをサポートし、JSONオブジェクトを出力します。 |
| コレクション範囲 | 複数のサイトにわたるマルチソースデータを集約し、自動的に重複を排除して、統一されたデータセットを生成します。 | 指定されたURLからコンテンツを再帰的にクロールまたは抽出します。特に既知のウェブサイトのコンテンツに重点を置きます。 |
| 自動化レベル | オーケストレーター+サブエージェントのクローズドループ:検出→取得→重複排除→検証→テーブル作成→エクスポート、完全自律プロセス | シングルリンクまたはエージェントベースのクローリングおよび変換には、データセット管理のための外部ツールが必要です。 |
| 定期的に更新する | ネイティブサポート(30分/6時間/12時間/毎日/毎週) | スケジュールされたジョブは定期的に実行できますが、そのためにはAPIまたは外部スケジューラによる設定が必要です。 |
| 出力形式 | CSVおよびXLSX形式(ソースURL付き、Excel/BIで直接使用可能) | Markdown、JSON、HTML、スクリーンショット、リンク(LLM/RAGパイプライン向けに最適化済み) |
| データ重複排除 | 主キーに基づく自動重複排除により、データセットの一意性が保証されます。 | ユーザーは、後続の処理で重複排除ロジックを自身で処理する必要があります。 |
BigSetの応用シナリオ
-
競合製品のモニタリング競合他社の製品価格、機能アップデート、採用情報などを自動的に追跡し、定期的に更新可能な構造化された情報テーブルを生成します。
-
市場調査特定の業界における企業情報、資金調達動向、市場シェアデータを収集し、業界データベースを迅速に構築する。
-
投資分析株式、仮想通貨、スタートアップ企業の資金調達ラウンドや評価額の変化を追跡するためのデータ収集を行い、投資判断を支援する。
-
採用情報対象企業や業界の求人情報、必要なスキル、給与水準を監視し、人材市場の動向を分析する。
-
ECサイトの価格比較複数のプラットフォームから製品の価格、在庫、レビューデータを収集し、リアルタイムで更新される価格比較データセットを構築します。