project
SearchClaw - 中国人民大学が開発したAI深層研究インテリジェントエージェント
SearchClawは、中国人民大学情報検索研究所(RUC-NLPIR)が開発した、自己ホスト型のAI深層研究エージェントであり、ウェブベースの対話型インターフェースを備えています。ユーザーが質問を送信すると、システムは自動的に複数回のウェブ検索を実行します。
SearchClawとは何ですか?
SearchClawは、中国人民大学情報検索研究所(RUC-NLPIR)が開発した、自己ホスト型のAI深層研究エージェントで、ウェブベースの対話型インターフェースを備えています。ユーザーが質問を送信すると、システムは自動的に複数回のウェブ検索、ページクローリング、論文検索、コンテンツ合成を実行し、最終的に引用リンク付きの詳細なレポートを生成します。FastAPIを基盤とするこのプロジェクトは、「ツール+フック」アーキテクチャによって研究品質を保証し、様々なLLMプロバイダーと永続メモリをサポートしており、研究者やアナリストが追跡可能な自動化された研究を実施するのに適しています。
SearchClawの主な機能
-
自律的な複数ラウンドの研究サイクル回答が条件を満たすまで、検索、取得、読み込み、参照のプロセスを自動的に繰り返します。
-
複数ソースからの情報検索統合されたウェブ検索(Google/Serper)、学術検索(Semantic Scholar/DBLP/arXiv)、ニュース検索(NewsAPI/Google News RSS)、およびWeChat公式アカウントの記事検索。
-
ブラウザとの深い統合Playwright/CDPを介してJavaScriptページをレンダリングし、ログイン状態でのクロールをサポートします。
-
的確なフォローアップ質問と説明調査プロセス中に、ユーザーのニーズを明確にするために、追加の質問をユーザーに投げかけることができる。
-
研究計画の内訳複雑なクエリを自動的に追跡可能なサブタスクに分解し、それらを段階的に実行します。
-
高品質アクセス制御システム組み込みのチェック機能は、引用数、情報源の多様性、回答の完全性をチェックします。これらの基準を満たしていない場合は、調査が続行されます。
-
コンテキスト圧縮管理2段階圧縮メカニズムにより、長時間のセッションがコンテキストウィンドウの制限を超えないことが保証されます。
-
セッション間持続記憶過去の調査から得られた質の高い情報源、ユーザー設定、重要な事実を自動的に保存し、再利用します。
SearchClawの使い方
-
リポジトリをクローンして依存関係をインストールします:
git clone https://github.com/RUC-NLPIR/SearchClaw.git && pip install -e . -
APIキー(LLMおよび検索ソース)を設定する:設定
ANTHROPIC_API_KEYまたはOPENAI_API_KEY推奨構成SERPER_API_KEYそしてJINA_API_KEY検索品質を向上させる。 -
サービスを開始する:
python -m src.mainブラウザアクセスhttp://localhost:8000。 -
結果を返す研究課題を入力すると、システムはWebSocket経由でリアルタイムに参考文献を含む包括的なレポートを返します。
SearchClawの重要な情報と使用要件
-
環境要件Python 3.11以降に対応。Linux/macOS/Windowsをサポート。
-
LLMサポートAnthropic、OpenAI、Google Gemini、xAI、Alibaba Tongyi、ByteDance、Zhipu GLM、Lunar Dark Sideといった主要なモデルに加え、litellmルーティングを介したローカルのvLLM/Ollamaエンドポイントもサポートしています。
-
依存関係を検索Serperが利用できない場合は自動的にDuckDuckGoによるデータ取得にダウングレードし、Jinaが利用できない場合は直接HTTPリクエストにフォールバックします。
-
オプションのブラウザ:埋め込む
pip install -e '.[browser]' && playwright install chromiumJavaScriptレンダリングのサポートを有効にします。 -
セキュリティ設定リモート展開
SEARCH_CLAW_API_KEY不正使用を防ぐため、アクセスパスワードを設定してください。 -
永続ストレージメモリデータとセッションデータは、デフォルトではローカルファイルシステム上にJSON形式で保存されます。
SearchClawの主な利点
-
検証可能な引用品質複数の情報源からの引用を義務付け、アクセス制御チェックを通過することは、幻覚のリスクを軽減し、単一ラウンドのRAGによる断片的な情報の接合よりも優れている。
-
自律的な計画立案とエラー修正複雑なタスクを自動的に分解し、品質が基準を満たさない場合でも、反復プロセスにおいて手動による介入を必要とせずに、研究を自己維持します。
-
マルチソース異種統合これは、英語の学術リポジトリ、中国のWeChat公式アカウント、リアルタイムニュースを同時に網羅する唯一のオープンソース研究ツールであり、国境を越えた研究シナリオに適しています。
-
完全セルフホスティングデータはオンプレミスに保持され、ローカルのLLMエンドポイントをサポートすることで、機密性の高い研究データに関するプライバシーコンプライアンス要件を満たします。
SearchClawのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/RUC-NLPIR/SearchClaw
SearchClawの競合製品比較
| 比較対象寸法 | SearchClaw | Perplexity | PaperClaw |
|---|---|---|---|
| 展開方法 | 完全セルフホスト型のローカルFastAPIサーバー | クラウドベースのSaaSサービス、クローズドソースの商用製品 | 自己ホスト型で、研究自動化に特化 |
| 研究の深度 | 複数回の自律的なサイクルが、計画の分解と品質アクセス制御をサポートします。 | 単回探索または浅い複数回探索によって、直接解答を生成する。 | エンドツーエンドの紙複製と実験の自動化 |
| ソースカバレッジ | ウェブページ、学術コンテンツ、ニュース記事、WeChat公式アカウントに対応。CDPログインとデータスクレイピングをサポート。 | ウェブページ、学術コンテンツ、ニュースは網羅しているものの、中国のソーシャルメディアに関する詳細な報道が不足している。 | 学術文献とコードリポジトリに焦点を当てる |
| 参照機構 | 複数のソース参照の強制、フックチェックの数と多様性 | 参考文献は自動的に生成されますが、必須の検証メカニズムはありません。 | 実験レポートとコード参照を生成する |
| プライバシー管理 | データはすべてローカルであり、ローカルなLLMをサポートします。 | データはクラウドにアップロードされます。エンタープライズ版では、より高度なプライバシー保護が提供されます。 | 研究の再現性に焦点を当てたローカルデータ処理 |
| インタラクションモード | WebSocketによるリアルタイムストリーミング、フォローアップクエリにも対応。 | 中間確認ステップなしの対話型リアルタイム検索 | 人的介入箇所を減らした自動実行 |
SearchClawの応用事例
-
文献レビューこのツールは、Semantic ScholarとarXivから論文を自動的に取得し、当該分野の進歩に関する引用要約を生成することができます。
-
市場競合他社の監視ニュースソースやWeChat公式アカウントを自動的に追跡し、競合他社の活動を分析し、タイムスタンプ付きの参照データを出力します。
-
政策・規制研究このツールは、政府のウェブサイトやシンクタンクの報告書をクロールし、多言語の情報源を統合してコンプライアンス分析レポートを作成することができる。
-
技術選定評価この機能を使うと、技術系ブログ、GitHubのディスカッション、学術論文などを検索して、さまざまなフレームワークのコミュニティ評価やパフォーマンスデータを比較できます。