project
Crawl4LLM - 清華大学とカーネギーメロン大学が共同でオープンソース化したインテリジェントなウェブクローラーシステム
Crawl4LLMは、清華大学とカーネギーメロン大学が共同開発したオープンソースのインテリジェントWebクローラーシステムで、大規模言語モデル(LLM)の事前学習の効率向上を目的としています。Crawl4LLMは、LLMの事前学習におけるWebページの価値をインテリジェントに評価し、クロールするWebページの優先順位を決定します。
Crawl4LLMとは何ですか?
Crawl4LLMは、清華大学とカーネギーメロン大学が共同開発したオープンソースのインテリジェントWebクローラーシステムで、大規模言語モデル(LLM)の事前学習の効率を向上させます。Crawl4LLMは、LLMの事前学習における価値をインテリジェントに評価し、価値の高いWebページを優先的にクロールすることで、従来のクローラーの約5倍の効率を実現します。Crawl4LLMは、インテリジェントモード、ランダムクロールモード、リンクベースクロールモードの3つのクロールモードをサポートしています。また、クローラーの状態の定期的な保存やデータ可視化などの機能を備え、DCLMフレームワークとシームレスに統合して、モデル学習に直接使用できます。
Crawl4LLMの主な機能
- インテリジェントなウェブページ選択このシステムは、LLMの事前学習における価値に基づいて、価値の高いウェブページを優先的にクロールすることで、データ品質を向上させ、無効なデータのクロールを削減します。
- 複数のクロールモード:
- スマートモードウェブページの価値評価に基づき、価値の高いウェブページのクロールを優先する。
- ランダムモードウェブページをランダムにクロールします。厳密な要件がないシナリオに適しています。
- リンク数のパターンに基づくこのツールはリンク数に基づいてウェブページをクロールするため、大規模なデータ収集に適しています。
- クローラーの状態は定期的に保存されます。定期的にクローラーの状態を保存する機能をサポートしており、中断された場合でも中断箇所からクロールを再開できるため、データ損失を回避できます。
- データ閲覧と視覚化データ閲覧ツールと視覚化インターフェースを提供することで、ユーザーはクローリングの進行状況と結果をリアルタイムで簡単に監視できます。
- DCLMフレームワークとのシームレスな統合収集したデータは、データストリームの効率と精度を向上させるために、LLMの事前学習に使用されます。
Crawl4LLMの技術的原理
- 事前トレーニングの影響スコアCrawl4LLMは、事前学習済みの影響力スコアラー(DCLM fastTextなど)を使用してWebページを評価します。このスコアラーは、コンテンツの品質や関連性などの指標に基づいて、WebページがLLMの事前学習にどれだけ貢献しているかを評価します。各クローリングイテレーションにおいて、新たに発見されたWebページはスコアラーによって評価され、そのスコアに基づいてクローリングの優先順位が決定されます。
- 優先キューCrawl4LLMは優先度キューに基づいてWebページの優先順位を決定し、評価の高いページから順にクロールします。これは、従来のグラフ接続性(PageRankなど)に基づくスケジューリングメカニズムに代わるものです。この優先度キューを使用することで、Crawl4LLMは事前学習に最も価値のあるWebページを迅速に発見してクロールし、価値の低いページのクロールを削減します。
- 多次元データ評価Crawl4LLMは、ウェブページのコンテンツ品質を考慮し、リンク数やコンテンツの長さなど複数の要素を組み合わせて総合的なスコアを算出します。また、高スコアのウェブページのリンク関係を分析することで、潜在的に価値の高いウェブページをさらに発見します。
- シミュレーションと最適化ClueWeb22データセットを用いて大規模なシミュレーション実験を行い、様々なシナリオにおける有効性を検証した。これらの実験に基づき、限られたクロール量で最適な事前学習結果が得られるよう、アルゴリズムのパラメータを最適化した。
- ウェブサイトへの負荷を軽減するCrawl4LLMは、不要なウェブスクレイピングを削減し、ウェブサイトのトラフィック負荷を軽減し、スクレイピング活動のコンプライアンスを向上させます。ウェブサイトやネットワークリソースへのデータスクレイピングの負荷を軽減し、事前学習済みデータの取得において、より持続可能なアプローチを促進します。
Crawl4LLMのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/cxcscmu/Crawl4LLM
- arXiv技術論文:https://arxiv.org/pdf/2502.13347
Crawl4LLMの応用シナリオ
- LLM事前学習データ収集大規模言語モデルの事前学習に必要な高品質データを効率的に取得する。
- 検索エンジン最適化検索結果の質を向上させ、ユーザーエクスペリエンスを最適化する。
- データセットの構築研究やビジネスニーズを満たす高品質なコーパスを迅速にフィルタリングして構築します。
- ネットワーク監視と分析オンライン上の動向を監視し、トレンドとなっているトピックや情報発信を分析する。
- エンタープライズレベルのデータ取得知識管理や市場分析のために、特定の分野のデータを正確に収集する。