project
LoHoSearch - Meituanの次世代検索インテリジェンスベンチマーク
LoHoSearchは、MeituanのLongCatチームが開発した次世代検索インテリジェンスベンチマークです。762万件のWikipediaエンティティと2億6500万件の関係エッジを網羅するナレッジグラフに基づいて質問を自動的に生成し、従来の手動による質問生成に取って代わります。
LoHoSearchとは何ですか?
LoHoSearchは、MeituanのLongCatチームが立ち上げた次世代検索エージェントベンチマークです。762万件のWikipediaエンティティと2億6500万件の関係エッジを網羅する知識グラフに基づいて質問を自動的に生成し、従来の手動による質問生成方法に取って代わります。このベンチマークには、音楽、映画、地理など11のドメインを網羅する544の高品質で人間が検証した質問が含まれており、検索空間と構造的複雑さの両方を制御することで課題を作り出しています。現在の最高性能モデルであるGPT-5.5の精度はわずか34.74%で、BrowseCompでの90%を超える性能をはるかに下回っており、長距離検索推論とコンテキスト管理のためのより識別力の高い評価基準を提供します。
LoHoSearchの主な機能
- 知識グラフの自動構築英語版ウィキペディア全文をデータソースとして使用し、762万個のエンティティノードと2億6500万個の有向エッジを持つ巨大な知識グラフを構築した。各エンティティにはWikidataタイプと入次数人気度がラベル付けされており、グローバルな視点からのトピック選択の基盤となっている。
- 二次元的な難易度制御このシステムは、検索空間と構造的複雑さという2つの側面から問題の難易度を調整することで、手作業による問題作成における認知的な限界を打ち破ります。
- ツリー構造とグラフ構造のサンプリングツリー構造は探索空間を拡大することで難易度を上昇させる一方、グラフ構造は巨大な探索空間の上に循環依存関係や相互制約を導入することで、構造的な複雑さをさらに増大させる。
- 自動QA生成および検証ウィキの説明はサブグラフから抽出され、自然言語の質問に書き換えられます。その後、質問は関係抽出、サブグラフの網羅性チェック、回答の満足度検証という3つの層を通して自動的にフィルタリングされます。最後に、品質を確保するために手動でレビューされます。
- マルチモデル性能評価これは、主流の検索エージェントの標準化された評価をサポートし、精度、ツール呼び出し回数、キャリブレーション誤差などのコア指標を出力することで、モデルの長距離推論能力を直感的に反映します。
LoHoSearchの技術原則
- 知識グラフの自動構築データソースとして英語版ウィキペディア全文を使用し、762万件のエンティティページをノードとして抽出し、テキスト中の2億6500万件のハイパーリンクを有向エッジとして抽出した。各エンティティにはWikidata P31タイプと入次数人気度をラベル付けし、グローバルな知識ネットワークを構築した。
- 二次元的な難易度の定義質問の難易度は、「探索空間」と「構造的複雑性」という2つの直交する次元から定量化され、手作業で作成された質問の認知的な限界を打破する。
- ツリー構造サブグラフサンプリング探索空間を拡大して難易度を上げることで、単一の解答ノードから複数の独立した分岐が下方向に展開されます。各分岐は、候補空間の制約条件に対応しており、これにより排除コストが指数関数的に増加します。
- グラフ構造サブグラフサンプリング広大な探索空間に基づき、循環依存関係と相互制約が導入されます。複数の条件ノードが相互に接続されています。解は複数の相互関係を同時に満たす必要があり、構造的な複雑さが増し、二重の課題が生じます。
- 関係抽出と自然言語生成サンプリングされたサブグラフから各エンティティのWikipediaの説明を抽出し、大規模なモデルを使用してそれらを一貫性のある自然言語の質問に書き換え、各手がかりが元のサブグラフ内の関係情報を完全に保持していることを確認します。
LoHoSearchの使い方
- データ読み込み中:合格
datasetsライブラリの直接読み込みmeituan-longcat/LoHoSearch544の質問と標準的な回答を入手できます。 - ビュー構造このデータセットには、質問文、対応するサブグラフ構造、ドメインラベル、および知識グラフによって検証された一意の回答が含まれています。
- アクセス評価テスト対象の探索エージェントに問題を入力し、その推論過程と最終出力を記録する。
- 自動採点モデルの出力結果をデータセットで提供されている標準解答と比較し、すべての制約が満たされているかどうかを確認し、精度を計算します。
- 比較分析データセットに付随するサブグラフの複雑さとドメインラベルを用いて、様々な難易度やトピックにおけるモデルのパフォーマンスを多角的に分析します。
LoHoSearchの主な利点
- 手動による質問生成の限界を突破する従来の手動ベンチマークは、アノテーターが把握しているエンティティの範囲によって制限されます。LoHoSearchは、グローバルな知識グラフを活用することで、検索空間が広く構造的に複雑な「実際の問題」を体系的に特定できます。
- 難易度は既存のベンチマークよりもかなり高い。同じモデルはBrowseCompでは58.84%の精度を達成しましたが、LoHoSearchではわずか10.02%でした。ツール呼び出しの平均回数は35回から61回に増加し、チャレンジの難易度は74%上昇しました。
- より強い差別化既存のコンテキスト管理戦略は、BrowseCompではパフォーマンスを14.03%向上させるが、LoHoSearchではわずか6.8%しか向上させないため、長期的かつ複雑なシナリオにおける戦略の限界的なメリットをより正確に反映している。
- 構造的複雑性は独立しており、制御可能である。グラフ構造問題の正答率(8.01%)は、ツリー構造問題の正答率(11.89%)よりも著しく低く、構造の複雑さは探索空間とは無関係に難易度を高める要因であり、個別に定量化できることが証明された。
LoHoSearchのプロジェクトアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/meituan-longcat/LoHoSearch
- arXiv技術論文:https://arxiv.org/pdf/2606.12837
LoHoSearchの競合比較
| 寸法 | LoHoSearch | BrowseComp |
|---|---|---|
| 質問形式 | 自動知識グラフ生成+手動検証 | 人工設計 |
| 質問数 | 544 | 数百の |
| 対象地域 | 11分野(音楽、映画・テレビ、地理など) | 未定義のフィールド |
| 難易度調整 | 探索空間+構造的複雑性(2次元) | 人間の主観的制御 |
| 最高のモデル精度 | GPT-5.5:34.74% | GPT-5.5 Pro:90.1% |
| ツール呼び出しの中央値 | 59回 | 26回 |
| 文脈に応じた政策推進 | +6.8% | +14.03% |
| 飽和状態 | 飽和状態には程遠く、高い分化度を示している | 飽和状態に近づいている。 |
| 適用可能なシナリオ | 長距離探索推論とコンテキスト管理の評価 | 基本的な検索能力の評価 |
LoHoSearchの応用事例
- 検索エージェントの能力評価これは、長距離推論能力を持つ検索エージェントに対して、非常に難易度の高い標準化されたテストを提供し、複雑な情報検索チェーンにおけるモデルの弱点を正確に特定します。
- コンテキスト管理戦略の検証極めて長いやり取りが発生するシナリオにおいて、要約、すべて破棄、検証などのコンテキスト圧縮および検証戦略の真の効果を評価し、単純なベンチマークでこれらの戦略の有効性を過大評価しないようにする。
- モデル反復ベンチマークこれは、研究チームに対し、モデルのバージョン反復中に能力の限界を検出したり、性能を比較したりする際に役立つ、未飽和の評価基準を提供する。
- 検索アルゴリズムに関する研究本システムは、多段階の推論と交差検証を必要とする複雑な検索アルゴリズムの研究のために、難易度を制御可能なデータセットと評価フレームワークを提供する。
- スマートエージェント製品選択LoHoSearchは、企業が検索エージェントソリューションを選択する際に、現実世界の複雑なクエリシナリオにおけるさまざまなモデルの実際のパフォーマンスを区別するのに役立ちます。