project
E-Bench - テンセント・フンユアンなどが開発した、インテリジェントエージェントを評価するためのベンチマーク。
E-Benchは、テンセントの渾源チームが清華大学AIRおよび東南大学と共同で開発した、多段階のツール使用評価ベンチマークです。Honor of Kings、QQ Music、Tencent Meetingという3つの実在製品を基に、完全に合成された仮想環境を構築しています。
E-Benchそれは何ですか?
E-Benchは、テンセントの渾源チームが清華大学AIRおよび東南大学と共同で開発した、複数ステップのツール使用評価ベンチマークです。Honor of Kings、QQ Music、Tencent Meetingという3つの実在製品を基に、323の状態変化タスク、41のデータベーステーブル、76,000件を超えるデータエントリを含む、完全に合成された仮想環境を構築します。情報ギャップとツールギャップという二重の非対称設計により、エージェントは隠れた情報を積極的に収集し、複数ステップのツール呼び出しをオーケストレーションする必要があります。最終的に、決定論的なデータベース状態差分スコアを用いて、実在製品シナリオにおけるAIエージェントの現在の能力を明らかにします。
E-Bench主な機能
-
完全合成製品環境の構築グラフ誘導型データベース構築技術に基づき、孤立レコードがなく、テーブル間で一貫性のある仮想世界を3つの主要製品向けに生成します。
-
ダブルギャップミッションジェネレーション質問生成モデルはデータベースへの完全なアクセス権を持つ一方、テスト対象モデルは限られた業務ツールを通してのみ操作できるため、情報とツールの両面で非対称性が生じる。
-
決定論的状態評価このシステムは、操作前後のデータベース状態の差分を唯一の評価基準として使用します。正確な一致のみが合格とみなされるため、部分点や審査員のばらつきは排除されます。
-
コストパフォーマンス共同分析各タスクのAPIオーバーヘッドを同期的に記録し、精度とコストのパレート最適解をプロットし、モデルの費用対効果を評価する。
-
コード実行拡張機能E-Benchコードバージョンがリリースされました
exec_codeツールを用いることで、困難さを2種類に分けることができる。すなわち、整理の仕組みに関する困難と、情報の獲得に関する困難である。
E-Bench技術原理
-
グラフガイドデータベースへのデータ投入関係スキーマから出発して、テーブルレベルの依存関係グラフが構築され、ルートテーブルと下流テーブルがトポロジー順にデータで埋められます。制約付きシンセサイザーとして強力なLLMが使用され、データは挿入ツールのみを介して書き込まれます。下流テーブルは、現在のデータベースから候補エンティティを照会する必要があります。最後に、決定論的なスクリプトを使用して、時間順序や集計数などの意味エラーを検証および修正し、環境が完全かつ自己整合的であることを保証します。
-
ジェネレーターとソルバーの非対称性質問設定エージェントは、以下のものを備えている。
query_sqlそしてexec_code権限により、ユーザーはデータベース全体を表示し、複雑な計算を実行できます。テスト対象のエージェントはビジネスレベルのツールしか呼び出すことができないため、情報ギャップ(グローバルな状態の隠蔽)とツールギャップ(内部計算ツールの削除)が生じ、モデルは多段階の並列ツール呼び出しを通じて環境を積極的に探索せざるを得なくなります。 -
意図の書き換えとルールの置換タスクが環境に依存しない形で完了できないようにするため、曲のIDを直接指定するのではなく、「コレクションから削除されたすべての曲を追加する」など、データベースから取得した特定の値を、その値を生成したルールに置き換えてください。
-
クロスバリデーションタスクの生成各タスクは、データのレビュー、目標の定義、ステータスの変更、意図の要約という一連のプロセスを経て生成されます。生成されたタスクは、3つの異なる強力なエージェントモデルによって相互検証され、少なくとも2つのモデルによって一貫して再現されたタスクのみが採用されます。これにより、タスクの解決可能性とラベル付けの精度が保証されます。
E-Benchの使い方
- 環境準備E-Benchの完全合成仮想環境は、論文の補足資料から入手し、Honor of Kings、QQ Music、Tencent Meetingという3つの主要製品領域を網羅するデータベーステンプレートと323の評価タスクを読み込んだ。
- バージョン選択研究目的に応じて、E-Benchの基本バージョンまたはE-Bench-Codeのいずれかを選択してください。
- モデルアクセステスト対象のLLMエージェントは評価フレームワークに統合され、制限されたドメインツール(楽曲の検索、会議の作成、友人の追加など)を介してのみ間接的に環境とやり取りするように構成されており、基盤となるデータベースへの直接的なクエリは禁止されています。
- タスク構成各タスクを独立して実行できる回数と、新しいデータベースコピーを開始するための条件を設定します。結果の再現性を確保するために、API呼び出しコストの追跡を有効にします。
- 実行評価自動評価を開始します。自然言語による指示を受け取ると、エージェントは仮想環境と対話し、複数ステップのツール呼び出しを通じてその状態を変更します。システムは、操作の全過程とトークン消費量を自動的に記録します。
- 結果分析評価後、システムは決定論的なデータベース状態差分に基づいてPass@1とPass³の精度を出力し、モデルの費用対効果を評価するのに役立つ費用対効果の共同分析レポートを生成します。
E-Benchの主な利点
-
実規模の干渉で十分各ライブラリには76,000行以上、600,000以上のデータユニットが含まれています。対象となるエンティティは多数の類似レコードに囲まれており、モデルは環境の疎性を利用して推測することはできません。
-
環境とタスクの分離と再利用自己整合的な製品環境は、極めて低い限界費用で約100個のタスクの生成をサポートでき、環境層は制御可能であり、タスク層は拡張可能である。
-
評価結果は安定しており、再現性も高い。完全に合成された環境はオンラインサービスの進化の影響を受けず、決定論的な差分スコアリングによって意味判断における主観的な偏りが排除される。
-
明確な難易度レベル基本バージョンでは、複数ステップのオーケストレーションと情報収集をテストする一方、コードバージョンでは、計算負荷の高いタスクのためにコードをアンロードする機能もテストします。
E-Benchプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2607.23722
E-Benchの競合製品比較
| 寸法 | E-Bench | SWE-bench |
|---|---|---|
| 評価対象 | 複数ステップのツール使用エージェント(状態変化、情報収集、ツールオーケストレーション) | コード修正エージェント(対応するコードパッチはGitHubのIssueに記載) |
| 環境構築 | 完全合成仮想製品環境、グラフ誘導型データベース構築 | 過去のGitHubイシューに基づいた、実際のオープンソースコードベースのスナップショット。 |
| タスクの種類 | ソーシャルメディア、音楽、オフィスでのコラボレーションなど、323件のステータス変更タスク。 | コードの理解と修正を伴う、実世界のソフトウェアエンジニアリング業務。 |
| 評価メカニズム | 決定論的データベース状態差分、完全一致合格 | 単体テスト合格率。パッチ適用後にテストが合格するかどうかを示します。 |
| 拡張性 | 環境とタスクの分離:1つの環境で数百ものタスクを低コストでサポートする。 | 実際のコードベースや問題に依存する拡張機能は、オープンソースプロジェクトの利用可能性によって制限される。 |
| 汚染物質を除去することの難しさ | 完全に人工的な環境、つまり自然由来の汚染物質を含まない環境は、モデルがトレーニングメモリを迂回して近道することを防ぎます。 | データ漏洩を防ぐためには厳密な時間区分が必要であり、データ消去には費用がかかる。 |
| コスト面 | APIオーバーヘッドを同期的に測定し、共同のコストパフォーマンス分析をサポートします。 | 主な焦点は機能的な正確性であり、コスト分析は設計の中核的な目的ではない。 |
E-Benchの応用事例
-
AIエージェントの能力評価LLMエージェント向けに、情報検索、状態変化、エンティティ間連携といった主要な側面を網羅した、標準化された定量化可能な多段階ツール使用能力評価を提供します。
-
モデル選定と製品化の決定コストパフォーマンスのパレート図を用いることで、企業は精度とAPIのオーバーヘッドを比較検討し、費用対効果の高いモデルを特定することができます。
-
エージェントトレーニングデータの合成制御可能で拡張性の高いトレーニングデータソースとして、エージェントが複数ステップのツールを呼び出す能力と信頼性を継続的に向上させるために使用されます。
-
コード拡張エージェントの研究E-Bench-Codeは、さまざまな種類のタスク(計算負荷の高いタスクと推論に基づく意思決定)におけるコード実行のペイオフフロンティアを研究することをサポートします。
-
クロスドメインベンチマーク拡張機能この手法は、より多くの製品バックエンドやCLIシナリオに移行可能であり、汎用的なインテリジェントエージェント評価基準の確立を促進する。