AB
AiBoss站
project

E-Bench - 腾讯混元等推出的智能体评测基准

E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准,基于王者荣耀、QQ 音乐、腾讯会议三大真实产品为原型,构建全合成虚拟环境...

E-Bench是什么

E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准,基于王者荣耀、QQ 音乐、腾讯会议三大真实产品为原型,构建全合成虚拟环境,包含 323 个状态变更任务、41 张数据库表及超 7.6 万条数据。通过信息鸿沟与工具鸿沟双不对称设计,迫使智能体主动搜集隐藏信息并编排多步工具调用,最终用确定性数据库状态 diff 评分,揭示当前 AI 智能体在真实产品场景中的能力边界。

E-Bench的主要功能

  • 全合成产品环境构建:基于图引导的数据库填充技术,生成无孤立记录、跨表一致的三大产品虚拟世界。
  • 双鸿沟任务生成:出题模型拥有完整数据库访问权,被测模型仅能通过受限业务工具交互,制造信息与工具双重不对称。
  • 确定性状态评测:用数据库操作前后的状态 diff 作为唯一评判标准,精确匹配才计通过,杜绝部分分与裁判方差。
  • 成本性能联合分析:同步记录每任务 API 开销,绘制准确率与成本的帕累托前沿,评估模型性价比。
  • 代码执行扩展:E-Bench-Code 版本开放 exec_code 工具,可剥离编排机制与信息获取两类难度。

E-Bench的技术原理

  • 图引导数据库填充:从关系型 schema 出发构建表级依赖图,按拓扑序填充根表与下游表,用强 LLM 作为受约束合成器,仅通过插入工具写入数据,下游表必须从当前库查询候选实体,最后用确定性脚本校验修复时间顺序、聚合计数等语义错误,确保环境完整自洽。
  • 生成器-求解器不对称:出题 Agent 拥有 query_sqlexec_code 特权,能查看完整数据库并执行复杂计算;被测 Agent 仅能调用业务级工具,形成信息鸿沟(全局状态隐藏)与工具鸿沟(内部计算工具移除),迫使模型通过多步并行工具调用主动探索环境。
  • 意图改写与规则替换:将数据库派生的具体值替换为产生它的规则,例如”把收藏里所有已下架的歌加进来”而非直接给出歌曲 ID,确保任务无法脱离环境交互独立完成。
  • 交叉验证任务生成:每个任务经查看数据→确定目标→修改状态→总结意图的产品化循环生成,由三个不同强 Agent 模型交叉验证,至少两个复现一致才采纳,保证任务可解性与标注准确性。

如何使用E-Bench

  • 环境准备:从论文配套资源获取 E-Bench 全合成虚拟环境,加载覆盖王者荣耀、QQ 音乐、腾讯会议三大产品域的数据库模板与 323 个评测任务。
  • 版本选择:根据研究目标选择基础版 E-Bench或 E-Bench-Code。
  • 模型接入:将被测 LLM Agent 接入评测框架,配置其只能通过受限的领域工具(如搜索歌曲、创建会议、添加好友等)间接与环境交互,禁止直接查询底层数据库。
  • 任务配置:设定每任务独立运行次数与全新数据库副本起始条件,开启 API 调用成本追踪以确保结果可复现。
  • 执行评测:启动自动化评测,Agent 接收自然语言指令后通过多步工具调用与虚拟环境交互并修改状态,系统自动记录完整操作轨迹与 Token 消耗。
  • 结果分析:评测结束后,系统基于确定性数据库状态 diff 输出 Pass@1 与 Pass³ 准确率,生成成本-性能联合分析报告,辅助评估模型性价比。

E-Bench的核心优势

  • 真实规模干扰充分:每个库填充至 7.6 万+行、60 万+数据单元,目标实体被大量近似记录环绕,模型无法靠环境稀疏蒙对。
  • 环境任务解耦复用:一套自洽产品环境可支撑约上百个任务生成,边际成本极低,环境层可控、任务层可扩展。
  • 评测稳定可复现:全合成环境不受线上服务演进影响,确定性 diff 评分消除语义裁判的主观偏差。
  • 难度分层清晰:基础版考验多步编排与信息搜集,Code 版额外测试计算密集型任务的代码卸载能力。

E-Bench的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2607.23722

E-Bench的同类竞品对比

维度 E-Bench SWE-bench
评测对象 多步骤工具使用 Agent(状态变更、信息搜集、工具编排) 代码修复 Agent(GitHub Issue 对应代码补丁)
环境构建 全合成虚拟产品环境,图引导数据库填充 真实开源代码库快照,基于 GitHub 历史 Issue
任务类型 323 个状态变更任务,涉及社交、音乐、办公协作 真实软件工程任务,涉及代码理解与修改
评分机制 确定性数据库状态 diff,精确匹配通过 单元测试通过率,补丁应用后测试是否通过
可扩展性 环境任务解耦,一套环境支撑上百任务,边际成本低 依赖真实代码库与 Issue,扩展受限于开源项目可用性
去污染难度 全合成环境,天然无污染,模型无法靠训练记忆抄近道 需严格时间切分防止数据泄漏,去污染成本高
成本维度 同步测量 API 开销,支持成本-性能联合分析 主要关注功能正确性,成本分析非核心设计目标

E-Bench的应用场景

  • AI 智能体能力评测:为 LLM Agent 提供标准化、可量化的多步工具使用能力评估,覆盖信息检索、状态变更、跨实体编排等核心维度。
  • 模型选型与产品化决策:通过成本-性能帕累托图,帮助企业在准确率与 API 开销之间做出权衡,识别高性价比模型。
  • 智能体训练数据合成:作为可控、可扩展的训练数据来源,用于持续提升 Agent 在多步工具调用与可靠性方面的能力。
  • 代码增强 Agent 研究:E-Bench-Code 支持研究代码执行对不同类型任务(计算密集 vs 推理决策)的收益边界。
  • 跨领域基准扩展:方法论可迁移至更多产品后端与 CLI 场景,推动通用智能体评测标准建立。