AB
AiBoss站
project

HarnessEval - MirroS 联合清北、英伟达等推出的评测系统

HarnessEval 是 MirroS 联合清北、Berkeley、MIT、英伟达等机构推出的评测系统。HarnessEval将评测本身 Agent 化:面对每个案例,系统动态规划评测路径,从 S...

HarnessEval是什么

HarnessEval 是 MirroS 联合清北、Berkeley、MIT、英伟达等机构推出的评测系统。HarnessEval将评测本身 Agent 化。面对每个案例,系统动态规划评测路径,从 Skill Library 选择适用技能,拆解为可验证的子问题,调用工具搜集证据,最终输出可追溯的 evidence tree。HarnessEval突破传统静态 benchmark 的局限,让评测从黑盒分数变成可解释、可复现的智能工作流。首个落地项目 HarnessEval-W 已用于交互式世界模型评测。

HarnessEval的主要功能

  • 动态评测规划:针对每个案例的上下文与目标,自动生成定制化评测计划。
  • 技能路由:从 Skill Library 中按需选择适用技能,而非跑完所有固定指标。
  • 问题拆解:将抽象评测问题拆分为可测量、可验证的子问题。
  • 证据搜集:调用 sub-agent 和诊断工具,从不同角度搜集视觉与逻辑证据。
  • 证据验证:主智能体验证各分支证据的质量与逻辑关系,确保结论可靠。
  • Evidence Tree 输出:输出完整证据树,记录测试内容、工具调用、推理链与最终分数。
  • 可扩展 Skill Library:内置 9 个核心技能模块,支持随模型演进动态添加新技能。
  • 评测案例自动构建:基于场景分类学自动生成初始世界、动作与验证,确保评测质量。

HarnessEval的技术原理

  • 四层 Agentic 工作流:HarnessEval 采用 Plan-Router-Decompose-Verify 四层工作流:Plan 阶段理解案例上下文并生成定制化评测计划;Route 阶段从 Skill Library 中动态选择适用技能;Decompose 阶段将高层问题拆分为子问题并委派给 sub-agent;Verify 阶段由主智能体验证证据质量与逻辑关系,形成最终结论。
  • 分层智能体架构:系统采用主智能体统筹规划与验证,各 Skill Agent 负责专项评测,每个 Skill 再进一步拆分为多个 sub-agent 处理具体子任务,形成层级化的评测执行结构。
  • 可扩展 Skill Library:框架内置 9 个核心技能模块,覆盖渲染质量、物理合理性、状态变化验证、漂移分析、重访一致性、离屏演化等维度,并支持随模型能力演进动态添加新技能,实现评测能力的持续扩展。
  • Evidence Tree 输出机制:评测结果以层级式证据树形式呈现,完整记录测试内容、工具调用、视觉证据与推理链,使评测结论可检查、可复现、可追责,而非仅输出单一标量分数。

微信关注回复“开源”,加入AI开源项目交流群

如何使用HarnessEval

  • 克隆仓库:从 GitHub 拉取 HarnessEval-W 代码库。
  • 创建环境:分别创建 harnesseval-mainharnesseval-metricsharnesseval-pavrm 三个 conda 环境。
  • 配置凭证:复制 config/example.envharnesseval.env 并加载环境变量。
  • 准备数据:将待评测模型生成的视频结果放入指定目录,并准备好 manifest.json 清单文件。
  • 执行评测:运行 harnesseval eval 命令,指定模型结果路径、评测计划和输出目录。
  • 验证结果:运行 harnesseval verify run 检查评测输出是否完整、分数是否生成。
  • 查看报告:在输出目录中查看 summary.jsonleaderboard_latest.csvLEADERBOARD.md 获取详细评分与排名。

HarnessEval的核心优势

  • 动态评测规划:针对每个案例的上下文自动生成定制化评测计划,而非套用固定流程。
  • 智能技能路由:从 Skill Library 中按需选择适用技能,避免对所有案例跑完无关指标。
  • 可解释的证据链:输出完整的 Evidence Tree,可追溯每项分数背后的工具调用、视觉证据与推理逻辑。
  • 可扩展的技能库:Skill Library 支持动态添加新技能,随模型能力演进持续扩展评测维度。
  • 分层智能体协作:主智能体统筹规划与验证,sub-agent 分工处理子问题,实现复杂评测任务的精细化拆解。
  • 评测数据自动生成:基于场景分类学自动构建初始世界、动作与验证,确保评测案例的质量与多样性。
  • 评测过程透明可审计:完整的推理链与证据记录使评测结论可检查、可复现、可追责。
  • 贴近人类评测方式:模拟人类专家”理解—规划—取证—推理”的评测工作流,而非机械打分。

HarnessEval的项目地址

  • 项目官网:https://mirros.ai/blog/harnesseval
  • GitHub仓库:https://github.com/mirros-lab/harnesseval-w

HarnessEval的同类竞品对比

对比维度 HarnessEval VBench
评测对象 交互式世界模型(带动作输入、状态转移、物理因果) 视频生成模型(单场景、无交互输入)
评测方式 Agentic 动态工作流:Plan → Route → Decompose → Verify 固定指标流水线:预设 rubric + 批量打分
技能选择 根据案例上下文动态路由 Skill Library 中的技能 所有案例跑完同一套固定指标
问题拆解 将高层评测问题拆分为可测量的子问题,委派 sub-agent 直接计算指标,无层级拆解
输出形式 Evidence Tree(证据树):记录测试内容、工具调用、推理链、分数依据 标量分数 + 各维度柱状图
可解释性 可追溯每项分数的完整推理链与视觉证据 仅输出分数,无法解释”为什么低分”
可扩展性 Skill Library 可动态添加新技能,支持递归自我改进 指标固定,扩展需修改整体框架
物理因果 专门评估状态转移正确性、物理合理性、世界持续性 仅评估视觉质量与运动流畅度

HarnessEval的应用场景

  • 交互式世界模型评测:评估视频生成模型在动作条件下的状态转移正确性、物理合理性与世界持续性。
  • 具身智能与机器人仿真:评测机器人在虚拟环境中的操控能力、物理交互因果与长期状态一致性。
  • 自动驾驶世界模型:验证生成场景中的相机轨迹遵循、物体 permanence、离屏演化与物理动力学合理性。
  • 游戏与虚拟世界生成:评估开放世界游戏的场景一致性、NPC 行为因果、重访一致性与视觉质量。
  • 物理仿真与科学计算:检验生成视频中的物理定律遵循与因果保真度。
  • AI 视频创作平台:为 Seedance、Kling、Sora 等模型提供可解释的质量诊断,定位具体失败模式(如额外事件、目标漂移、物理违规)。