project
HarnessEval - MirroS 联合清北、英伟达等推出的评测系统
HarnessEval 是 MirroS 联合清北、Berkeley、MIT、英伟达等机构推出的评测系统。HarnessEval将评测本身 Agent 化:面对每个案例,系统动态规划评测路径,从 S...
HarnessEval是什么
HarnessEval 是 MirroS 联合清北、Berkeley、MIT、英伟达等机构推出的评测系统。HarnessEval将评测本身 Agent 化。面对每个案例,系统动态规划评测路径,从 Skill Library 选择适用技能,拆解为可验证的子问题,调用工具搜集证据,最终输出可追溯的 evidence tree。HarnessEval突破传统静态 benchmark 的局限,让评测从黑盒分数变成可解释、可复现的智能工作流。首个落地项目 HarnessEval-W 已用于交互式世界模型评测。
HarnessEval的主要功能
-
动态评测规划:针对每个案例的上下文与目标,自动生成定制化评测计划。
-
技能路由:从 Skill Library 中按需选择适用技能,而非跑完所有固定指标。
-
问题拆解:将抽象评测问题拆分为可测量、可验证的子问题。
-
证据搜集:调用 sub-agent 和诊断工具,从不同角度搜集视觉与逻辑证据。
-
证据验证:主智能体验证各分支证据的质量与逻辑关系,确保结论可靠。
-
Evidence Tree 输出:输出完整证据树,记录测试内容、工具调用、推理链与最终分数。
-
可扩展 Skill Library:内置 9 个核心技能模块,支持随模型演进动态添加新技能。
-
评测案例自动构建:基于场景分类学自动生成初始世界、动作与验证,确保评测质量。
HarnessEval的技术原理
- 四层 Agentic 工作流:HarnessEval 采用 Plan-Router-Decompose-Verify 四层工作流:Plan 阶段理解案例上下文并生成定制化评测计划;Route 阶段从 Skill Library 中动态选择适用技能;Decompose 阶段将高层问题拆分为子问题并委派给 sub-agent;Verify 阶段由主智能体验证证据质量与逻辑关系,形成最终结论。
- 分层智能体架构:系统采用主智能体统筹规划与验证,各 Skill Agent 负责专项评测,每个 Skill 再进一步拆分为多个 sub-agent 处理具体子任务,形成层级化的评测执行结构。
- 可扩展 Skill Library:框架内置 9 个核心技能模块,覆盖渲染质量、物理合理性、状态变化验证、漂移分析、重访一致性、离屏演化等维度,并支持随模型能力演进动态添加新技能,实现评测能力的持续扩展。
- Evidence Tree 输出机制:评测结果以层级式证据树形式呈现,完整记录测试内容、工具调用、视觉证据与推理链,使评测结论可检查、可复现、可追责,而非仅输出单一标量分数。
微信关注回复“开源”,加入AI开源项目交流群
如何使用HarnessEval
-
克隆仓库:从 GitHub 拉取 HarnessEval-W 代码库。
-
创建环境:分别创建
harnesseval-main、harnesseval-metrics和harnesseval-pavrm三个 conda 环境。 -
配置凭证:复制
config/example.env为harnesseval.env并加载环境变量。 -
准备数据:将待评测模型生成的视频结果放入指定目录,并准备好
manifest.json清单文件。 -
执行评测:运行
harnesseval eval命令,指定模型结果路径、评测计划和输出目录。 -
验证结果:运行
harnesseval verify run检查评测输出是否完整、分数是否生成。 -
查看报告:在输出目录中查看
summary.json、leaderboard_latest.csv和LEADERBOARD.md获取详细评分与排名。
HarnessEval的核心优势
-
动态评测规划:针对每个案例的上下文自动生成定制化评测计划,而非套用固定流程。
-
智能技能路由:从 Skill Library 中按需选择适用技能,避免对所有案例跑完无关指标。
-
可解释的证据链:输出完整的 Evidence Tree,可追溯每项分数背后的工具调用、视觉证据与推理逻辑。
-
可扩展的技能库:Skill Library 支持动态添加新技能,随模型能力演进持续扩展评测维度。
-
分层智能体协作:主智能体统筹规划与验证,sub-agent 分工处理子问题,实现复杂评测任务的精细化拆解。
-
评测数据自动生成:基于场景分类学自动构建初始世界、动作与验证,确保评测案例的质量与多样性。
-
评测过程透明可审计:完整的推理链与证据记录使评测结论可检查、可复现、可追责。
-
贴近人类评测方式:模拟人类专家”理解—规划—取证—推理”的评测工作流,而非机械打分。
HarnessEval的项目地址
- 项目官网:https://mirros.ai/blog/harnesseval
- GitHub仓库:https://github.com/mirros-lab/harnesseval-w
HarnessEval的同类竞品对比
| 对比维度 | HarnessEval | VBench |
|---|---|---|
| 评测对象 | 交互式世界模型(带动作输入、状态转移、物理因果) | 视频生成模型(单场景、无交互输入) |
| 评测方式 | Agentic 动态工作流:Plan → Route → Decompose → Verify | 固定指标流水线:预设 rubric + 批量打分 |
| 技能选择 | 根据案例上下文动态路由 Skill Library 中的技能 | 所有案例跑完同一套固定指标 |
| 问题拆解 | 将高层评测问题拆分为可测量的子问题,委派 sub-agent | 直接计算指标,无层级拆解 |
| 输出形式 | Evidence Tree(证据树):记录测试内容、工具调用、推理链、分数依据 | 标量分数 + 各维度柱状图 |
| 可解释性 | 可追溯每项分数的完整推理链与视觉证据 | 仅输出分数,无法解释”为什么低分” |
| 可扩展性 | Skill Library 可动态添加新技能,支持递归自我改进 | 指标固定,扩展需修改整体框架 |
| 物理因果 | 专门评估状态转移正确性、物理合理性、世界持续性 | 仅评估视觉质量与运动流畅度 |
HarnessEval的应用场景
-
交互式世界模型评测:评估视频生成模型在动作条件下的状态转移正确性、物理合理性与世界持续性。
-
具身智能与机器人仿真:评测机器人在虚拟环境中的操控能力、物理交互因果与长期状态一致性。
-
自动驾驶世界模型:验证生成场景中的相机轨迹遵循、物体 permanence、离屏演化与物理动力学合理性。
-
游戏与虚拟世界生成:评估开放世界游戏的场景一致性、NPC 行为因果、重访一致性与视觉质量。
-
物理仿真与科学计算:检验生成视频中的物理定律遵循与因果保真度。
-
AI 视频创作平台:为 Seedance、Kling、Sora 等模型提供可解释的质量诊断,定位具体失败模式(如额外事件、目标漂移、物理违规)。