AB
AiBoss
ニュース

英国 AISI 采用 EvalEval 基础设施公开评测结果

EvalEval 联盟宣布,英国 AI 安全研究所(AISI)正使用其基础设施公开分享评测结果,以提升评测科学的可复现性与可验证性。

核心事实

据 Hugging Face 博客文章,EvalEval 联盟表示,英国 AI 安全研究所(AISI)正在使用 EvalEval 的基础设施公开分享评测结果,以支持更具可复现性和可验证性的评测科学。双方此前曾在 NeurIPS 2025 期间的一场联合研讨会上开展合作研究,AISI 的反馈也参与塑造了 Every Eval Ever(EEE)模式。

据该文章介绍,此次 AISI 通过 Evaluation Cards 公开的评测方法与发现,涵盖其论文主实验中的五个基准:HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0,涉及六个前沿模型;此外还包括两项网络评测的结果,所用模型集合不同且部分重叠。

背景与影响

文章指出,随着 AI 部署加速,评测日益成为关于模型与系统表现的重要证据来源,但结果分散在多种格式、平台和渠道中,往往缺少足以复现的信息,而重新运行评测本身可能成本高昂。EvalEval 的目标是通过共享报告模式 Every Eval Ever 和开放平台 Evaluation Cards,把评测结果与解读所需信息纳入统一结构。

文章称,AISI 的工作还包括通过 OptStop 提升评测效率、通过 HiBayES 增强统计严谨性,并在转录分析和能力引出等方面推进标准化。文章认为,当结果连同设置信息一并公开时,研究人员可以更细致地考察单项研究,并在更广的生态中比较发现;随着更多评测方采用 EEE,这类开放比较可支持更广泛、更可靠的元研究。

限制与来源

上述内容来自 Hugging Face 博客文章,相关合作细节、数据范围与模型清单均以该文章表述为准,尚未见其他独立来源确认。文中提及的基准、模型与评测结果可能随版本和设置变化,具体信息请以 AISI、EvalEval 及 Hugging Face 官方页面当前公布的内容为准。

来源:Hugging Face 博客