AB
AiBoss站
project

Simreal-MLBench - 面向机器学习研究智能体的外部评分可验证评测环境

Simreal-MLBench 是 Simreal-AI 开源的一套机器学习研究智能体评测环境,公开 60 项任务目录、评测协议、评分代码与客户端 SDK,采用 Apache-2.0 许可。评测运行时与官方评分通道由 Simreal 以商业服务方式运营,仓库本身是该项目公开的最小切片。

Simreal-MLBench 是 Simreal-AI 维护的一个机器学习研究智能体评测环境。按项目自述,它面向的是「完整研究流程」:智能体需要理解数据、设计验证方案、做特征工程、选模型、调参、集成、调试、分配资源,最后提交预测结果。评测覆盖表格学习、时序预测、视觉、语言、音频、多模态以及结构化科学数据等方向,共 60 项任务。它适合两类读者:一是想了解智能体评测协议如何设计、评分如何复算的研究者与工程师;二是希望按公开协议接入评测、拿到带完整溯源记录结果的实验室与团队。

需要先说明这个仓库的边界。据项目 README,它是 ML Benchmark 的「开放最小切片」:公开的是 60 项任务目录、评测协议、评分代码和客户端 SDK;而评测运行时、官方评分通道和全量套件准入则运行在 SimReal 引擎上,不在本仓库内。也就是说,仓库公开的是规则,执行规则的基础设施是 Simreal 运营的商业服务。

维护者与状态

项目由 Simreal-AI 维护,仓库创建于 2026-09-21,最后一次提交在 2026-09-24。截至 2026-10-05,仓库获得 302 个星标。事实表显示,该项目尚无正式 release,因此不存在可引用的版本号;README 也把它标注为 public preview,并明确写着「It is early and will change」。

按 README 的发布状态表,60 项任务目录与协议、评分与聚合及验证工具已经发布(其中验证工具自述 35 项测试通过);评测运行时(网关、控制器、broker、评分器)已实现但由 Simreal 运营;官方评分基线在 3 项任务上完成了端到端验证;全量套件准入与硬件校准仍在进行中;可比的 60 任务智能体排行榜尚在计划阶段。项目自述的原则是「只发布已经验证过的东西」,数字要带完整溯源才会出现在仓库里。

主要能力

以下内容均来自项目自述,未经本站实测。

据 README,任务按难度分为三档,每档 20 项:Easy 档研究预算 6 小时、使用 CPU;Medium 档 12 小时、使用异构 GPU 池;Hard 档 24 小时、同样使用异构 GPU 池。

在可信度设计上,项目自述了几条机制。第一,评分方不是 Simreal 自己:测试标签留在竞赛平台上,Simreal 不持有答案,因此智能体读不到标签,Simreal 也不会切错数据划分。第二,智能体有两次提交机会,中间会拿到真实分数反馈,项目认为这让「智能体拿到真相后能否据此行动」变成可测量的问题。第三,任务简报在加载时会检查平台名、竞赛身份和 URL,从机制上而非仅靠约定做来源盲化;README 同时承认这只能降低、不能消除智能体认出知名数据集的可能,并称报告会明确写出这一限制。第四,每个奖励在任务被接纳前都会用对抗性提交做探测。第五,每个数字都带提交 id、产物哈希和冻结的参考快照。

评分规则方面,据 README,任务得分为 100 × p²,其中 p 是超过的冻结参考排行榜比例,并列计半分。智能体可以使用全部被允许的原始训练数据,自行选择验证策略,在原始截止时间内最多提交两次官方结果,取更好的那次保留。项目建议同时报告分档均值、覆盖率和实际资源使用量。

此外,README 提到该任务/工具循环可作为序列化研究决策的环境,用于 RLVR 实验,以及通过版本化的研究记忆、技能和智能体代码做智能体层面的递归自我改进;但项目明确说明这些是「支持的研究方向」,本次发布不包含训练结果。

使用入口

仓库地址:Simreal-MLBench。项目官网为 simreal.co。

据 README,本地示例要求 Python 3.11 及以上,本地测试过的版本是 Python 3.12。安装与验证命令如下(这些命令运行本地示例,不需要凭据,也不会调用模型):

python3 -m venv .venv
source .venv/bin/activate
python -m pip install -e '.[test]'
mleb validate configs/catalog.json
mleb grade examples/snapshot.json examples/result.json
python scripts/verify_report.py
python -m pytest -q

README 称,用公开包可以独立完成三件事:校验任务目录与协议配置;阅读确切的评分代码,并从保存的参考计数复算每一个已发布的任务分数;核对每个报告数字背后的提交 id、产物哈希与参考快照哈希。而端到端的智能体运行、官方两次提交评分以及可用于官方基准报告的结果,需要通过 Simreal 的评测服务获得,README 给出的联系方式是 business@simreal.co。原始竞赛数据集需另行获取。

许可与限制

许可证为 Apache-2.0。按 README 的开放范围表,任务定义与目录、评测协议与预算、远程客户端 SDK(mleb-remote)、评分与聚合工具、示例与测试及数据访问工具、技术报告与验证脚本均在 Apache-2.0 下公开;网关、控制器与工作队列、提交 broker 与官方评分通道、本地评分器、仪表盘与部署则属于 Simreal 评测服务,不在开源范围内。

使用边界上需要注意几点。其一,仓库是公开预览版,项目自述「还早,会变」,且事实表确认尚无正式 release,接口与协议都可能调整。其二,公开包只能做本地校验与分数复算,无法自行跑通官方协议下的完整评测,也无法产出可用于官方报告的结果。其三,来源盲化只能降低而非消除智能体识别出知名数据集的可能,项目自己把这条限制写进了说明。其四,全量套件准入与硬件校准仍在进行中,可比排行榜尚未发布,因此目前不存在可引用的 60 任务横向成绩。其五,README 中提到的 RLVR 与递归自我改进属于支持的研究方向,本次发布不含训练结果。