Vercel Sandbox 支持运行 Terminal-Bench 等 Harbor 评测
Vercel 更新日志显示,Harbor 评测框架现可在 Vercel Sandbox 上运行,覆盖 Terminal-Bench、SWE-bench、tau3-bench、OSWorld 等基准,每个试验在独立 Firecracker 微虚拟机中执行。
Vercel Sandbox 新增 Harbor 评测支持
据 Vercel 更新日志,用户现在可以在 Vercel Sandbox 上运行 Harbor 评测。Harbor 是 Terminal-Bench 背后的开源评测框架,其注册表中还包含 SWE-bench、tau3-bench、OSWorld 等多个基准。官方给出的用法是在 harbor run 命令中加上 --env vercel 参数,每个试验会在各自独立的 Firecracker 微虚拟机中执行,从而支持超出本地机器能力的并行规模。
背景与影响
按照该更新日志的描述,任务所需的网络策略在虚拟机之外的沙箱防火墙上执行;可选的凭据注入会在该防火墙上把密钥附加到匹配的出站请求上,因此密钥不会进入沙箱内部。配合 AI Gateway,一个 AI_GATEWAY_API_KEY 即可访问多家提供商的众多模型,更换被测模型只需修改 --model 参数。日志中给出的示例命令包含 uv tool install 'harbor[vercel]'、设置 VERCEL_TOKEN 与 AI_GATEWAY_API_KEY,以及以 --n-concurrent 8 并发运行 terminal-bench-2-1 的调用方式。该日志称此功能需要 Harbor 0.22.0 或更高版本。
限制与来源
上述内容来自 Vercel 官方更新日志,属于厂商自述,本文未做独立验证。日志中出现的模型名称、示例参数与版本要求可能随后续版本调整,具体可用模型、配额、区域支持与计费方式请以 Vercel 官网当前信息为准。使用前建议先阅读官方给出的分步指南与 Sandbox 文档,确认配置与故障排查方式。