AB
AiBoss
ニュース

Anthropic 为 claude-api skill 增添评测构建与逐步优化指导

Anthropic 在 claude-api skill 中加入 build-eval 与 hillclimb 指导,帮助开发者先构建贴近实际任务的评测,再逐项验证优化效果。

Anthropic 9 月 28 日介绍 claude-api skill 的两项新工作流:build-eval 与 hillclimb。前者用于在代码库内构建评测,后者在保留测试集的前提下逐项尝试改动并检查效果。

官方文章强调评测样本应贴近生产任务,同时警惕对测试集过拟合。这是开发工作流指导的新增内容,并非 Claude API 模型能力发布。

参考:Claude Developer Blog原始资料