News
Anthropic研究:自动化研究代理可缓解10类模型对齐失败
Anthropic披露早期实验,Claude可自动设计后训练方案,缓解10类预设对齐失败;部分方法还能泛化到未见测试和更大模型。
Anthropic公布一项自动化对齐研究,使用Claude自主设计后训练方案,以缓解10类预设的模型对齐失败。最佳方案改善了目标基准,并在部分未见基准和规模最高约4.7倍的模型上表现出泛化。
其中一项实验让Sonnet 5在约60小时内处理一个早期Opus 4.8检查点,但研究范围仅覆盖预设的10类失败,也依赖代理指标和受控环境,不能据此推断已解决通用模型对齐问题。