News
Epoch AI 推出真实工作任务评测,现有模型尚难独立完成研究流程
Epoch AI 推出 Epoch Automation Reports,以机构内部真实任务评估六款模型;其初步研究认为,前沿模型在明确任务中表现较好,但仍难独立完成开放式研究工作。
Epoch AI 发布 Epoch Automation Reports。研究团队选取图表制作、数据洞察和研究设计等内部真实任务,测试六款模型,并以机构员工标准人工评估结果。
报告认为,领先模型在边界明确的任务上较可靠,但在开放式研究判断、实验设计及识别自身方案缺陷方面仍有不足。这是特定机构任务和评估方法下的结果,不能推断所有工作都无法自动化。