Artificial Analysis 发布智能指数 v4.2:新增代理工作流与长文档评测,Anthropic 与 OpenAI 领跑
Artificial Analysis 于 9 月 4 日发布 Intelligence Index v4.2,新增代理知识工作评测 AA-Briefcase 与长文档推理测试 GDP.pdf,并将私有测试集权重提升至 40%。结果显示 Anthropic 的 Claude Fable 5.1 领跑,OpenAI 的 GPT-6 Astra 紧随其后。
核心事实
Artificial Analysis 于 2026 年 9 月 4 日发布 Intelligence Index v4.2。该版本新增两项评测:一是自研的 AA-Briefcase,采用私有测试集,模拟跨数周、包含数千源文件的多任务知识工作项目;二是由 Surge AI 创建的 GDP.pdf,覆盖 100 份 PDF、十个领域,要求模型综合 4,592 页中的文本、表格、图表等证据,并按 1,275 条专家标准评分。同时,v4.2 将私有测试集权重提升至 40%,并升级了评分基础设施。
背景与影响
据该机构介绍,v4.2 是 v5 正式发布前的过渡更新,旨在应对近期前沿模型快速迭代带来的评测滞后。结果显示,Anthropic 的 Claude Fable 5.1 领跑智能指数,OpenAI 的 GPT-6 Astra 紧随其后,较 GPT-5.6 Sol 提升 4 分;Meta 位列第三。在成本/任务帕累托前沿上,Anthropic、OpenAI、Meta 与 Z.AI 四家实验室共同占据。GPT-6 Astra 在输出 token 效率上表现突出,而 AA-Briefcase 中 Claude Fable 5.1 与 Opus 5 领先,GPT-6 Astra 较 GPT-5.6 Sol 高出约 85 Elo 点。GDP.pdf 中 OpenAI 领先,GPT-6 Astra 与 GPT-5.6 Sol 分别取得 33.2% 与 28.2% 的全通过率,Claude Fable 5.1 为 26.2%。
限制与来源
上述结果来自 Artificial Analysis 的独立评测,具体模型名称、版本及分数均以该机构发布为准。文中提及的模型(如 Claude Fable 5.1、GPT-6 Astra 等)及其性能数据尚未获得相关厂商官方确认,评测方法细节可参阅其方法论页面。用户如需了解最新排行与完整数据,请访问 artificialanalysis.ai。