AB
AiBoss
ニュース

Artificial Analysis 更新智能指数,回应 GPT-6 Astra 评分争议

Artificial Analysis 发布智能指数 4.2 版,回应此前对 GPT-6 Astra 评分偏低的质疑。新版中 Astra 较前代提升 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1。指数新增两个基准测试,并提高私有测试数据权重以降低刷分可能。

核心事实

据 the-decoder.com 报道,Artificial Analysis 已发布其智能指数(Intelligence Index)4.2 版本,此举被认为是对此前 GPT-6 Astra 评分引发质疑的回应。早前多项评测(包括 OpenAI 自家评估)将 Astra 置于领先位置:Epoch AI 在 50 多项基准测试中将其列为 267 个模型之首(169 分),ARC-AGI-3 也显示其有大幅进步。然而 Artificial Analysis 当时仅将 Astra 评为与其前代持平,引发争议。

更新后的指数显示,GPT-6 Astra 较其前代 Sol 提升了 4 分。Anthropic 的 Claude Fable 5.1 仍居榜首,Astra 位列第二,Meta 排名第三。Artificial Analysis 称 Astra 在每任务 token 消耗上低于所有其他前沿模型。在性价比方面,Anthropic、OpenAI、Meta 和智谱 AI 并列领先。

背景与影响

新版指数新增了两个基准测试:面向真实世界知识工作的 AA-Briefcase,以及 Surge AI 的 GDP.pdf(用于 PDF 文档分析)。GPQA-Diamond 因模型已解决而被移除。私有测试数据在权重中的占比提升至 40%,以增加刷分难度。Artificial Analysis 还修复了多个基准的评分错误,并调整了评分系统以求更稳定。

该公司表示,此前为在大模型密集发布期保持分数稳定而暂缓更新,但榜单头部变动过快,促使他们推出此次临时更新。据称,已开发八个月的 5.0 版本将分阶段推出。

限制与来源

上述信息来自 the-decoder.com 对 Artificial Analysis 公告的转述,具体评测方法、分数细节及模型表现尚未获得官方独立验证。文中涉及的模型名称(如 GPT-6 Astra、Claude Fable 5.1)及评测结果均以素材原文为准,可能包含非官方命名或未来产品信息。相关数据与排名请以 Artificial Analysis 官网当前发布内容为准。