GPT-6 Astra 在 ARC-AGI-3 测试中接近满分,但被指靠高成本 Harness 刷分
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 测试中成绩逼近 100%,引发热议。但 ARC Prize 总裁指出,该成绩依赖昂贵的 Harness 和大量算力,每局耗资 360 美元,并非 AGI 的真正证据。
核心事实
据雷峰网报道,OpenAI 的最强模型 GPT-6 Astra 在 ARC-AGI-3 测试中成绩逼近 100%,远超上一代模型 GPT-5.6 Sol 的 38.3%。ARC-AGI-3 被公认为 AI 智商评测的高阶测试,要求 AI 在陌生图形规律题中临场推理,无法靠刷题通过。GPT-6 Astra 在 96% 的关卡中操作效率高于人类,平均动作步数比人类少 51.7%。ARC Prize 官方复盘发现,该模型在测试中会生成高效的“符号世界模型”,将环境抽象为逻辑符号和因果代码,并在内部模拟验证后再行动。
背景与影响
符号世界模型被认为是 AI 迈向高级推理的必经之路,业界包括哈佛、MIT 和 Google DeepMind 都在押注这一方向。GPT-6 Astra 将原本依赖外部 Harness 的能力内化进模型权重,减少了延迟和外部依赖,被视为这一路线的重大胜利。然而,ARC Prize 基金会总裁 Greg Kamradt 公开表示,分数虽真实,但离 AGI 还远。他指出,许多团队通过配备无损内存、程序化分析等组件的 Harness 也能在 ARC-AGI-3 上获得 90% 以上分数,GPT-6 Astra 的成绩同样依赖豪华 Harness 和昂贵算力,每局耗资 360 美元,完整测试成本高达 1.8 万美元(约合 13.5 万人民币),而人类受试者每局成本约 12.78 美元。Kamradt 认为,这种靠“钞能力”刷出的高分只是证明 AI 在变聪明,并非 AGI 到来的证据。
限制与来源
以上信息来自雷峰网文章《打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?》,作者高允毅,编辑岑峰。文中提及的 GPT-6 Astra 性能数据、测试成本及 Kamradt 的评论均来自该报道,尚未获得 OpenAI 或 ARC Prize 的官方确认。关于 GPT-6 Astra 的具体功能、可用性及定价,请以 OpenAI 官网当前信息为准。