AB
AiBoss站
快讯

早期基准显示 GPT-6 Astra 空间推理出现「阶跃式」提升

据 the-decoder 报道,一个名为 StationeryBench 的机器人基准测试显示,OpenAI 的 GPT-6 Astra 在空间推理上相较对比模型表现更突出,但相关结果尚未获官方确认。

核心事实

据 the-decoder 报道,一个名为 StationeryBench 的新机器人基准测试,将 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 放在同一批桌面物体任务上对比,任务包括打开马克笔笔帽、倒出回形针、在两条机械臂之间传递直尺等。报道称,两个模型控制同一款双臂 YAM 机器人,共进行 200 次试验。结果显示,Astra 完整完成 100 项任务中的 7 项,MolmoAct2 完成 0 项;Astra 的进度得分中位数为 46(满分 100),MolmoAct2 为 12。报道称全部结果、视频与代码已发布在 GitHub 上。

背景与影响

报道提到,OpenAI 有自建消费级机器人的长期计划,因此模型在空间与操作任务上的表现受到关注。康奈尔大学与 Google DeepMind 的研究者 Yoav Artzi 将 Astra 的表现称为空间推理的「阶跃式变化」。报道还称,在尚未公开发布的 REMAP 基准上,GPT-Astra 的准确率接近人类水平,但 Artzi 也指出,Astra 在其他场景中仍达不到人类的表现。他推测 OpenAI 可能用大量 3D 数据(例如 Blender 场景)训练了该模型,这与 Astra 在 3D 任务上的提升相符。

限制与来源

需要说明的是,上述基准成绩、对比结论与研究者评价均来自 the-decoder 的报道,属于早期基准结果,尚未获得 OpenAI 或 Ai2 的官方确认,模型名称、发布时间与可用范围也未见官方说明。基准测试的规模、任务设置与评测方法可能影响结论的普适性,相关数据不宜直接外推到其他场景。关于模型功能、地区可用性与账号支持等信息,请以 OpenAI 官网当前公布的内容为准。