快讯
xAI 发布 Grok 4.7:主打长任务与性价比,口碑两极
xAI 正式发布 Grok 4.7,官方称其为迄今最强的编程与知识工作模型,主打长时执行、自我验证与性价比。官方公布多项基准提升,但横向对比未全面领先;首批实测口碑分化。
xAI 正式发布 Grok 4.7
据 36 氪转载爱范儿报道,xAI 已正式发布 Grok 4.7,官方将其定位为迄今面向编程与知识工作最强的模型。该模型已接入 Cursor、Grok Build 与 Grok API,并称将通过第三方编程工具、模型路由平台与云服务提供。发布节奏晚于此前预告,官方称模型仍需进一步调优。
能力侧重与官方数据
官方介绍称,Grok 4.7 采用比 Grok 4.6 更大的基础模型,强化学习时间更长、训练任务更难,并增强长上下文管理与结果验证能力。官方公布的对比显示:CursorBench 4.0 由 40.4% 升至 46.3%,DeepSWE v1.1 由 65.2% 升至 71.0%,Terminal Bench 4.0 由 20.3% 升至 38.0%。不过横向看,其在部分基准上仍低于 Fable 5.1 Max 与 GPT 5.6 Sol Max。价格方面,官方 API 定价与 Grok 4.6 相同,输入每百万 token 2 美元、输出每百万 token 6 美元,另提供输出速度加倍的快速版本,价格相应翻倍。上述价格与可用范围请以 xAI 官网当前信息为准。
限制与来源
首批第三方实测口碑分化:有开发者称其在多步可视化任务中细节丰富、成本更低,也有人认为 3D 与前端表现低于预期,存在物理效果僵硬、提示理解不稳、token 消耗过快等问题。相关评测均为个人或机构单次测试,样本有限,不构成性能结论。本文信息来自 eu.36kr.com 转载内容,观点仅代表原作者,尚未获 xAI 官方对第三方评测的确认。