AB
AiBoss
News

Mozilla 报告:开源模型与前沿闭源模型性能差距缩至约 4.4 个月

Mozilla 报告称,美国前沿闭源模型与中国开源权重模型的性能差距已缩至约 4.4 个月;为闭源模型付费相当于以约五倍单任务成本换取约四个月的领先期,且这一判断主要适用于 8 至 12 小时量级的任务。

核心事实

据 Ars Technica 报道,Mozilla 于 9 月 15 日发布最新一期《State of Open Source AI》报告。报告称,美国科技公司的前沿闭源模型与中国开源权重模型之间的性能差距已缩小到约 4.4 个月。报告举例称,Moonshot AI 的 Kimi K3 在 Artificial Analysis Intelligence Index 上的综合得分仅落后 Anthropic 的 Fable 5 三分,而成本约为后者的 30%。Mozilla 首席技术官 Raffi Krikorian 表示,为闭源模型支付溢价应视为「按工作负载」而非「按组织」决定。

背景与影响

开源权重模型允许任何人下载主要模型组件并在自有设备上运行,但开发者通常不公开训练数据、数据管线和训练代码;闭源前沿模型则全部专有,需付费使用。Krikorian 解释,企业仍愿为闭源模型付费,是因为它们开箱即用,并附带合规、支持与责任机制,而许多组织缺乏自行运行开源模型的团队。报道提到,DoorDash 已将 Kimi 用于日常任务,把 Fable 留给更困难的专家级任务。报告还援引 METR 的「时间跨度」指标:当前最强闭源模型可可靠完成的任务时长约为最强开源模型的 1.7 倍;需要 8 至 12 小时的任务通常是闭源能做、开源尚不能做的区间。基准公司 Vals AI 在统一测试框架下评估显示,Z.ai 的 GLM 5.2 在 Terminal-Bench 2.1 中与 Anthropic 的 Claude Opus 4.7、4.8 得分相差不到一分,而每个完成任务成本约低五倍。Krikorian 还提到,当前世界运行的大多数开源模型来自中国,他更担心的是能力集中而非模型国籍,并呼吁美国与欧洲实验室进入同一开放赛道。

限制与来源

上述数据来自 Mozilla 报告及 Ars Technica 的报道,具体评测方法、模型版本与成本口径可能随时间变化,尚未获相关厂商官方确认。文中提到的模型名称、得分与价格比较均为报道内容,实际功能、可用地区、账号与语言支持请以各厂商官网当前信息为准。本文不构成任何采购、投资或法律建议。