AB
AiBoss
News

英伟达Vera Rubin NVL72首登MLPerf推理榜,吞吐量据报最高达GB300 NVL72的3.7倍

英伟达在MLPerf Inference v6.1中首次提交Vera Rubin NVL72预览成绩,据报在Qwen3-VL上吞吐量最高达GB300 NVL72的3.7倍,DeepSeek-R1上最高2.5倍;GB300 NVL72四机架288 GPU实现99%扩展效率。

英伟达Vera Rubin NVL72首次亮相MLPerf推理测试

据英伟达官方博客消息,在MLPerf Inference v6.1结果中,英伟达首次以Vera Rubin NVL72系统提交预览成绩。据报该平台在Qwen3-VL基准上,于离线、服务器和交互三种场景下吞吐量最高可达GB300 NVL72的3.7倍;在DeepSeek-R1上吞吐量最高为GB300 NVL72的2.5倍。上述结果来自MLCommons公开数据,属于Closed Division提交。

背景与影响

英伟达称,这些成绩体现硬件与软件的全栈协同设计:Vera Rubin的Tensor Core与Transformer Engine加速推理的预填充与解码阶段,NVFP4精度降低模型权重、注意力与KV缓存的内存占用;提交中还大量采用分离式服务与大规模专家并行。此外,GB300 NVL72在DeepSeek-R1上从单机架72 GPU扩展至四机架288 GPU,据报实现99%扩展效率;在WAN 2.2文生视频基准上达到每秒0.65段720p视频。英伟达还表示,v6.1提交中的软件优化使GB300 NVL72在Qwen3-VL上性能较v6.0最高提升1.6倍。对考虑AI基础设施投入的机构而言,吞吐、扩展效率与软件迭代速度是影响长期推理经济性的因素。

限制与来源

需要说明的是,Vera Rubin NVL72的成绩为预览提交,尚未获官方全面确认,实际表现可能随软件版本变化。文中提及的3.7倍、2.5倍、99%等数字均来自英伟达博客引用的MLCommons结果,未经独立验证;博文中还提到提交截止后的优化结果尚未经MLCommons验证。相关平台的功能、可用地区与配置请以英伟达官网当前信息为准。本文不构成任何采购或投资建议。来源:英伟达官方博客(blogs.nvidia.com),MLPerf名称与标识为MLCommons Association商标。