AB
AiBoss站
快讯

NVIDIA cuOpt 推出 mPDLP:多 GPU 求解超 1 亿变量线性规划

NVIDIA 开发者博客介绍 cuOpt 新增的 mPDLP 求解器,可将大规模线性规划问题分布到 NVLink 互联的多块 GPU 上,单 GPU 峰值内存最高降至单卡 PDLP 的六分之一,问题规模上限为 21 亿非零元。

核心事实

NVIDIA 开发者博客发布文章,介绍 NVIDIA cuOpt 中新增的 mPDLP(Multi-GPU Primal-Dual hybrid gradient for Linear Programming)求解器。该求解器将大规模线性规划(LP)问题分布到通过 NVLink 互联的多块 GPU 上,官方称可实现两项主要效果:一是缩短那些在规划时间窗口内难以求解的大规模问题的求解时间;二是相比单 GPU 的 PDLP,每块 GPU 的峰值内存占用最高可降低至六分之一,LP 问题的非零元规模上限为 21 亿。

背景与影响

文章指出,供应链与能源电网等场景的规划模型正变得越来越大。cuOpt 此前在单 GPU 上对大规模 LP 问题已能相对 CPU 求解器带来超过 10 倍的加速,但当前最大的规划问题可能需要数小时才能收敛,或超出单块 GPU 的显存容量。mPDLP 采用最小割(min-cut)图划分,利用连续稀疏矩阵向量乘法(SpMV)之间共享的依赖关系,通过减少二分依赖图中的边割来降低跨 GPU 通信。据文章介绍,在 NVIDIA DGX B200 上对 100 多个 LP 实例的基准测试显示,加速效果与问题规模强相关,非零元超过 10^7 后开始明显,最大问题上仅 PDLP 迭代步骤最高可达 11.4 倍加速;在多数非零元超过 10^7 的大规模实例上,相比此前的 D-PDLP 方法有 1.2 倍至 2.5 倍加速,但性能会随稀疏结构和边割比例而变化。文章还提到,Kinaxis 在超过 1.35 亿变量的消费品供应链模型上使用八块 NVLink 互联的 H100 GPU,报告了 3.3 倍加速;PSR 在 1.85 亿变量的随机能源扩展模型上使用八块 B200 GPU,报告了超过 5 倍加速。

限制与来源

上述数据来自 NVIDIA 开发者博客及其引用的合作方陈述,属于厂商侧信息,尚未经独立第三方验证。文章也说明,mPDLP 的性能高度依赖矩阵的稀疏模式与边割数量,并非所有问题都能获得同等加速。相关 API、求解器设置与部署方式以 cuOpt 官方文档和代码仓库的当前信息为准。