AB
AiBoss
News

llama.cpp 衍生项目测试新 all-reduce 算法:仅双 GPU 场景据报小幅提速

GitHub 项目 llama-cpp-rdna-boosts 的 Issue #37 提出一个可选启用的 all-reduce 算法,标签为 ce,通过环境变量 GGML_CUDA_ALLREDUCE=ce 开启。据发布者描述,该算法仅在 2 块 GPU 上对 Q8_0 权重带来约 4% 的 prefill 性能提升,单 GPU 无效果,3 GPU 反而略差于默认混合算法。

核心事实

GitHub 仓库 stew675/llama-cpp-rdna-boosts 的 Issue #37 中,发布者公布了一个新的 all-reduce 算法,标签为 ce,定位为可选启用(opt-in)的测试特性。启用方式是在启动 llama-server、llama-bench、llama-cli 等程序前设置环境变量 GGML_CUDA_ALLREDUCE=ce。该 Issue 标注为 enhancement,并带有 merged 标记。

背景与影响

据发布者描述,该算法在 2 块 GPU 上对 Q8_0 权重可带来约 4% 的 prefill 性能提升;单 GPU 场景不使用 all-reduce,因此没有变化;在 3 块 GPU 上则略逊于默认的 hybrid all-reduce 算法,发布者建议不要在 3 GPU 配置下启用。测试配置中每块 GPU 通过 PCIe5 x4 通道通信,P2P 与 tensor 模式(-sm tensor)均已开启,所用模型为 Unsloth 的 Qwen3.8-27B、Q8_0 权重。发布者同时表示已启动完整发布构建,并邀请使用者在 Issue 中反馈异常情况。

限制与来源

上述性能数字均为发布者在自有测试环境中的单方描述,尚未获官方确认,也未提供可复现的基准细节,实际表现可能因硬件、驱动、模型与并行配置而异。该特性属于测试性质的可选开关,是否合入上游、后续是否保留均不确定。相关环境变量、支持范围与构建方式请以项目仓库及 llama.cpp 官方当前信息为准。