AB
AiBoss
News

英伟达介绍面向生物基础模型的高效MoE训练方案

英伟达开发者博客发布技术文章,介绍如何借助Transformer Engine的GroupedLinear、MXFP8低精度与融合GroupedMLP内核,提升生物基础模型MoE训练的GPU效率。文中称在八块B200上的训练基准中,BioNeMo配方吞吐量最高可达Hugging Face基线的2.21倍。

核心事实

英伟达开发者博客发布了一篇技术文章,介绍面向生物基础模型的混合专家(MoE)高效训练方法。文章指出,MoE架构通过为每个token只激活部分专家子网络来扩展模型容量,但其收益高度依赖实现方式:专家计算碎片化会降低GPU利用率,路由带来通信开销,参数量增大也带来显存与分布式训练压力。文章给出的应对手段是英伟达Transformer Engine(TE)中的若干优化原语,包括GroupedLinear、MXFP8块缩放8位精度,以及将量化、SwiGLU与路由权重缩放融合的GroupedMLP内核。

背景与影响

文章解释,朴素实现会在Python循环中逐个遍历专家,每次触发独立的内核启动;TE的GroupedLinear把多个专家GEMM合并为一次分组操作提交,并接受每个专家的token数量(split_sizes),从而降低启动与调度开销。在精度方面,BF16每个权重和激活占16位,而FP8与MXFP8占8位;MXFP8为每32个连续值分配一个缩放因子,据文章称有助于保持数值范围与精度,并在Blackwell GPU上获得硬件加速。TE的Sequential API可将GroupedLinear、ScaledSwiGLU与GroupedLinear序列替换为融合算子,避免部分中间结果的物化。文章称,在八块NVIDIA B200 Tensor Core GPU上的训练基准中,BioNeMo配方吞吐量最高可达Hugging Face基线的2.21倍。

限制与来源

上述性能数字来自英伟达自身的训练基准,属于厂商自测结果,未获独立第三方验证,实际表现可能因配置与环境而异。文章列出的前提条件包括:熟悉Python、PyTorch与分布式训练概念,具备CUDA环境,专家并行至少需要两块GPU,而使用融合MXFP8 GroupedMLP内核需要Blackwell架构GPU。相关配方、启动命令与文档以英伟达官网当前信息为准。本文信息来源于英伟达开发者博客,该页面标注由AI生成摘要,并提示AI生成内容可能不完整,建议核实重要信息。