AB
AiBoss
News

NVIDIA 提出 Megatron Core 位级确定性预训练方案,开销降至约 2%

NVIDIA 开发者博客介绍 Megatron Core 中的位级确定性预训练工作流:通过按 rank 记录有序张量指纹定位不确定性来源,并在万亿参数 Nemotron 模型上将确定性开销从两位数降至约 2%。

核心事实

NVIDIA 开发者博客发布文章,介绍在 NVIDIA Megatron Core 中实现位级确定性(bitwise determinism)预训练的工作流。据该文描述,Megatron-LM PR #7262 提出记录按 rank 排序的张量指纹,用于定位并修复大规模预训练中的不确定性。文章称,针对三个 Nemotron 工作负载的优化把「确定性税」降至约 2%(2,432 个 GPU),并在 800 步内保持位级确定性。

文章给出的验证方式是:对训练损失、语言建模损失、负载均衡损失、多 token 预测(MTP)损失、梯度范数等指标逐步做指纹比对,找出第一个不一致的步数;同时用未中断的参考运行与检查点恢复运行对比,检查参数、优化器状态、随机数状态与数据位置是否位级一致。

背景与影响

文章认为,位级确定性对万亿参数、数千 GPU 规模的训练有四项价值:复现失败、保持检查点连续性、发现意外差异、区分预期改动与运行间波动。定位流程从端到端指标逐级收窄到阶段、模块、算子与内核;指纹在 GPU 上通过 torch.hash_tensor 计算,MXFP8 或 NVFP4 张量需同时记录编码值与 scale 缓冲。文章还提到,分组 GEMM 的多个 N-tile 原先写入同一地址导致结果依赖到达顺序,改为每个 N-tile 使用私有输出槽并固定归约顺序后,可在保持并行度的同时恢复确定性。

限制与来源

上述性能数字与优化效果均来自该博客自述,尚未见独立复现。文章明确指出,位级确定性只在相同硬件与软件环境下验证,跨 GPU 代际、网络配置或库版本的比较不在验证范围内,结果可能不同;指纹匹配也不保证张量位级相同,需用字节级比较确认。相关配方、支持范围与最新信息请以 NVIDIA 官方文档和 Megatron Core 用户指南为准。来源:NVIDIA 开发者博客。