AB
AiBoss
News

Ai2 发布 Olmo-core 3:面向万亿参数 MoE 的开源训练框架

Ai2 发布 Olmo-core 3,重构混合专家(MoE)训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。官方称该框架已用于下一代 Olmo 模型,并以开源方式提供。

核心事实

Ai2 发布 Olmo-core 3,称这是其大语言模型开发框架的一次重要升级,核心是重新设计的开源混合专家(MoE)训练系统。官方表示,该版本面向万亿参数级别的 MoE 训练,同时尽量保持计算效率,是下一代 Olmo 模型背后的核心系统之一,并延续其开放训练基础设施的做法。

据官方博客,Olmo-core 3 从早期基于全分片数据并行(FSDP)的 MoE 实现,转向基于分布式数据并行(DDP)的系统:专家常驻 GPU,数据被路由到对应专家,避免反复聚合权重。框架还组合了专家并行、流水线并行与分布式优化器,并采用行式专家并行、GPU 常驻路由与分组 GEMM 等优化,同时支持 MXFP8 低精度格式。

背景与影响

MoE 通过只激活部分参数来降低单个输入的计算量,但完整模型仍需存放在 GPU 显存中并在训练中更新,跨集群路由输入也会带来通信与协调开销。随着 MoE 规模增大,这些成本可能侵蚀其计算优势。Olmo-core 3 的目标正是缩小这一差距。

官方给出的一组基准显示:专家池从 8 扩到 128、每个 token 仍只选 4 个专家、每 token 激活参数约 3.2B 时,总参数容量从 4.6B 增至 47B,训练吞吐下降不到 5%。在 8 块 NVIDIA B300 GPU 的初步测试中,470 亿参数 MoE 达到每 GPU 每秒 52,000 token,而旧实现为 19,400,约为 2.7 倍。官方还称已在超过 1 万亿总参数配置上做过基准测试,包括 512 块 GPU 上 1.2 万亿参数、每 token 激活 583.6 亿参数的配置,最高观测吞吐为 858 TFLOP/s/GPU;这些测试使用随机路由衡量系统性能,而非模型质量。

限制与来源

上述数字均来自 Ai2 官方博客与技术报告,属于其自测结果,尚未见独立第三方复现。官方也说明,2.38 万亿参数配置只是短时容量测试,并非完整训练运行,用于展示可达到的规模而非持续训练性能。MXFP8 的约 21% 吞吐提升与显存下降同样来自受控基准,实际效果取决于工作负载与硬件。框架的可用范围、硬件支持与许可条款请以官网及代码仓库当前信息为准。

来源:Hugging Face 博客《Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs》。