AB
AiBoss站
快讯

AWS 介绍在 Amazon EKS 上用 EFA 与 DeepEP 扩展 MoE 强化学习

AWS 发布技术文章,介绍如何用 Amazon EKS、EFA 与 DeepEP 支撑大规模 MoE 强化学习训练,并称吞吐量提升约 40%。文章聚焦 rollout 生成与策略训练的资源平衡、专家并行通信开销等基础设施挑战。

AWS 发布 MoE 强化学习扩展方案

AWS 在其机器学习博客发布技术文章,介绍在 Amazon Elastic Kubernetes Service(Amazon EKS)上,结合 Elastic Fabric Adapter(EFA)与 DeepEP 来扩展混合专家(MoE)模型的强化学习训练。文章标题称该方案可带来约 40% 的吞吐量提升。文章由 Ashvin Nihalani、Alexander Zhipa、James Park 与 Vijay Rajakumar 署名,归入 Amazon EKS 与 Technical How-to 分类。

背景与影响

文章指出,MoE 已成为把大语言模型扩展到数千亿乃至万亿参数规模的常见架构,稀疏化降低了推理成本,但并未消除训练侧的基础设施复杂度。在预训练、中期训练、监督微调与强化学习等环节中,大规模强化学习对基础设施的要求尤为特殊:它同时包含弹性推理类工作负载与紧耦合的模型训练。

文章把挑战归纳为三点:一是协调 rollout 生成与策略训练这两类异构算力需求;二是在数百个加速器之间维持高吞吐通信;三是动态编排各子系统以保持平衡。文章特别提到,专家并行(EP)会引入设备间动态的 all-to-all token 路由,随着 MoE 架构越来越稀疏,训练瓶颈更多来自通信而非计算。文章称该问题在基于 PPO 的 RLHF 流程以及 GRPO 等较新方法中普遍存在。

限制与来源

需要说明的是,上述内容来自 AWS 官方博客的技术说明,属于厂商自述,文中提到的吞吐量提升幅度未在素材中给出可独立核验的测试条件与细节。相关功能、可用区域、实例类型与计费方式可能随时调整,请以 AWS 官网当前信息为准。本文不构成任何采购、投资或技术选型建议。