AWS 博客介绍在 Amazon EKS 上用 NVRx 实现容错分布式训练
AWS 博客发布技术文章,介绍如何将 NVIDIA Resiliency Extension(NVRx)集成到 Amazon EKS 上的 PyTorch FSDP 训练中,以应对大规模分布式训练中的故障中断与检查点开销问题。
AWS 博客介绍 EKS 上的 NVRx 容错训练方案
AWS 官方博客发布了一篇技术文章,介绍如何将 NVIDIA Resiliency Extension(NVRx)集成到运行在 Amazon Elastic Kubernetes Service(Amazon EKS)上的 PyTorch Fully Sharded Data Parallel(FSDP)训练流程中,以提升大规模分布式训练的容错能力。文章称,NVRx 是一个可通过 pip 安装的 Python 层,为 PyTorch 增加异步检查点、进程内重启和作业内重启等容错原语,模型与训练代码无需改动。
背景与影响
文章指出,大规模分布式训练通常持续数小时至数天、跨数十个节点运行,网络分区、内存错误、软件异常或基础设施事件都可能中断至少一个工作节点;单个 GPU 故障可能通过 NCCL 超时扩散到健康节点,导致 Pod 崩溃重启不同步。文章还称,同步检查点会让所有 rank 阻塞在 I/O 上,在该文所述集群规模下可占用相当比例的总运行时间。按文章描述,NVRx 的三层恢复机制分别对应不同故障类型:进程内重启处理软故障,ft_launcher 处理 SIGKILL、OOM 等硬故障,集群编排层则应对节点丢失。文章提到其方案在 H100 GPU 上进行了 2 至 8 节点规模的基准测试,并提供了可复现的代码。
限制与来源
上述内容来自 AWS 博客文章,属于厂商技术说明,其中涉及的性能表现、集群配置与恢复效果均为该文作者陈述,尚未获独立验证。文中提到的实例类型、存储服务、网络带宽及可用性等,请以 AWS 与 NVIDIA 官网当前信息为准。本文不构成任何采购、投资或架构选型建议。