AB
AiBoss
News

AWS 博客介绍在 SageMaker HyperPod 上运行 SkyRL 多模态强化学习

AWS 博客发布技术文章,介绍如何在 Amazon SageMaker HyperPod 上使用开源强化学习框架 SkyRL 训练视觉语言模型,并说明集群容错、检查点与可观测性等配套能力。

AWS 博客介绍 HyperPod 上的 SkyRL 多模态 RL 训练方案

AWS 官方博客发布了一篇技术文章,介绍如何在 Amazon SageMaker HyperPod 上使用开源强化学习框架 SkyRL 开展多模态强化学习训练。文章以 Qwen3-VL-8B 视觉语言模型为例,采用 GRPO(Group Relative Policy Optimization)方法训练模型完成二维迷宫导航任务。据该文章描述,从 VisGym 的监督微调检查点出发,经过 GRPO 后训练,在固定的 64 个迷宫评测集上,解迷宫成功率由 43.75% 提升至 95% 以上。上述数字来自该博客自述,尚未获独立验证。

背景与影响

文章指出,强化学习后训练正逐渐成为构建语言模型智能体的常规环节,而多轮 RL 需要模型在整段轨迹上学习,奖励稀疏、难以逐步标注。GRPO 通过让同一初始状态下的多次尝试相互比较来形成训练信号,因此不需要额外的评论家模型或价值模型。在基础设施层面,HyperPod 提供集群韧性能力,持续监控节点健康并自动替换故障节点,配合检查点机制,长时多节点训练任务可从最近保存的步骤继续,而不必从头开始。文章还提到可结合 Ray 能力远程提交作业,并通过预置的 Grafana 仪表盘观察训练过程。

限制与来源

该文属于技术操作指南,文中给出的实例规格、集群规模与配置仅为作者示例,其他 GPU 实例与集群规模同样可行,前提是显存足以容纳模型。具体可用实例类型、区域支持、配额与计费方式,请以 AWS 官网当前信息为准。本文所述性能提升为博客自述结果,未获官方独立确认,也不构成任何采购或投资建议。来源:AWS 机器学习博客,作者 Nilesh PS、Dhawal Parkar、Pradeep Cruz、Vishal Shahane。