AB
AiBoss
ニュース

AWS 推出 Ray Serve 深度学习容器,简化 TorchServe 推理负载迁移

AWS 发布 Ray Serve 深度学习容器(DLC),为 TorchServe 用户提供预构建、经过测试的推理镜像,涵盖 GPU 栈、PyTorch 和 Ray Serve,支持在 EKS 上部署视觉语言模型。

核心事实

AWS 于 2026 年 9 月 9 日发布博客,宣布推出 Ray Serve 深度学习容器(DLC),旨在简化 TorchServe 工作负载的迁移与支持。该容器基于 Amazon Linux 2023(CPU 版)或 NVIDIA Amazon Linux 2023(GPU 版)构建,预集成 PyTorch、Ray Serve、FastAPI、Uvicorn 以及 FFmpeg(含 NVIDIA 硬件加速)等组件,并针对 Amazon EKS、Amazon EC2 和 Amazon SageMaker 提供不同入口点的镜像。AWS 表示,所有组件在每次发布前均经过联合验证,构建时已应用安全补丁,以消除 CUDA 运行时、框架与服务层之间的版本漂移。

背景与影响

TorchServe 已不再积极维护,官方项目公告称没有计划中的更新、错误修复、新功能或安全补丁,漏洞可能无法解决。这意味着依赖 TorchServe 的团队将面临安全补丁停止、与新版 PyTorch 和 CUDA 的兼容性更新停止等问题,工程师需自行管理整个依赖链。AWS DLC 此前已解决训练负载的类似问题,此次将相同方法扩展到推理。通过 Ray Serve DLC,用户可直接拉取预构建镜像,无需自定义镜像即可运行 Qwen3-VL 等模型;对于需要额外库的模型,可在同一测试基座上叠加。博客示例展示了如何在 EKS 单 GPU 节点上部署 Qwen3-VL-2B 视觉语言模型,应用代码通过 ConfigMap 注入,便于灵活更新而无需重建镜像。

限制与来源

该容器当前提供的镜像标签列表、具体性能数据及定价尚未在素材中披露,实际可用性、配额要求(如 g5.xlarge 实例)及配置步骤以 AWS 官方文档为准。本文信息基于 AWS 机器学习博客文章《Simplify and support your TorchServe workloads using Ray Serve Deep Learning Containers》,作者为 Ananth Raghavendra、Felipe Lopez 和 Jinyan Li。读者应访问 AWS 官网获取最新镜像列表和详细部署指南。