AB
AiBoss
ニュース

AWS 为 SageMaker HyperPod 推出模型缓存以缩短推理冷启动

AWS 发布 Amazon SageMaker Inference on HyperPod 的模型缓存功能,通过预加载模型权重与容器镜像到节点本地 NVMe,减少推理 Pod 启动时的下载等待。官方博客称权重读取速度约为 7 GB/s,但具体效果仍取决于集群配置与工作负载。

核心事实

AWS 在官方博客中宣布,为 Amazon SageMaker Inference on HyperPod 推出模型缓存(model caching)功能。据该博客描述,该功能会在 Pod 被调度之前,把模型权重和推理服务器容器镜像预先加载到集群节点上,从而减少推理服务的冷启动时间。博客称,启用后 Pod 可从本地 NVMe 存储读取权重,典型速度约为 7 GB/s,而不再依赖网络下载。

背景与影响

博客指出,在 HyperPod 上部署大语言模型时,从请求 Pod 到可服务流量之间存在等待,主要来自两次串行下载:来自 Amazon ECR 的推理服务器容器镜像,以及来自 Amazon S3、Amazon FSx for Lustre 或 HuggingFace Hub 的模型权重。博客举例称,较小模型可能只需几分钟,而像 DeepSeek-R1 这类 600 GB 以上的模型可能需要 30 分钟以上。在扩容场景下,每个新 Pod 都会重复这一过程,因此自动扩缩容的实际响应时间受限于存储后端的网络吞吐。模型缓存提供权重缓存与镜像缓存两项能力,可分别或同时启用;两者均采用优先调度而非强制调度,Pod 不会被阻止启动,若落在未预热节点上则回退到原有下载方式。

限制与来源

上述内容来自 AWS 官方博客,属于厂商自述,尚未获得独立验证。博客中提到的约 7 GB/s 读取速度、5–7 分钟镜像拉取时间、20 分钟以上权重下载时间等均为该博客给出的说明,实际表现会因集群配置、存储后端、网络条件与模型规模而异。该功能的具体可用区域、计费方式与配额限制,请以 AWS 官网当前信息为准。