AB
AiBoss
News

亚马逊云科技盘点 SageMaker 推理 2026 年迄今新功能

亚马逊云科技博客盘点 SageMaker AI 推理在 2026 年迄今推出的 13 项能力,覆盖托管端点与 HyperPod 两条部署路径,涉及容量回退、OpenAI 兼容接口、容器缓存与可观测性等方向。

核心事实

亚马逊云科技在官方博客中发布了对 Amazon SageMaker AI 推理能力的年度盘点。据该博客介绍,2026 年迄今 SageMaker AI 在推理方向共推出 13 项新能力,分布在两条部署路径上:由 AWS 全托管的 SageMaker 推理端点,以及面向需要 Kubernetes 原生控制的 SageMaker HyperPod Inference。

博客称,端点路径的新增能力涉及推理推荐与基准测试、容量感知实例池、OpenAI 兼容 API、容器缓存、可观测性以及异步推理内联负载等;HyperPod 路径则涉及简化 Operator、分层 KV 缓存、数据捕获、性能特性以及预填充与解码分离等。

背景与影响

博客指出,生成式 AI 推理的难点在于模型体积大、延迟以每秒 token 数衡量、冷启动可能持续数分钟、GPU 容量受限,且传统监控工具难以暴露生产环境真正关心的 token 级信号。SageMaker AI 的定位是让客户按实例而非按 token 消费模型。

在两条路径的对比中,博客给出的差异包括:端点为 AWS 全托管,HyperPod 基于托管 Kubernetes 栈;端点支持 Amazon CloudWatch 托管自动扩缩,HyperPod 支持 Karpenter、KEDA 与 CloudWatch;端点在容器与模型层可定制,HyperPod 提供节点级访问、框架与 AMI 层面的更高可定制性。博客称端点适合希望以最小运维开销快速完成托管部署的团队,HyperPod 适合基于 Kubernetes 的训练到推理、多云或混合云场景。

限制与来源

上述内容均来自亚马逊云科技官方博客的自我盘点,属于厂商视角的发布说明,其中涉及的实例类型、区域可用性、计费方式与功能细节可能随服务更新而变化,具体请以 AWS 官网当前信息为准。博客中提到的性能示例为特定条件下的演示结果,不代表普遍表现。本文未对相关功能的实际效果进行独立验证,也未涉及任何采购或投资建议。