AB
AiBoss站
快讯

亚马逊 SageMaker 推理推出前缀感知路由,据称可降低 LLM 延迟

AWS 发布 Amazon SageMaker Inference 的前缀感知路由功能,将具有相同提示前缀的请求固定发送到同一实例,以提升 KV 缓存复用率。官方博客称在 Llama 3.1 70B 基准测试中降低了首 token 延迟,但相关数据均为 AWS 自测,实际效果需以官网当前信息为准。

核心事实

亚马逊云科技(AWS)在其官方博客发布文章,介绍 Amazon SageMaker Inference 新增的前缀感知路由(prefix-aware routing)功能。据该文章描述,这一路由策略会查看每个请求的开头部分,把具有相同前缀的请求持续发送到同一个实例,使该实例上的 KV 缓存得以积累和复用,而不是像默认随机路由那样把相同前缀分散到不同机器上重复计算。

文章称该功能内置两项保护机制:一是过载保护,当某个前缀过于热门、目标实例已达并发上限时,请求会被转发到较空闲的实例;二是扩缩容期间的稳定性,增加或减少实例时大部分请求仍流向原实例,只有少量流量发生迁移。

背景与影响

在 LLM 应用中,提示词通常由固定的上下文部分(指令、参考文档、对话历史)和可变的用户输入组成。vLLM、TensorRT-LLM 等推理框架已支持前缀缓存,可复用已计算的 KV 对,从而缩短首 token 延迟(TTFT)。但在多实例部署下,若路由层把相同前缀打散,各实例都难以形成有效缓存,前缀缓存的收益会被削弱。前缀感知路由正是针对这一环节。

据该博客披露的自测数据,在 7 台 ml.p5.48xlarge 实例、Llama 3.1 70B Instruct 与 vLLM 环境下,长上下文场景的 P50 TTFT 降幅为 71%–77%,P90 TTFT 降幅为 33%–37%,吞吐提升 15%–16%,KV 缓存命中率从约 25% 升至 82%;短上下文场景收益相对较小。文章还称路由逻辑每请求增加约 1.3–1.9 毫秒开销。上述数字均来自 AWS 自行开展的基准测试,尚未获独立验证。

限制与来源

需要说明的是,本文所述性能数据、实例规格与测试配置均出自 AWS 官方博客,属于厂商自测结果,实际表现会因模型、负载形态、实例类型与配置不同而存在差异。该功能的具体可用区域、支持的实例类型、计费方式与配额限制,博客未在素材中完整给出,请以 Amazon SageMaker 官网当前信息为准。本文不构成任何采购、投资或架构决策建议。

来源:AWS 官方博客《Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference》,链接:aws.amazon.com