亚马逊 Bedrock 提示缓存:据称可降低输入令牌成本
AWS 博客介绍 Amazon Bedrock 提示缓存机制,称在重复发送相同上下文时,缓存命中的输入令牌成本可降低最多 90%,并给出六种实践场景与令牌计费分类。
核心事实
AWS 官方博客发布了一篇技术文章,介绍 Amazon Bedrock 的提示缓存(prompt caching)功能。文章称,当用户反复向基础模型发送相同上下文时,该功能可降低输入令牌成本,并缩短首令牌时间(TTFT)。文中给出的机制是:请求中加入 cachePoint 标记后,Bedrock 会判断标记前的内容是否与已有缓存条目匹配;命中则跳过重复处理,未命中则处理完整内容并写入缓存。
文章列出四项关键概念:缓存条目按 AWS 账户与区域隔离;每个缓存检查点需达到最低令牌阈值(文中举例称 Claude Sonnet 4.5/4.6 为 1,024 令牌,Opus 模型为 4,096);缓存条目按请求指定的 TTL 过期,默认 5 分钟,部分模型支持最长 1 小时;Converse API 的 cachePoint 语法在不同模型家族间保持一致。
背景与影响
文章以一份 10,000 令牌合同加 50 个问题为例,说明无缓存时全部输入令牌按标准价格计费。作者认为,缩短提示、缩小上下文窗口或应用层响应缓存各有取舍,而提示缓存是在基础设施层面缓解该问题。文中还列出六种场景:消息内容缓存、系统提示缓存、工具定义缓存、混合 TTL 缓存、多租户隔离,以及与 LangChain 集成。
计费方面,文章称缓存写入令牌比标准输入高 25%,1 小时 TTL 的写入高 100%,缓存读取令牌比标准输入低 90%;对重复上下文的工作负载,输入令牌成本净节省约 75%,前提是后续请求都在 TTL 窗口内。
限制与来源
上述比例、阈值与 TTL 均来自 AWS 博客原文,属于厂商自述,尚未获独立验证。模型支持范围、区域可用性、定价与 TTL 选项可能随时调整,请以 Amazon Bedrock 官网当前信息为准。文章示例使用跨区域推理配置文件,并提示请求自动跨区域路由,可能增加缓存写入频率。本文不构成任何采购或架构建议。