快讯
AWS 博客:Amazon Bedrock 上选 OpenAI 模型,别只看每 token 价格
AWS 博客发文讨论在 Amazon Bedrock 上选择 OpenAI 模型时,仅比较每百万 token 价格并不足够,还需考虑正确率、token 效率与智能体多轮对话成本。文中结果来自开源评测工具,作者提醒样本量有限,应以官网当前信息为准。
AWS 博客提出按“结果成本”选择 Bedrock 上的 OpenAI 模型
AWS 官方博客发布一篇技术文章,讨论在 Amazon Bedrock 上为生成式 AI 工作负载选择 OpenAI 模型的方法。文章认为,业界习惯用“每百万 token 多少美元”做比较,但生产负载真正购买的是结果,例如一张已解决的支持工单或一份完成的调研简报。作者提出应关注三个乘数:模型答对的频率、达到正确答案所需的 token 数量,以及智能体任务中的轮次数量,因为每一轮都会重新发送不断增长的对话上下文。
背景与影响
文章称,其结论来自一个开源评测工具,对 Amazon Bedrock 上的若干 OpenAI 模型与 OpenAI API 上两款成本优化模型进行对比,覆盖单次调用准确率与成本、多轮网页研究任务轨迹,以及按评分标准评估的专业交付物。文中提到,Bedrock 上的模型在评测时关闭了推理,而 API 基线使用默认设置,因此这是实际部署配置的比较,而非对模型内在能力的受控估计。文章还提及 2026 年 7 月 30 日 Bedrock 上部分 GPT-5.6 模型的价格调整,并称结果文件中的单价需以实时定价页为准。
限制与来源
作者明确提示,样本量在 48 至 198 项之间,差距较小时应视为方向性参考;评测结果受模型、供应商基础设施与模型特定配置差异影响。文章鼓励读者在自己的任务上复现评测后再做选择。本文所述价格、模型可用性与区域支持情况均以 Amazon Bedrock 官网当前信息为准,相关细节尚未获独立确认。