AB
AiBoss站
快讯

AWS 发布 SageMaker AI 多轮强化学习微调搜索智能体方案

AWS 在官方博客介绍如何用 Amazon SageMaker AI 的多轮强化学习(MTRL)微调搜索智能体,以 Qwen3.6-27B 为例,结合 BM25 与向量检索工具,在 FRAMES、BRIGHT 等数据集上训练,并支持 PPO、CISPO 等算法与 MLflow 轨迹观测。

核心事实

AWS 在官方博客发布技术文章,介绍如何借助 Amazon SageMaker AI 的多轮强化学习(MTRL)能力微调搜索智能体。文中以 Qwen3.6-27B 模型为例,构建了一个企业搜索场景:智能体可调用两种工具——基于词频的关键词检索(BM25)与向量语义检索,并在多轮交互中自主决定检索内容、检索策略以及何时停止。训练环境需使用可访问 Amazon SageMaker AI 的 AWS 账户,文章给出的示例区域为美国西部(俄勒冈)即 us-west-2,训练与验证数据集需上传至 Amazon S3。

背景与影响

文章指出,搜索智能体的多步行为难以直接获得:小模型经提示词难以稳定呈现多轮行为,前沿模型虽效果好但延迟与成本更高。传统监督微调依赖昂贵且往往不存在的专家多轮轨迹,单轮强化学习(如 RLVR)又只对单次回复打分,无法覆盖多轮之间的依赖关系。MTRL 则把任务建模为决策序列,通过多轮 rollout 生成训练数据,并用策略梯度算法优化,奖励信号只需反映最终结果好坏。SageMaker AI MTRL 提供模块化智能体—环境接口、无服务器执行、异步 rollout 与轨迹收集、内置算法库(PPO、CISPO、重要性采样损失,以及 GRPO、GRPO pass@k、RLOO 等组内优势估计器)、可恢复训练、基于 MLflow 的轨迹与奖励观测,以及评估作业。训练数据涉及 FRAMES、BRIGHT、Enterprise RAG、ESCI、Musique、MLQA 等,测试集包括 FreshStack、WixQA、BrowseComp-Plus、Wands。

限制与来源

上述内容来自 AWS 官方博客的技术说明,属于方案介绍而非独立第三方评测;文中未给出可复现的检索质量与可靠性具体数值,也未披露定价、配额或各区域可用性细节。示例所用模型、区域与数据集均为文章设定,实际支持情况、计费方式与功能范围请以 AWS 官网当前信息为准。原文链接:https://aws.amazon.com/blogs/machine-learning/fine-tune-a-search-agent-with-multi-turn-rl-on-amazon-sagemaker-ai/