AWS 为技能型智能体推出技能评估器
AWS 博客介绍 Strands Evals SDK 与 Amazon Bedrock AgentCore Evaluations 新增的技能评估器,用于衡量智能体是否选对技能、是否完整遵循技能指令,以补上通用输出质量指标难以覆盖的两类失败模式。
AWS 为技能型智能体新增技能评估器
据 AWS 机器学习博客介绍,Strands Evals SDK 与 Amazon Bedrock AgentCore Evaluations 新增了面向技能的评估器。其中 Skill Selection Accuracy 判断每次被调用的技能是否适合当前任务,对每个被调用技能返回二元结果;Skill Instruction Following 衡量智能体对某项技能指令的遵循程度,对每个规定步骤给出五级评分;Strands Evals 还提供确定性的 Skill Invoked 检查,用于判断某个具名技能是否已成功加载。博客称这些评估器可基于 Strands Evals 记录的轨迹或 OpenTelemetry 追踪结果运行,并通过 AgentCore CLI 使用。
背景与影响
博客指出,技能是一组可复用的指令,通常存放在 SKILL.md 文件中,用于教会智能体处理特定领域任务,例如合同脱敏、发票核对或团队拉取请求规范。技能遵循开放的 Agent Skills 标准,可在兼容的运行框架间迁移,智能体在运行时只加载所需技能。这种模块化带来两类通用输出质量指标容易漏掉的失败模式:智能体调用了不适合任务的技能;或调用了正确技能却跳过、只部分遵循其指令。两者都可能产出流畅且看似合理的回答,却未真正使用预设的领域知识。因此评估不能只看最终回答。博客举例说,若 HR 助手在员工询问牙科与视力福利时调用了福利技能,Skill Selection Accuracy 可定位这一路由决策;若智能体正确调用休假规划技能却跳过结转规则检查,Skill Instruction Following 可定位被跳过的步骤。博客强调,这两类失败需要不同的修复方式。
限制与来源
上述内容来自 AWS 官方博客,属于厂商自述,本文未做独立验证,也未获得相关实测数据。博客未披露这些评估器的定价、地区可用性、配额或许可信息,具体功能范围、支持语言与账号要求请以 AWS 官网当前信息为准。评估器给出的评分与判定结果应结合具体业务场景审慎解读,不宜直接作为合规或人事决策依据。