NVIDIA 发布 NeMo Relay,用执行轨迹追踪 Agent Harness 行为
NVIDIA 开发者博客介绍 NeMo Relay,为 Agent 运行提供统一可观测层,记录有序生命周期事件与结构化轨迹。Hermes Agent 已原生集成,可输出 ATOF 事件流、ATIF 逐步轨迹及带 OpenInference 标签的 OpenTelemetry span,并可在 Arize Phoenix 中查看。
核心事实
NVIDIA 开发者博客发布教程《Tracing Agent Harness Behavior with NVIDIA NeMo Relay》,介绍如何用执行轨迹理解 Agent 行为、判断 harness 改动是否改善任务结果。据该文,NeMo Relay 提供统一的可观测层,捕获有序的生命周期事件与结构化的 Agent 运行轨迹。
文章称,Agent harness Hermes Agent 已原生集成 NeMo Relay,将其会话、轮次、模型调用与工具调用映射到 NeMo Relay 的 scope 层级中,并产出三类输出:ATOF(Agent Trajectory Observability Format)事件流、ATIF(Agent Trajectory Interchange Format)逐步轨迹,以及带 OpenInference 标签的 OpenTelemetry span,可在 Arize Phoenix 等工具中查看。
背景与影响
文章指出,Agent 可能完成任务却走了低效路径,例如失败搜索触发再次搜索、文件读取被截断导致重复抓取,最终答案正确却掩盖了额外步骤,增加延迟与 token 消耗。仅靠成功校验无法解释 Agent 为何从工具错误中恢复、提前停止或需要额外模型调用。
教程给出两个示例:一是终端工具任务,Hermes 在隔离的 Docker 容器中运行脚本并输出固定结果,运行器校验输出、模型 scope、token 用量与工具错误;二是多工具研究任务,Hermes 需读取旅行记录、搜索网络、在官网核实会议、撰写报告并返回会议名称,所有模型与工具 span 发送至 Phoenix。文章还提到一个 Hermes ToolPerf 案例研究,在 108 次运行中比较基线与修订版本,据报 Qwen Coder 30B 恢复了更多任务,但调用次数、数据量与延迟上升。
限制与来源
上述内容来自 NVIDIA 开发者博客,属于教程与厂商自述,文中示例输出为单次已验证运行的结果,token 数、标识符与文件路径可能因运行而异。文章强调,因任务使用实时网络搜索,相关运行适合探索行为而非用于模型排名;受控比较需要固定搜索响应并重复运行。此外,轨迹可能包含提示词、模型响应、工具参数与结果、文件路径等数据,分享前应先行检查。安装、配置与格式细节请以 NeMo Relay、ATOF、ATIF 官方文档及官网当前信息为准。