闲社

标题: NVIDIA介绍NeMo Relay:用可观测轨迹评估AI代理改动 [打印本页]

作者: sale@163ns.com    时间: 半小时前
标题: NVIDIA介绍NeMo Relay:用可观测轨迹评估AI代理改动
事件概述:NVIDIA技术博客于2026年9月30日发布教程,展示如何用NeMo Relay记录AI代理的模型调用、工具调用、错误、重试、耗时和Token使用,再把这些执行证据与任务验证结果结合起来,判断代理编排(harness)改动是否真的提升了任务表现。

对象与开发者:方案围绕NVIDIA NeMo Relay和Nous Research的Hermes Agent展开,作者为NVIDIA的William Markito Oliveira、Maryam Najafian、Moon Chung,以及Nous Research的Teknium。

官方发布日期:NVIDIA Technical Blog标注发布于2026年9月30日。

关键能力与改动:NeMo Relay提供统一观测层,保留有序生命周期事件和结构化轨迹;Hermes Agent原生输出三类证据:ATOF事件流用于重建每个作用域的开始、结束和时间关系,ATIF步骤轨迹用于逐步审阅代理路径,OpenTelemetry加OpenInference跨度则可在Arize Phoenix等工具中查看模型与工具调用、时延、Token和错误。教程用隔离Docker中的终端任务验证VALUE=42,再用文件加网页研究任务验证代理是否查找官方来源并写入报告。

适用对象:需要调试、审计或持续评测多工具AI代理的工程团队、评测人员和安全治理人员,特别是希望区分“少调用”与“更可靠完成”的平台开发者。

实际影响与限制:文章展示的Hermes ToolPerf案例固定任务、模型、工具和验收条件,在108次运行中比较基线与修订版本;Qwen3 Coder 30B修订组成功任务从19/27升到22/27,但平均模型调用从3.8升到4.9、工具调用从2.8升到3.9、时长从27秒增至42秒,说明成功率提升可能伴随更多成本和延迟。NeMo Relay只提供证据,不会自动证明代理更好;轨迹可能包含提示词、模型输出、工具参数、结果和文件路径,分享前需脱敏。教程还要求Docker、Linux或macOS环境和NVIDIA API Key,不能直接视为所有生产系统的性能保证。

官方来源:https://developer.nvidia.com/blog/tracing-agent-harness-behavior-with-nvidia-nemo-relay/




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0