|
**事件概述**
微软研究团队在2026年10月2日的研究归档中介绍AgentRx,一套用于诊断AI智能体失败执行轨迹的自动化框架,并公开了包含115条失败轨迹的新基准。
**对象与发布方**
项目:AgentRx;开发者:Microsoft Research团队;官方归档日期:2026年10月2日;论文计划发表于EMNLP 2026。
**关键能力**
- 基准覆盖结构化API工作流、事件管理以及开放式网页/文件任务,并为每条失败轨迹标注关键失败步骤和跨领域失败类别。
- AgentRx会综合约束条件逐步评估执行过程,生成带证据的可审计验证日志,再由基于大语言模型的评判器定位关键步骤和失败类别。
- 微软研究页面称,该框架在三个领域的步骤定位与失败归因上优于现有基线。
**适用对象**
构建或评测多步骤AI智能体的研发团队、平台工程师和安全/可靠性研究者,可用它分析工具调用、长流程和多智能体执行中的失败原因。
**实际影响与限制**
AgentRx把“智能体失败了”进一步拆解为可复核的步骤和约束违反证据,有助于建立回归测试与故障分析流程;但公开基准只有115条失败轨迹,任务域也集中在三个场景,不能直接代表所有生产工作流。框架还依赖轨迹记录质量和LLM评判器,实际部署仍需人工抽查并验证归因可靠性。
**官方来源**
[Microsoft Research:AgentRx: Diagnosing AI Agent Failures from Execution Trajectories](https://www.microsoft.com/en-us/research/publication/agentrx-diagnosing-ai-agent-failures-from-execution-trajectories/) |
0