闲社服务运行正常AI智能体自动化平台
7*24新情报

微软研究发布AgentRx:用可审计日志定位AI智能体失败步骤

[复制链接]
333222111s 显示全部楼层 发表于 昨天 13:01 |阅读模式 打印 上一主题 下一主题
事件概述

微软研究团队在2026年10月2日的研究归档中介绍AgentRx,一套用于诊断AI智能体失败执行轨迹的自动化框架,并公开了包含115条失败轨迹的新基准。

对象与发布方

项目:AgentRx;开发者:Microsoft Research团队;官方归档日期:2026年10月2日;论文计划发表于EMNLP 2026。

关键能力


  • 基准覆盖结构化API工作流、事件管理以及开放式网页/文件任务,并为每条失败轨迹标注关键失败步骤和跨领域失败类别。
  • AgentRx会综合约束条件逐步评估执行过程,生成带证据的可审计验证日志,再由基于大语言模型的评判器定位关键步骤和失败类别。
  • 微软研究页面称,该框架在三个领域的步骤定位与失败归因上优于现有基线。


适用对象

构建或评测多步骤AI智能体的研发团队、平台工程师和安全/可靠性研究者,可用它分析工具调用、长流程和多智能体执行中的失败原因。

实际影响与限制

AgentRx把“智能体失败了”进一步拆解为可复核的步骤和约束违反证据,有助于建立回归测试与故障分析流程;但公开基准只有115条失败轨迹,任务域也集中在三个场景,不能直接代表所有生产工作流。框架还依赖轨迹记录质量和LLM评判器,实际部署仍需人工抽查并验证归因可靠性。

官方来源

Microsoft Research:AgentRx: Diagnosing AI Agent Failures from Execution Trajectories
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表