闲社

标题: 【工作流】智能体技能评估失败分类核验工作流 [打印本页]

作者: admin    时间: 昨天 22:44
标题: 【工作流】智能体技能评估失败分类核验工作流
[md]
# 智能体技能评估失败分类核验工作流

## 套餐描述

区分技能评估中的合法断言与崩溃、超时、API错误,阻止基础设施异常制造假通过。

## 详细介绍

# 智能体技能评估失败分类核验工作流

**3个实用技能 · 3步完成 · 每一步都能单独使用**

把评估器的“未触发”和“运行失败”分开:先整理每条用例的期望、观察结果、运行身份和错误证据,再分类合法断言与基础设施异常,最后生成等待负责人决定的人工门禁。套餐只处理脱敏评估摘要,不调用模型、不运行评估、不修改技能描述。

3个可下载技能 · 每个技能可单独运行

## 3步自动化工作流

### 🔵 1 智能体技能评估结果归一

技能文件:`agent-skill-eval-outcome-normalizer`

**解决什么:** 评估输出常把触发、未触发、断言失败、超时、API 错误和进程崩溃混在同一布尔字段中,无法判断通过率是否可信。

**你会得到:** READY/REVIEW、规范化用例、基础设施异常数量、运行引用和 `eval_outcome_snapshot_hash`。

**↓ 本步结果自动进入下一步**

### 🟢 2 智能体技能评估失败分类

技能文件:`agent-skill-eval-failure-classifier`

**解决什么:** 负向用例发生崩溃时,错误结果可能被计成“未触发”,从而制造假通过并误导描述优化器。

**你会得到:** PASS/REVIEW/BLOCKED、逐例 VALID_PASS/VALID_FAIL/INFRA_ERROR 分类、可计分用例数量、`infra_error_count` 和 `false_pass_guard`。

**↓ 本步结果自动进入下一步**

### 🟠 3 智能体技能评估失败人工门禁

技能文件:`agent-skill-eval-failure-gate`

**解决什么:** 分类结果通过不等于可以自动改描述、继续优化或重跑;负责人还需要确认基线、异常处置和重跑范围。

**你会得到:** READY_FOR_HUMAN_EVAL_FAILURE_REVIEW/HOLD、`human_decision=PENDING`、`optimizer_execute=false`、`rerun_execute=false` 和 `external_action_executed=false`;这是最终交付。

## 实际示例

脱敏样例包含一个应触发且实际触发的正向用例、一个应不触发且实际未触发的负向用例。第一步固定用例与运行身份,第二步输出两个 VALID_PASS,第三步生成待人工复核包。将负向用例 outcome 改为 timeout、crashed 或 api_error 并提供 stderr_ref,会输出 INFRA_ERROR;它不会进入通过率或优化器。样例只验证离线字段,不代表真实技能质量或模型行为。

## 适合谁

- 维护 Agent Skills 触发评估、功能评估或描述优化器的工程团队
- 需要把 CI 运行失败与模型/技能断言失败分开的 QA 团队
- 负责技能版本、基线、回归和发布门禁的开发者
- 在自动优化技能描述前,需要证明评估数据没有被基础设施异常污染的团队

## 买家只需提供

- 脱敏的 suite_ref、case_id、query、should_trigger 和 outcome
- 每条用例的 run_id,以及错误、超时、API 或 stderr 引用
- 基线引用、重跑引用和人工负责人引用
- 不提供 API key、Cookie、原始提示词、模型响应、客户数据或业务载荷

## 使用方式

1. 使用 Python 3.10 或更高版本,把评估运行摘要写成 UTF-8 JSON;错误引用只写脱敏编号。
2. 依次运行结果归一、失败分类和人工门禁,也可以单独运行任一步。
3. 由负责人修复评估基础设施、决定是否重跑或更新基线;套餐不会调用模型、修改描述或启动优化器。

## 交付与验收

- 三个独立技能目录,每个包含元数据、技能说明、标准库执行器、文档和脱敏样例。
- 三步可重复运行:结果归一、失败分类、人工评估门禁;每个技能也能单独使用。
- 缺 run_id、outcome、错误证据,或发现 crash/timeout/api_error 时,输出明确 REVIEW/BLOCKED 分支,并避免把异常计入合法断言得分。
- 正常样例输出 READY_FOR_HUMAN_EVAL_FAILURE_REVIEW,并保留 PENDING、optimizer_execute=false、rerun_execute=false 和 external_action_executed=false;错误样例不会触发评估或优化动作。

## 服务说明

脚本只处理买家有权使用且已经脱敏的本地 JSON,不连接模型、评估器、CI、网络或数据库,不读取凭据,不运行测试,不修改技能描述,不改变基线。静态分类不能证明评估器实现正确、模型输出真实或技能应当发布;分类依赖买家提供的 outcome、run_id 和错误证据。套餐不包含模型调用、评估框架接入、CI 配置、描述优化、生产部署或持续监控。

## 套餐图标



## 包含技能

- [agent-skill-eval-failure-classifier
](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=agent-skill-eval-failure-classifier)
- [agent-skill-eval-failure-gate
](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=agent-skill-eval-failure-gate)
- [agent-skill-eval-outcome-normalizer
](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=agent-skill-eval-outcome-normalizer)

## 安装方式

此套餐为**付费套餐**,购买后可一键下载全部技能。

🛒 [点击购买并下载 智能体技能评估失败分类核验工作流](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=buy&bundle_id=551)

## 收费方式

💴 **现金购买** - 需要支付 ¥187.00

## 前往安装

**[👉 点击前往套餐安装页面](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=bundle&ac=detail&slug=agent-skill-eval-outcome-normalizer-b1282905f99c)**
[/md]




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0