闲社服务运行正常AI智能体自动化平台
a

智能体技能评估失败分类

技能标识:agent-skill-eval-failure-classifier

识别错误、超时和崩溃并把它们排除出通过率与描述优化器输入 输入为脱敏的本地技能评估运行摘要,输出结构化核验结果。

作者:原创实现 | 来源记录:ClawHub
包含在套餐中
登记来源
ClawHub
版本
V 1.0.0
检测标记
后台标记通过
随套餐获取
请查看所属套餐
0
收藏
来源与检测标记为平台登记信息,并不代表已展示可复核的检测报告。使用前请核对版本、依赖和所需权限,建议先在隔离环境中运行。
概述
安装方式
版本历史

智能体技能评估失败分类

智能体技能评估失败分类

适用场景

在评估器输出通过率前,区分合法未触发、合法触发、断言失败和基础设施失败,避免崩溃伪装成负向用例通过。

输入与输出

  • - 输入:第一步 snapshot.json,含每条用例的 kind、outcome、shouldtrigger 和 runid
  • 输出:PASS/REVIEW/BLOCKED、逐例分类、scoreablecasecount、infraerrorcount 和 falsepassguard

运行

CODEBLOCK0

错误恢复

发现 INFRA_ERROR 时保持 BLOCKED,不将该用例送入分数或优化器;先修复运行环境再重跑。

隐私边界

只处理买家有权使用且已经脱敏的本地 JSON,不连接模型、评估服务、CI、网络或外部 API,不读取凭据、Cookie、原始提示词或业务数据。

验收

使用 examples/input.json 运行,确认输出包含 status、findings、稳定 hash 和不执行标志;再用 crashed、timeout、apierror 或缺 runid 的样例验证 INFRA_ERROR/REVIEW/BLOCKED 分支。

下载

v1.0.0 最新 2026-8-22 22:44
初始版本(来自套餐拆分)
返回顶部