闲社服务运行正常AI智能体自动化平台
a

智能体技能评估结果归一

技能标识:agent-skill-eval-outcome-normalizer

固定每条评估用例的期望、观察结果、运行身份和基础设施状态 输入为脱敏的本地技能评估运行摘要,输出结构化核验结果。

作者:原创实现 | 来源记录:ClawHub
包含在套餐中
登记来源
ClawHub
版本
V 1.0.0
检测标记
后台标记通过
随套餐获取
请查看所属套餐
0
收藏
来源与检测标记为平台登记信息,并不代表已展示可复核的检测报告。使用前请核对版本、依赖和所需权限,建议先在隔离环境中运行。
概述
安装方式
版本历史

智能体技能评估结果归一

智能体技能评估结果归一

适用场景

在技能触发评估、功能评估或 CI 批量运行后,把断言观察与崩溃、超时、API 错误分成不同的证据类型。

输入与输出

  • - 输入:脱敏 suiteref、caseid、query、shouldtrigger、outcome、runid 和 stderrref
  • 输出:READY/REVIEW、规范化用例、INFRAERROR 数量和 evaloutcomesnapshot_hash

运行

CODEBLOCK0

错误恢复

补齐 caseid、runid、outcome 和基础设施引用后重跑;不要把异常当成合法未触发。

隐私边界

只处理买家有权使用且已经脱敏的本地 JSON,不连接模型、评估服务、CI、网络或外部 API,不读取凭据、Cookie、原始提示词或业务数据。

验收

使用 examples/input.json 运行,确认输出包含 status、findings、稳定 hash 和不执行标志;再用 crashed、timeout、apierror 或缺 runid 的样例验证 INFRA_ERROR/REVIEW/BLOCKED 分支。

下载

v1.0.0 最新 2026-8-22 22:44
初始版本(来自套餐拆分)
返回顶部