闲社服务运行正常AI智能体自动化平台
智能体技能评估失败分类核验工作流

智能体技能评估失败分类核验工作流

区分技能评估中的合法断言与崩溃、超时、API错误,阻止基础设施异常制造假通过。

AI智能体与自动化
立即购买
技能数量
3
19,501
下载量
¥187.00
参考价 · 登录确认
15,034
销量

购买前,先确认这些

我的已购工作流

以下摘录自发布者现有说明,不代表平台已完成运行验证。完整交付范围、限制与验收要求请继续阅读原文。

交付内容

三个独立技能目录,每个包含元数据、技能说明、标准库执行器、文档和脱敏样例。 三步可重复运行:结果归一、失败分类、人工评估门禁;每个技能也能单独使用。 缺 run_id、outcome、错误证据,或发现 crash/timeout/api_error 时,输出明确 REVIEW/BLOCKED 分支,并避免把异常计入合法断言得分。 正常样例输出 READY_FOR_HUMAN_EVAL_FAILURE_REVIEW,并保留 PENDING、optimizer_execute=false、rerun_execute=false 和 external_action_executed=false;错误样例不会触发评估或优化动作。

需要准备

脱敏的 suite_ref、case_id、query、should_trigger 和 outcome 每条用例的 run_id,以及错误、超时、API 或 stderr 引用 基线引用、重跑引用和人工负责人引用 不提供 API key、Cookie、原始提示词、模型响应、客户数据或业务载荷

运行与安装说明

使用 Python 3.10 或更高版本,把评估运行摘要写成 UTF-8 JSON;错误引用只写脱敏编号。 依次运行结果归一、失败分类和人工门禁,也可以单独运行任一步。 由负责人修复评估基础设施、决定是否重跑或更新基线;套餐不会调用模型、修改描述或启动优化器。

费用、服务与边界

脚本只处理买家有权使用且已经脱敏的本地 JSON,不连接模型、评估器、CI、网络或数据库,不读取凭据,不运行测试,不修改技能描述,不改变基线。静态分类不能证明评估器实现正确、模型输出真实或技能应当发布;分类依赖买家提供的 outcome、run_id 和错误证据。套餐不包含模型调用、评估框架接入、CI 配置、描述优化、生产部署或持续监控。

安装准备与故障排查确认材料、运行环境与额外费用后再购买。阅读完整说明

工作流详情

返回顶部