区分技能评估中的合法断言与崩溃、超时、API错误,阻止基础设施异常制造假通过。
以下摘录自发布者现有说明,不代表平台已完成运行验证。完整交付范围、限制与验收要求请继续阅读原文。
三个独立技能目录,每个包含元数据、技能说明、标准库执行器、文档和脱敏样例。 三步可重复运行:结果归一、失败分类、人工评估门禁;每个技能也能单独使用。 缺 run_id、outcome、错误证据,或发现 crash/timeout/api_error 时,输出明确 REVIEW/BLOCKED 分支,并避免把异常计入合法断言得分。 正常样例输出 READY_FOR_HUMAN_EVAL_FAILURE_REVIEW,并保留 PENDING、optimizer_execute=false、rerun_execute=false 和 external_action_executed=false;错误样例不会触发评估或优化动作。
脱敏的 suite_ref、case_id、query、should_trigger 和 outcome 每条用例的 run_id,以及错误、超时、API 或 stderr 引用 基线引用、重跑引用和人工负责人引用 不提供 API key、Cookie、原始提示词、模型响应、客户数据或业务载荷
使用 Python 3.10 或更高版本,把评估运行摘要写成 UTF-8 JSON;错误引用只写脱敏编号。 依次运行结果归一、失败分类和人工门禁,也可以单独运行任一步。 由负责人修复评估基础设施、决定是否重跑或更新基线;套餐不会调用模型、修改描述或启动优化器。
脚本只处理买家有权使用且已经脱敏的本地 JSON,不连接模型、评估器、CI、网络或数据库,不读取凭据,不运行测试,不修改技能描述,不改变基线。静态分类不能证明评估器实现正确、模型输出真实或技能应当发布;分类依赖买家提供的 outcome、run_id 和错误证据。套餐不包含模型调用、评估框架接入、CI 配置、描述优化、生产部署或持续监控。
以下为套餐组成,实际执行顺序请按上方工作流说明。安装所需环境、账号与外部服务费用请在购买前确认。
识别错误、超时和崩溃并把它们排除出通过率与描述优化器输入 输入为脱敏的本地技能评估运行摘要,输出结构化核验结果。
汇总基础设施失败分类并生成不自动优化或重跑的人工复核包 输入为脱敏的本地技能评估运行摘要,输出结构化核验结果。
固定每条评估用例的期望、观察结果、运行身份和基础设施状态 输入为脱敏的本地技能评估运行摘要,输出结构化核验结果。