整理技能测试夹具,核对可观察行为并比较基线回归,在新失败出现时生成不自动推广的人工门禁。
以下摘录自发布者现有说明,不代表平台已完成运行验证。完整交付范围、限制与验收要求请继续阅读原文。
三个独立技能目录,每个包含元数据、技能说明、执行器、文档和脱敏样例。 三步可重复运行:用例整理、行为断言、基线回归门禁;每个技能也能单独使用。 缺字段、重复用例、空预期、缺失观测、断言失败、状态变化和新回归均有明确分支。 正向样例通过,负向样例保留人工边界;基线 PASS 到当前 FAIL 时门禁输出 BLOCKED、PENDING 且 promote=false。
脱敏的技能测试用例、触发提示、夹具引用和可观察 expect 一次或多次运行后的脱敏 observations,不包含原始客户内容、密钥或真实工具参数 认可的失败、人工复核、文件变化和动作边界规则 可作为比较起点的基线断言报告及回归门禁策略
使用 Python 3.10 或更高版本,把测试用例、观察结果和基线写成 UTF-8 JSON。 依次运行用例整理、行为断言和回归门禁,也可以单独运行任一步。 在真实模型或 CI 环境中自行生成脱敏 observations,再由负责人查看回归列表和人工放行状态;本套餐不替你调用模型或推广版本。
脚本只处理买家有权使用且已经脱敏的本地 JSON,不连接模型、CI、仓库或业务系统,不读取 token、不执行工具调用、不自动修改技能或推广版本。离线断言不能代表完整模型评测、跨模型稳定性、提示注入测试或生产可用性。套餐不包含模型额度、CI 配置、云端运行、人工标注、持续监控、代码审查或结果保证。
以下为套餐组成,实际执行顺序请按上方工作流说明。安装所需环境、账号与外部服务费用请在购买前确认。
按可观察输出、文件变化和动作标志核对技能行为,不把缺失观测当成通过 输入为脱敏的技能测试夹具、观察结果或回归基线,输出结构化核验结果。
比较技能行为基线与当前结果,识别新失败并输出不自动推广的人工门禁 输入为脱敏的技能测试夹具、观察结果或回归基线,输出结构化核验结果。
把技能触发场景、脱敏夹具、可观察预期和负向用例整理成稳定测试合同 输入为脱敏的技能测试夹具、观察结果或回归基线,输出结构化核验结果。