把脱敏生产轨迹转成评估用例,检查行为、权限、重试、成本与可观测性,并生成上线前人工复核包。
以下摘录自发布者现有说明,不代表平台已完成运行验证。完整交付范围、限制与验收要求请继续阅读原文。
交付 4 个独立技能目录,每个包含 _meta.json、SKILL.md、agents/openai.yaml、README、Python 执行器和脱敏样例;根目录另含清单。 4 个脚本可离线重复运行,相同输入产生稳定 JSON;技能数与工作流步数精确为 4,顶层目录 slug 唯一且为小写短横线。 正常输入产生非空 case_set_hash 和 packet_hash;缺约束、缺证据、超权限、重试过多、延迟过高、成本超阈值和追踪缺失都会形成明确结果。 最终门禁保留人工复核、影子模式和变更审批,不会把静态 PASS 解释成上线成功。 不包含平台账号、API Key、OAuth 授权、模型调用、真实生产数据接入、日志采集、权限修改、自动部署、自动回滚、CI 写入或人工实施服务。
已授权且脱敏的生产轨迹、用户反馈和候选输出 业务约束、证据要求、允许的工具权限和运行阈值 人工审批负责人、影子模式规则和回滚引用
使用 Python 3.10 或更高版本,先删除真实用户内容、私有载荷、密钥、Cookie、内部域名和绝对路径。 依次运行用例归一化、行为评估、风险审计和生产门禁,将 JSON 结果作为测试或发布工单附件。 先用正常、缺证据、超权限、重复重试和缺追踪样例验收,再在影子模式或测试环境验证真实运行。
本套餐只处理买家有权使用且已脱敏的用例、输出和运行摘要,不接收密码、Cookie、Token、API Key、真实客户内容或内部机密。静态规则可能漏报或误报,阈值需要由业务负责人定义;通过不等于模型质量、平台稳定性、合规性或生产收益。买家必须自行验证数据留存、第三方调用、人工审批、影子模式、灰度、回滚和版本兼容,不承诺零错误、绝对合规、固定节省比例或经营结果。
以下为套餐组成,实际执行顺序请按上方工作流说明。安装所需环境、账号与外部服务费用请在购买前确认。
Score redacted agent outputs against constraints and evidence rubrics.
Turn redacted production traces into repeatable agent evaluation cases.
Combine production eval evidence into a conservative human release decision.
Scan redacted agent traces for authority, retry, latency, cost, and observability risks.