|
# AI提示词回归测试工作流
## 套餐描述
把脱敏测试集、输出断言、对抗风险和版本基线连接成可阻断回归的人工发布门禁。
## 详细介绍
# AI提示词回归测试工作流
**4个可下载技能 · 4步自动化工作流 · 每个技能可单独运行**
提示词、模型、工具说明和业务规则一变,原本通过的回答可能出现漏字段、错误路由、敏感信息外泄或拒答边界退化。本套餐把脱敏测试输入和期望行为冻结成版本化合同,再对新输出执行确定性断言,单独审计提示注入与敏感输出风险,最后比较用例基线并生成阻断或人工发布复核队列。4个技能均为离线Python脚本,不调用模型、不接生产流量、不自动部署、不自动批准;确定性断言和静态标记只提供可复核证据,不能替代人工质量评审、真实业务验收或安全测试。
## 4步自动化工作流
### 1 规范提示词回归用例
**对应技能:** `prompt-regression-case-normalizer`
**解决什么:** 统一脱敏输入、期望行为、预期路由、必需输出标记、禁止标记和风险标签,拦截重复用例、缺失期望路由和疑似个人信息。
**你会得到:** READY/BLOCKED、case_count、suite_hash、每条case_hash和可供后续步骤使用的规范化测试合同。
**流转到下一步:** 只有READY合同进入输出评分;提示词、模型或业务规则变化应保留旧suite_hash并生成新版本。
### 2 评分提示词输出回归
**对应技能:** `prompt-output-regression-scorer`
**解决什么:** 按每条用例的必需标记、禁止标记和预期路由比较买家提供的新输出,区分PASS与FAIL并保留缺失原因。
**你会得到:** 逐用例expected_route、PASS/FAIL、missing_markers、prohibited_markers、output_length和汇总计数。
**流转到下一步:** 确定性失败和完整输出一起进入对抗风险审计;失败不会被平均分数掩盖,也不会自动重写回答。
### 3 审计提示词对抗风险
**对应技能:** `prompt-adversarial-risk-auditor`
**解决什么:** 对提示注入、越权、数据外传和账户风险用例检查敏感输出、攻击语言回显和缺少拒答标记。
**你会得到:** CRITICAL/HIGH/MEDIUM/LOW findings、case_id、规则、严重度计数和人工控制建议。
**流转到下一步:** 风险发现与输出评分、suite_hash和批准基线一起进入发布闸门;该步骤不生成攻击、不调用目标模型。
### 4 生成提示词回归发布队列
**对应技能:** `prompt-regression-release-gate`
**解决什么:** 比较当前case_hash与批准基线,汇总用例漂移、确定性回归和对抗风险,为每条用例标记阻断或人工发布复核。
**你会得到:** release_state、release_queue、BLOCK_RELEASE或READY_FOR_HUMAN_RELEASE_REVIEW计数,以及HOLD_FOR_HUMAN_PROMPT_RELEASE_APPROVAL。
**最终交付:** 一份可接入CI、n8n、工单或变更审批系统的提示词发布证据队列;最终是否上线、是否回滚、是否增加用例和是否接入真实模型仍由质量负责人、安全人员和业务负责人决定。
## 实际示例
随包样例使用3条虚构用例和3段脱敏输出,不含真实客户内容、密钥、账号或生产提示词。第一步生成3条READY用例与稳定哈希;第二步得到2个PASS和1个FAIL,失败用例缺少“cannot share”且命中“system prompt”;第三步为该用例识别1个CRITICAL敏感输出和1个HIGH拒答缺口;第四步将该用例置为BLOCK_RELEASE,另外2条进入READY_FOR_HUMAN_RELEASE_REVIEW,最终状态为BLOCK。该结果只验证合同、断言、风险和路由,不代表真实模型质量、攻击成功或安全结论。
## 适合谁
- 正在迭代客服、销售、知识库、代码助手或内部Agent提示词的产品与工程团队
- 需要把提示词和模型变更纳入CI、灰度或人工发布审批的AI应用团队
- 使用Promptfoo、RAG评测、n8n、Dify、Coze或自建评测系统,但缺少统一回归合同和发布门禁的实施人员
- 需要保留用例版本、失败证据、对抗风险和人工决定的质量与安全负责人
## 买家只需提供
- 脱敏的输入、期望行为、预期路由、必需标记、禁止标记和风险标签
- 当前版本输出与上一版批准的case_hash基线
- 质量负责人、发布复核角色、组织允许的失败阈值和人工验收规则
## 使用方式
1. 使用Python 3.10或更高版本,按4个README准备UTF-8 JSON;全部脚本无第三方依赖。
2. 依次运行用例规范、输出评分、对抗风险审计和发布闸门,也可将任一步映射到CI或变更系统。
3. 先用随包3用例验收2个PASS、1个FAIL、1个CRITICAL、1个HIGH和阻断队列,再使用有权处理的脱敏测试输出。
## 交付与验收
- 交付4个独立技能目录,每个包含_meta.json、SKILL.md、agents/openai.yaml、README、Python执行器和脱敏输入输出样例。
- 4个脚本均可离线重复运行,相同输入产生稳定JSON;技能数与工作流步数精确为4。
- 验收3条用例、2个PASS、1个FAIL、1个CRITICAL、1个HIGH、1条BLOCK_RELEASE、2条人工复核队列和HOLD_FOR_HUMAN_PROMPT_RELEASE_APPROVAL。
- 用例重复、个人信息、期望路由缺失、输出断言失败、敏感输出、拒答缺口、基线漂移或上游BLOCKED都会形成blocker、finding或阻断原因。
- 不包含真实模型调用、API Key、生产流量、提示词部署、CI修改、红队攻击服务、人工质量评审、持续监控或安全认证。
## 服务说明
本套餐只处理买家有权使用且已脱敏的测试合同与输出,不接收密码、Cookie、Token、API Key、真实客户消息或内部机密。确定性标记不能理解全部语义,静态对抗规则可能误报或漏报;LLM评审、线上指标和人工抽样应由买家另行设计。任何PASS仅表示当前断言通过,任何BLOCK表示应停止并复核,不能保证事实正确、零幻觉、绝对安全、绝对合规或固定节省时间。买家必须自行确认测试数据授权、模型服务条款、日志保留、回滚策略和高风险场景的人工审批。
## 套餐图标
<img id="aimg_Y15F2" onclick="zoom(this, this.src, 0, 0, 0)" class="zoom" src="https://www.xianshe.com/data/attachment/hl_skillhub/images/bundle_icon_1_1787249861.png" onmouseover="img_onmouseoverfunc(this)" lazyloadthumb="1" border="0" alt="" />
## 包含技能
- [prompt-adversarial-risk-auditor](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-adversarial-risk-auditor)
- [prompt-output-regression-scorer](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-output-regression-scorer)
- [prompt-regression-case-normalizer](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-regression-case-normalizer)
- [prompt-regression-release-gate](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-regression-release-gate)
## 安装方式
此套餐为**付费套餐**,购买后可一键下载全部技能。
🛒 [点击购买并下载 AI提示词回归测试工作流](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=buy&bundle_id=430)
## 收费方式
💴 **现金购买** - 需要支付 ¥117.00
## 前往安装
**[👉 点击前往套餐安装页面](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=bundle&ac=detail&slug=prompt-regression-case-normalizer-8ba066f24edd)**
|