闲社

标题: 【工作流】AI提示词回归测试工作流 [打印本页]

作者: admin    时间: 1 小时前
标题: 【工作流】AI提示词回归测试工作流
[md]
# AI提示词回归测试工作流

## 套餐描述

把脱敏测试集、输出断言、对抗风险和版本基线连接成可阻断回归的人工发布门禁。

## 详细介绍

# AI提示词回归测试工作流

**4个可下载技能 · 4步自动化工作流 · 每个技能可单独运行**

提示词、模型、工具说明和业务规则一变,原本通过的回答可能出现漏字段、错误路由、敏感信息外泄或拒答边界退化。本套餐把脱敏测试输入和期望行为冻结成版本化合同,再对新输出执行确定性断言,单独审计提示注入与敏感输出风险,最后比较用例基线并生成阻断或人工发布复核队列。4个技能均为离线Python脚本,不调用模型、不接生产流量、不自动部署、不自动批准;确定性断言和静态标记只提供可复核证据,不能替代人工质量评审、真实业务验收或安全测试。

## 4步自动化工作流

### 1 规范提示词回归用例

**对应技能:** `prompt-regression-case-normalizer`

**解决什么:** 统一脱敏输入、期望行为、预期路由、必需输出标记、禁止标记和风险标签,拦截重复用例、缺失期望路由和疑似个人信息。

**你会得到:** READY/BLOCKED、case_count、suite_hash、每条case_hash和可供后续步骤使用的规范化测试合同。

**流转到下一步:** 只有READY合同进入输出评分;提示词、模型或业务规则变化应保留旧suite_hash并生成新版本。

### 2 评分提示词输出回归

**对应技能:** `prompt-output-regression-scorer`

**解决什么:** 按每条用例的必需标记、禁止标记和预期路由比较买家提供的新输出,区分PASS与FAIL并保留缺失原因。

**你会得到:** 逐用例expected_route、PASS/FAIL、missing_markers、prohibited_markers、output_length和汇总计数。

**流转到下一步:** 确定性失败和完整输出一起进入对抗风险审计;失败不会被平均分数掩盖,也不会自动重写回答。

### 3 审计提示词对抗风险

**对应技能:** `prompt-adversarial-risk-auditor`

**解决什么:** 对提示注入、越权、数据外传和账户风险用例检查敏感输出、攻击语言回显和缺少拒答标记。

**你会得到:** CRITICAL/HIGH/MEDIUM/LOW findings、case_id、规则、严重度计数和人工控制建议。

**流转到下一步:** 风险发现与输出评分、suite_hash和批准基线一起进入发布闸门;该步骤不生成攻击、不调用目标模型。

### 4 生成提示词回归发布队列

**对应技能:** `prompt-regression-release-gate`

**解决什么:** 比较当前case_hash与批准基线,汇总用例漂移、确定性回归和对抗风险,为每条用例标记阻断或人工发布复核。

**你会得到:** release_state、release_queue、BLOCK_RELEASE或READY_FOR_HUMAN_RELEASE_REVIEW计数,以及HOLD_FOR_HUMAN_PROMPT_RELEASE_APPROVAL。

**最终交付:** 一份可接入CI、n8n、工单或变更审批系统的提示词发布证据队列;最终是否上线、是否回滚、是否增加用例和是否接入真实模型仍由质量负责人、安全人员和业务负责人决定。

## 实际示例

随包样例使用3条虚构用例和3段脱敏输出,不含真实客户内容、密钥、账号或生产提示词。第一步生成3条READY用例与稳定哈希;第二步得到2个PASS和1个FAIL,失败用例缺少“cannot share”且命中“system prompt”;第三步为该用例识别1个CRITICAL敏感输出和1个HIGH拒答缺口;第四步将该用例置为BLOCK_RELEASE,另外2条进入READY_FOR_HUMAN_RELEASE_REVIEW,最终状态为BLOCK。该结果只验证合同、断言、风险和路由,不代表真实模型质量、攻击成功或安全结论。

## 适合谁

- 正在迭代客服、销售、知识库、代码助手或内部Agent提示词的产品与工程团队
- 需要把提示词和模型变更纳入CI、灰度或人工发布审批的AI应用团队
- 使用Promptfoo、RAG评测、n8n、Dify、Coze或自建评测系统,但缺少统一回归合同和发布门禁的实施人员
- 需要保留用例版本、失败证据、对抗风险和人工决定的质量与安全负责人

## 买家只需提供

- 脱敏的输入、期望行为、预期路由、必需标记、禁止标记和风险标签
- 当前版本输出与上一版批准的case_hash基线
- 质量负责人、发布复核角色、组织允许的失败阈值和人工验收规则

## 使用方式

1. 使用Python 3.10或更高版本,按4个README准备UTF-8 JSON;全部脚本无第三方依赖。
2. 依次运行用例规范、输出评分、对抗风险审计和发布闸门,也可将任一步映射到CI或变更系统。
3. 先用随包3用例验收2个PASS、1个FAIL、1个CRITICAL、1个HIGH和阻断队列,再使用有权处理的脱敏测试输出。

## 交付与验收

- 交付4个独立技能目录,每个包含_meta.json、SKILL.md、agents/openai.yaml、README、Python执行器和脱敏输入输出样例。
- 4个脚本均可离线重复运行,相同输入产生稳定JSON;技能数与工作流步数精确为4。
- 验收3条用例、2个PASS、1个FAIL、1个CRITICAL、1个HIGH、1条BLOCK_RELEASE、2条人工复核队列和HOLD_FOR_HUMAN_PROMPT_RELEASE_APPROVAL。
- 用例重复、个人信息、期望路由缺失、输出断言失败、敏感输出、拒答缺口、基线漂移或上游BLOCKED都会形成blocker、finding或阻断原因。
- 不包含真实模型调用、API Key、生产流量、提示词部署、CI修改、红队攻击服务、人工质量评审、持续监控或安全认证。

## 服务说明

本套餐只处理买家有权使用且已脱敏的测试合同与输出,不接收密码、Cookie、Token、API Key、真实客户消息或内部机密。确定性标记不能理解全部语义,静态对抗规则可能误报或漏报;LLM评审、线上指标和人工抽样应由买家另行设计。任何PASS仅表示当前断言通过,任何BLOCK表示应停止并复核,不能保证事实正确、零幻觉、绝对安全、绝对合规或固定节省时间。买家必须自行确认测试数据授权、模型服务条款、日志保留、回滚策略和高风险场景的人工审批。

## 套餐图标



## 包含技能

- [prompt-adversarial-risk-auditor](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-adversarial-risk-auditor)
- [prompt-output-regression-scorer](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-output-regression-scorer)
- [prompt-regression-case-normalizer](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-regression-case-normalizer)
- [prompt-regression-release-gate](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=detail&slug=prompt-regression-release-gate)

## 安装方式

此套餐为**付费套餐**,购买后可一键下载全部技能。

🛒 [点击购买并下载 AI提示词回归测试工作流](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=buy&bundle_id=430)

## 收费方式

💴 **现金购买** - 需要支付 ¥117.00

## 前往安装

**[👉 点击前往套餐安装页面](https://www.xianshe.com/plugin.php?id=hl_skillhub&mod=bundle&ac=detail&slug=prompt-regression-case-normalizer-8ba066f24edd)**
[/md]




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0