模型介绍
中文整理# Qwen3Guard-Gen-4B 模型卡片
模型用途
Qwen3Guard-Gen-4B 是基于 Qwen3 构建的安全审核模型系列之一,专门用于内容安全分类和审核。该系列包含三个参数规模的模型(0.6B、4B、8B),其中 Qwen3Guard-Gen 是生成式模型,将安全分类任务框架化为指令跟随任务。
## 主要能力
- *三级严重性分类**:将输出内容分类为安全、争议和不安全三个严重性等级,支持根据不同部署场景进行调整。
- *多语言支持**:支持119种语言和方言,在全球化和跨语言应用场景中保持稳健性能。
- *高性能表现**:在各类安全基准测试中达到领先水平,在英语、中文和多语言任务的提示和响应分类方面均表现优异。
## 输入输出
- *输入**:用户提示(User Prompt)或模型响应(Model Response)
- *输出**:安全分类结果,包括严重性等级(安全/争议/不安全)和具体安全类别标签
运行要求
- *依赖库**:需要 transformers>=4.51.0
- *部署环境**:支持使用 sglang>=0.4.6.post1 或 vllm>=0.9.0 部署为 OpenAI 兼容的 API 端点
基本用法
该模型可用于两种主要场景:
- 审核用户输入的提示
- 审核模型生成的响应
通过 SGLang 或 vLLM 部署后,可通过 OpenAI 兼容接口调用进行安全审核。
## 安全策略
- *不安全**:在大多数场景下被普遍认为有害的内容
- *争议**:危害性可能因上下文而异,或在不同应用中存在分歧的内容
- *安全**:在大多数场景下被普遍认为安全的内容
- *安全类别**:
- 暴力内容:提供暴力行为详细指导、方法或建议的内容,包括武器制造、获取或使用
- 非暴力违法行为:提供黑客攻击、未经授权的药物制造或盗窃等非暴力违法活动指导或建议
- 性内容:提供任何性 imagery、引用或描述的内容,包括描述非法或不道德性行为的内容
- 个人身份信息:未经授权分享或披露敏感个人身份信息,如姓名、身份证号、地址、电话号码、医疗记录、财务详情和账户密码等
- 自杀与自残:宣扬、直接鼓励或详细描述自残、自杀或可能导致严重伤害或死亡的危险活动
- 不道德行为:包括偏见、歧视、刻板印象、不公、仇恨言论、攻击性语言、骚扰、侮辱、威胁、诽谤、极端主义、道德错误信息等不合法但被认为不道德的行为
- 政治敏感话题:故意创建或传播关于政府行为、历史事件或公众人物的虚假信息
- 版权侵权:未经版权持有人明确许可,提供受法律保护的创意作品(如小说、剧本、歌词等)的未经授权复制、分销、公开展示或衍生使用
- 越狱(仅适用于输入):明确试图覆盖模型系统提示或模型条件的内容
许可证
原始资料中未提供具体的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
