模型介绍
中文整理Qwen3Guard-Gen-8B
模型用途
Qwen3Guard-Gen-8B 是基于 Qwen3 构建的安全审核模型系列之一,专门用于内容安全检测和分类。该系列包含三种参数规模的模型(0.6B、4B、8B),本模型为 8B 参数版本。Qwen3Guard-Gen 采用生成式方法,将安全分类任务转化为指令遵循任务来处理。
主要能力
三级严重程度分类:模型将输出内容分为安全、争议、不安全三个风险等级,支持根据不同部署场景进行灵活适配。
多语言支持:支持 119 种语言和方言,能够在全球化和跨语言应用场景中保持稳健的安全检测性能。
高性能表现:在多种安全基准测试中达到领先水平,在英语、中文及多语言任务的提示词和响应分类方面均表现出色。
输入输出
输入:用户提示词或模型生成的响应内容
输出:安全分类结果,包括严重程度等级(安全/争议/不安全)和具体安全类别标签
运行要求
推荐使用最新版本的 transformers,版本需满足 transformers>=4.51.0
基本用法
可通过 SGLang(>=0.4.6.post1)或 vLLM(>=0.9.0)部署为 OpenAI 兼容的 API 端点进行调用。
安全策略
Qwen3Guard 将潜在危害分为三个严重程度级别:
不安全:内容在大多数场景下被认为是有害的
争议:内容的危害性可能取决于上下文或在不同应用中存在分歧
安全:内容在大多数场景下被认为是安全的
安全类别
模型当前涵盖以下安全类别:
暴力内容:提供实施暴力行为的详细指导、方法或建议的内容,包括武器制造、获取或使用,也包括暴力描写
非暴力违法行为:提供黑客攻击、未经授权的毒品制造或盗窃等非暴力违法活动指导或建议的内容
色情内容:提供任何性 imagery、涉及个人的描述或引用,或描述非法或不道德性行为的内容,如强奸、兽奸、 incest、性奴役等
个人身份信息:未经授权分享或披露敏感个人身份信息的内容,包括姓名、身份证号、地址、电话号码、医疗记录、财务详情、账户密码等
自杀与自残:宣扬、直接鼓励或详细描述自残、自杀或可能导致严重伤害或死亡的危险活动的内容
不道德行为:任何不道德或违规内容,包括但不限于偏见、歧视、刻板印象、不公、仇恨言论、攻击性语言、骚扰、侮辱、威胁、诽谤、极端主义、伦理错误信息及其他虽不违法但仍被视为不道德的行为
政治敏感话题:故意创建或传播关于政府行为、历史事件或公众人物的虚假信息,且该信息明显不实,存在公众欺骗或社会危害风险
版权侵权:未经版权持有人明确许可,提供未经授权的复制、分销、公开展示或衍生使用受法律保护的内容,如小说、剧本、歌词等创意作品
越狱(仅适用于输入):明确试图覆盖模型系统提示或模型条件的内容
许可证
原文未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
