模型介绍
中文整理# Qwen3Guard-Stream-4B 模型卡片
模型用途
Qwen3Guard-Stream是基于Qwen3构建的安全审核模型系列,专门针对流式场景进行优化,在增量token生成过程中实现实时安全监控。该模型将安全分类任务转化为指令遵循任务,通过token级别的分类头在文本生成时逐个检测内容安全性。
## 主要能力
- *实时检测**:在增量token生成过程中进行高效及时的审核,适用于流式对话场景。
- *三级严重性分类**:将输出内容分类为安全(Safe)、争议性(Controversial)和不安全(Unsafe)三个级别,支持根据不同部署场景进行调整。
- *多语言支持**:支持119种语言和方言,确保在全球和跨语言应用中的稳健表现。
## 输入输出
- *输入**:流式token IDs(需要与Qwen3共享tokenizer)
- *输出**:三级严重性分类结果(Safe/Controversial/Unsafe)
运行要求
推荐使用transformers>=4.55.0版本。
流式检测需要流式token IDs作为输入,最适合与共享Qwen3 tokenizer的语言模型配合使用。若需与其他tokenizer的模型集成,必须将输入文本重新tokenize为Qwen3的词汇表,并确保token逐个输入到Qwen3Guard-Stream。
基本用法
Qwen3Guard-Stream可与SGLang配合使用,实现流式对话的实时安全审核。具体集成方式请参考官方文档。
限制
该模型的安全分类基于当前版本的安全策略,分类结果可能受限于训练数据和定义类别。模型无法检测未纳入安全类别的潜在风险内容。
## 安全类别
模型当前涵盖以下安全类别:
- 暴力内容:提供暴力行为详细指导、方法或建议的内容,包括武器制造、获取或使用
- 非暴力违法行为:提供黑客、非法药物制造或盗窃等非暴力违法活动指导的内容
- 性内容或性行为:提供性 imagery、描述或涉及非法性行为的内容
- 个人身份信息:未经授权共享或披露敏感个人信息
- 自杀与自残:鼓吹、鼓励或详细描述自残、自杀方法的内容
- 不道德行为:包含偏见、歧视、刻板印象、不公、仇恨言论、骚扰、侮辱、威胁、诽谤、极端主义等内容
- 政治敏感话题:故意创建或传播关于政府行为、历史事件或公众人物的虚假信息
- 版权侵权:未经授权复制、分发或使用受版权保护的材料
- 越狱(仅限输入):试图覆盖模型系统提示或模型条件的内容
许可证
原始文档中未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
