模型介绍
中文整理Qwen3-4B-SafeRL 模型卡片
模型概述
Qwen3-4B-SafeRL 是 Qwen3-4B 模型的安全对齐版本。该模型采用强化学习进行训练,利用 Qwen3Guard-Gen 提供的奖励信号来增强其对有害或对抗性提示的鲁棒性。这一过程旨在确保强大的安全保证,同时避免导致过度简单化或回避的拒绝行为,从而保持良好的用户体验。
主要能力
该模型通过混合奖励函数进行训练,联合优化三个关键目标:
安全最大化:对生成不安全内容的行为进行惩罚,由 Qwen3Guard-Gen-4B 检测。
帮助性最大化:奖励真正有用的回答,由 WorldPM-Helpsteer2 模型评估。
拒绝最小化:对不必要的拒绝行为施加适度惩罚,同样由 Qwen3Guard-Gen-4B 识别。
性能表现| 模式 | 模型 | 安全率(Qwen3-235B) | 安全率(WildGuard) | 拒绝率(WildGuard) | ArenaHard-v2(相对GPT-4.1胜率) | AIME25(Pass@1) | LCB-v6(Pass@1) | GPQA(Pass@1) |
|------|------|---------------------|---------------------|---------------------|--------------------------------|------------------|------------------|----------------|
| 非思考模式 | Qwen3-4B | 47.5 | 64.7 | 12.9 | 9.5 | 19.1 | 26.4 | 41.7 |
| 非思考模式 | Qwen3-4B-SafeRL | 86.5 | 98.1 | 5.3 | 10.7 | 18.2 | 27.7 | 40.8 |
| 思考模式 | Qwen3-4B | 43.8 | 59.0 | 6.5 | 13.7 | 65.6 | 48.4 | 55.9 |
| 思考模式 | Qwen3-4B-SafeRL | 83.4 | 97.4 | 6.2 | 16.6 | 63.5 | 47.5 | 51.2 |
输入输出
输入:文本提示(支持混合思考模式)
输出:文本回复
运行要求
建议使用最新版本的 Hugging Face transformers。支持的框架包括:transformers 0.4.6.post1 或更高版本、vllm 0.8.5 或更高版本。也支持通过 SGLang 或 vLLM 创建 OpenAI 兼容的 API 端点。本地应用方面,Ollama、LMStudio、MLX-LM、llama.cpp 和 KTransformers 也已支持 Qwen3。
基本用法
Qwen3-4B-SafeRL 的使用方式与 Qwen3-4B 相同,保留了混合思考模式的能力。
限制
该模型在安全性和帮助性之间寻求平衡,通过混合奖励机制避免过度拒绝。虽然安全率显著提升,但部分基准测试分数略有下降。
许可证
如需引用本工作,请参考相关论文。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
