闲社服务运行正常AI智能体自动化平台

Qwen3-4B-SafeRL

Qwen/Qwen3-4B-SafeRL

发布机构Qwen

下载访问条件魔搭来源

Qwen3-4B-SafeRL 是 Qwen3-4B 模型的安全对齐版本。该模型采用强化学习进行训练,利用 Qwen3Guard-Gen 提供的奖励信号来增强其对有害或对抗性提示的鲁棒性。这一过程旨在确保强大的安全保证,同时避免导致过度简单化或回避的拒绝行为,从而保持良好的用户体验。 该模型通过混合奖励函数进行训练,联合优化三个关键目标: 安全最大化:对生成不安全内容的行为进行惩罚,由 Qwen3Guard-Gen-4B 检测。

文字对话
模型详情

模型介绍

中文整理

Qwen3-4B-SafeRL 模型卡片

模型概述

Qwen3-4B-SafeRL 是 Qwen3-4B 模型的安全对齐版本。该模型采用强化学习进行训练,利用 Qwen3Guard-Gen 提供的奖励信号来增强其对有害或对抗性提示的鲁棒性。这一过程旨在确保强大的安全保证,同时避免导致过度简单化或回避的拒绝行为,从而保持良好的用户体验。

主要能力

该模型通过混合奖励函数进行训练,联合优化三个关键目标:

安全最大化:对生成不安全内容的行为进行惩罚,由 Qwen3Guard-Gen-4B 检测。

帮助性最大化:奖励真正有用的回答,由 WorldPM-Helpsteer2 模型评估。

拒绝最小化:对不必要的拒绝行为施加适度惩罚,同样由 Qwen3Guard-Gen-4B 识别。

性能表现| 模式 | 模型 | 安全率(Qwen3-235B) | 安全率(WildGuard) | 拒绝率(WildGuard) | ArenaHard-v2(相对GPT-4.1胜率) | AIME25(Pass@1) | LCB-v6(Pass@1) | GPQA(Pass@1) |

|------|------|---------------------|---------------------|---------------------|--------------------------------|------------------|------------------|----------------|

| 非思考模式 | Qwen3-4B | 47.5 | 64.7 | 12.9 | 9.5 | 19.1 | 26.4 | 41.7 |

| 非思考模式 | Qwen3-4B-SafeRL | 86.5 | 98.1 | 5.3 | 10.7 | 18.2 | 27.7 | 40.8 |

| 思考模式 | Qwen3-4B | 43.8 | 59.0 | 6.5 | 13.7 | 65.6 | 48.4 | 55.9 |

| 思考模式 | Qwen3-4B-SafeRL | 83.4 | 97.4 | 6.2 | 16.6 | 63.5 | 47.5 | 51.2 |

输入输出

输入:文本提示(支持混合思考模式)

输出:文本回复

运行要求

建议使用最新版本的 Hugging Face transformers。支持的框架包括:transformers 0.4.6.post1 或更高版本、vllm 0.8.5 或更高版本。也支持通过 SGLang 或 vLLM 创建 OpenAI 兼容的 API 端点。本地应用方面,Ollama、LMStudio、MLX-LM、llama.cpp 和 KTransformers 也已支持 Qwen3。

基本用法

Qwen3-4B-SafeRL 的使用方式与 Qwen3-4B 相同,保留了混合思考模式的能力。

限制

该模型在安全性和帮助性之间寻求平衡,通过混合奖励机制避免过度拒绝。虽然安全率显著提升,但部分基准测试分数略有下降。

许可证

如需引用本工作,请参考相关论文。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部