模型介绍
中文整理# HARC: 耦合有害性与拒绝方向的安全对齐模型
## 模型描述
HARC是一种安全对齐方法,在提示侧和响应侧的token位置耦合模型内部的有害性和拒绝方向。该方法使用残差流余弦投影的加性边际hinge损失进行干预,将调整限制在选定的少数层内的低维有害性-拒绝子空间中。这种设计提高了对越狱攻击的鲁棒性,同时保留了模型的通用能力,并避免了更广泛安全调优中常见的过度拒绝问题。
该仓库包含HARC LoRA适配器。适配器应用于注意力层和MLP投影,使用复合目标进行训练:(i)边际hinge耦合损失;(ii)KL散度保持项,将良性输出锚定到基础模型;(iii)监督有害提示上拒绝文本的交叉熵项。训练方向通过对比提示集的均值差提取,并使用EMA混合定期重新计算。适配器仅增加约1%的可训练参数,不改变基础架构。
## 骨干模型
Llama-3.1-8B-Instruct、Qwen-2.5-7B-Instruct
## 集合信息
HARC Collection
许可证
该仓库中的LoRA适配器采用MIT许可证发布。合并的完整模型分布在独立仓库中,使用基础模型的许可证:Llama变体采用Meta Llama 3.1 Community License,Qwen变体采用Apache-2.0。
运行要求
使用预合并完整模型无需下载基础模型或PEFT库。使用基础模型加LoRA适配器需要torch >= 2.1、transformers和peft库。推理硬件需求与基础模型相当,7-8B模型在bf16/fp16精度下可在一块24GB显存的GPU上运行。
基本用法
使用基础模型的标准聊天模板。有两种使用方式:
方式A:预合并完整模型(最简便)——直接从合并模型仓库加载。
方式B:基础模型加LoRA适配器——加载基础模型,然后从本仓库附加匹配的适配器子文件夹。
## 主要能力
提高对越狱攻击的鲁棒性;保留模型的通用能力;避免过度拒绝问题。
## 输入输出
输入:用户提示(使用基础模型的标准聊天模板)
输出:经过安全对齐的模型响应
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
