模型介绍
中文整理Shieldstral 1.0 3B
用途
Shieldstral 是一个紧凑的30 亿参数策略自适应多模态安全分类器。它不预测固定的审核类别,而是根据自然语言表达的安全策略对内容进行评估,并返回单个连续的安全评分。这使其成为文本、图像以及文本加图像审核的灵活即插即用护栏,可在推理时重新适配到新策略,无需重新训练。
模型基于 Ministral-3-3B-Base-2512 构建,配备原生 Pixtral 视觉编码器,通过单次前向传播得出判断。
主要能力
策略自适应:审核标准以自由形式自然语言查询在推理时提供,单个检查点即可处理新安全策略,无需重新训练。
多模态:统一接口支持文本、图像以及文本加图像的内容审核。
单令牌输出:分类通过单次是/否前向传播完成,产生连续置信度,可通过阈值设定进行二元决策。
紧凑:30 亿参数检查点,可在单 GPU 上运行。
多语言:支持英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语、阿拉伯语和俄语。
上下文窗口:训练时使用最长 32k 令牌的序列。虽然理论上支持 256k 上下文窗口,但建议将上下文保持在训练范围内。
输入输出
Shieldstral 将内容审核简化为二元问答任务。每次输入包含系统消息和用户消息:
系统消息(固定):提供高级任务框架(评估上下文和严格程度),通常在任务或产品层面保持一致。
用户消息(自适应):包含具体的是/否问题(如"此内容是否宣扬暴力?")以及待评估的内容——可以是提示词、回复、格式化的提示词-回复对或图像。
模型输出单个是/否令牌,可通过获取该令牌的 logprobs 并归一化是/否概率,得到连续的安全评分。
运行要求
模型可在单块 GPU 上运行,BF16 精度下需约 16GB 显存。
基本用法
每个查询对应一条策略:Shieldstral 每次调用回答一个是/否问题。如需多条策略,请逐条查询。
系统消息用于设置评估上下文、容忍度(严格/中等/宽松)以及可选的特定关注类别。
策略需表述为是/否问题,而非声明、关键词或抽象标签。
如需跨多条策略做出整体安全/不安全判断,可在系统消息中列出类别,并询问"此内容是否不安全?"等宽泛问题。
提示词-回复文档需格式清晰一致。
限制
覆盖不均:可靠性因语言和领域而异,取决于训练数据的代表性。
残留标签噪声:尽管进行了多模型验证和一致性过滤,合成数据和公开安全数据仍存在一定偏差和噪声。
对抗性/混淆输入(编码或音译文本)以及超长文档可能降低可靠性。
许可证
本模型采用 Apache 2.0 许可证授权,开放权重,可用于商业和非商业用途。不得以侵犯、侵犯或以其他方式违反任何第三方权利(包括知识产权)的方式使用本模型。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
