闲社服务运行正常AI智能体自动化平台

IndustryCorpus2_DataRater

BAAI/IndustryCorpus2_DataRater

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

本模型为数据集BAAI/IndustryCorpus2的质量评估模型,用于从语义一致性,信息密度,教育属性等维度评估预训练数据的质量。 按照我们的定义并经过实验,3分以上是相对高质量数据,4分以上绝对高质量数据,可以根据数据量按需所取。 下面是从数据中抽取的低质量数据,可以看到这种数据对模型的学习是有害无益的

其他模型
模型详情

模型介绍

中文整理

本模型为数据集BAAI/IndustryCorpus2的质量评估模型,用于从语义一致性,信息密度,教育属性等维度评估预训练数据的质量。

按照我们的定义并经过实验,3分以上是相对高质量数据,4分以上绝对高质量数据,可以根据数据量按需所取。

为什么要筛选低质量的数据

下面是从数据中抽取的低质量数据,可以看到这种数据对模型的学习是有害无益的

数据构建

数据来源:随机采样预训练语料

标签构建:设计数据打分细则,借助LLM模型进行多轮打分,筛选多轮打分分差小于2的数据

数据规模:20k打分数据,中英文比例1:1

  • *数据prompt**

模型训练

模型选型:与分类模型类似,我们同样使用的是0.5b规模的模型,并对比试验了beg-m3和qwen-0.5b,最终实验显示bge-m3综合表现最优

模型超参:基座bge-m3,全参数训练,lr=1e-5,batch size=64, max length = 2048

模型评估:在验证集上模型与GPT4对样本质量判定一致率为90%

高质量数据带来的训练收益

我们为了验证高质量的数据是否能带来更高效的训练效率,在同一基座模型下,使用从未筛选之前的50b数据中抽取出高质量数据,可以认为两个数据的分布大体是一致的,进行自回归训练.

曲线中可以看到,经过高质量数据训练的模型14B的tokens可以达到普通数据50B的模型表现,高质量的数据可以极大的提升训练效率。

此外,高质量的数据可以作为预训练的退火阶段的数据加入到模型中,进一步拉升模型效果,为了验证这个猜测,我们在训练行业模型时候,在模型的退火阶段加入了筛选之后高质量数据和部分指令数据转成的预训练数据,可以看到极大提高了模型的表现。

最后,高质量的预训练语料中包含着丰富的高价值知识性内容,可以从中提取出指令数据进一步提升指令数据的丰富度和知识性,这也催发了IndustryInstruction项目的诞生,我们会在那里进行详细的说明。

how to use

Citation

If you use **IndustryCorpus2 DataRater** in your research, please cite the model:

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部