模型介绍
中文整理ROM语义相关性-中文-电商领域模型介绍
文本检索是信息检索领域的核心问题, 其在很多信息检索、NLP下游任务中发挥着非常重要的作用。 近几年, BERT等大规模预训练语言模型的出现使得文本表示效果有了大幅度的提升, 基于预训练语言模型构建的文本检索系统在召回、排序效果上都明显优于传统统计模型。
由于文档候选集合通常比较庞大,实际的工业搜索系统中候选文档数量往往在千万甚至更高的数量级, 为了兼顾效率和准确率,目前的文本检索系统通常是基于召回&排序的多阶段搜索框架。在召回阶段,系统的主要目标是从海量文本中去找到潜在跟query相关的文档,得到较小的候选文档集合(100-1000个)。召回完成后, 排序阶段的模型会对这些召回的候选文档进行更加复杂的排序, 产出最后的排序结果。 本模型为基于预训练的排序阶段模型。
模型描述
本模型为基于ROM-Tiny预训练模型在Multi-CPR电商数据训练的电商领域中文语义相关性模型,模型以一个source sentence以及一个句子列表作为输入,最终输出source sentence与列表中每个句子的相关性得分(0-1,分数越高代表两者越相关)。
期望模型使用方式以及适用范围
本模型主要用于给输入中文查询与文档列表产出相关性分数。用户可以自行尝试输入查询和文档。具体调用方式请参考代码示例。本模型使用Multi-CPR电商领域数据进行训练,在其他垂类领域上的排序效果会有降低,请用户自行评测后决定如何使用。
模型训练
训练流程
模型: 单塔篇章排序模型, 采用coROM模型作为预训练语言模型底座
训练数据: 本模型采用来自Multi-CPR的中文电商领域数据标注训练。
模型采用4张NVIDIA V100机器训练, 主要超参设置如下:
训练示例代码
数据评估及结果
本模型在MultiCPR电商数据上使用CoROM文本向量-中文-电商领域-base(CoROM-Retrieval)模型召回的top100结果上重排序效果如下:
Model MRR@10
- ----------- --------
CoROM-Retrieval-base 31.85
CoROM-Ranking-base 47.28
CoROM-Retrieval-tiny 19.53
CoROM-Ranking-tiny 39.31
引用
如果你觉得这个该模型对有所帮助,请考虑引用下面的相关的论文:
Clone with HTTP
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
