模型介绍
中文整理BitNet Embeddings
模型描述
BitNet Embeddings 是由微软 BitNet 团队开发的多语言文本嵌入模型系列。该模型采用仅解码器架构,使用最后 token 池化和 L2 归一化来生成密集文本嵌入。可广泛应用于文本检索、聚类、语义相似度、分类、双语文本挖掘和重排序等任务。在公开基准测试中表现具有竞争力,同时保持出色的推理和存储效率。
开发者:微软研究院 BitNet 团队
模型类型:基于 BitNet b1.58 的文本嵌入模型
支持语言:多语言
许可证:MIT 许可证
模型规格
| 模型版本 | 权重类型 | 参数数量 | 嵌入维度 | 最大 Token 数 | MTEB v2 平均分 |
|----------|----------|----------|----------|---------------|----------------|
| bitnet-embeddings-270m | 1.58-bit | 270M | 640 | 32,768 | 66.26 |
| harrier-oss-v1-270m | bf16 | 270M | 640 | 32,768 | 66.5 |
| bitnet-embeddings-0.6b | 1.58-bit | 0.6B | 1,024 | 32,768 | 67.49 |
| harrier-oss-v1-0.6b | bf16 | 0.6B | 1,024 | 32,768 | 69.0 |
架构详情
模型采用 Transformer 架构,使用 BitLinear 层进行修改。核心特性包括:使用旋转位置嵌入(RoPE);采用 SubLN(子层归一化)以在量化训练中保持稳定;线性层和归一化层不含偏置项。
量化方式
模型采用原生 1.58-bit 权重和 8-bit 激活(W1.58A8)。权重被量化为三值 {-1, 0, +1},使用 absmean 量化方法。激活被量化为 8-bit 整数,使用 per-token 的 absmax 量化。模型从零开始使用此量化方案训练,非后训练量化。
上下文长度:32,768 个 token
池化策略:最后 token(EOS)池化 + L2 归一化
输入输出
输入:文本(需为查询添加任务指令,文档无需指令)
输出:密集嵌入向量(270M 模型为 640 维,0.6B 模型为 1024 维,已 L2 归一化)
运行要求
为获得效率优势,建议使用专用 C++ 实现 bitnet.cpp。模型支持将输出嵌入量化为 8、4、2 甚至 1 bit,用户可根据应用需求灵活权衡存储成本与检索性能。
基本用法
使用模型时,查询侧需要添加任务指令(单句描述任务),否则性能会下降。文档侧无需添加指令。模型使用最后 token 池化策略,取最后一个非填充 token 的嵌入作为句子表示,并进行 L2 归一化。
限制
模型不生成人类可读的文本或其他多模态内容,仅将输入文本映射为密集嵌入向量供下游向量数据库或分类器使用。
训练数据对低资源语言的覆盖有限,可能无法充分代表多样化的语言、文化或地理背景,因此低资源语言性能可能显著受限。
训练数据主要覆盖通用知识任务,特定或专业领域(如法律、医学、科学文献)可能未得到充分代表,相关领域结果需谨慎解读。
不建议在商业或现实世界应用中使用 BitNet Embeddings,无需进一步测试和开发。该模型发布用于研究目的,高风险场景下需要额外评估和微调以确保可靠性和公平性。
评估分数
MTEB v2 评估结果(16-bit 嵌入):
bitnet-embeddings-270m:双语文本分类 80.47 | 聚类 71.09 | 配对分类 52.37 | 重排序 79.72 | 检索 60.50 | 语义文本相似度 66.71 | 平均 66.26
bitnet-embeddings-0.6b:双语文本分类 81.47 | 聚类 72.65 | 配对分类 53.06 | 重排序 80.47 | 检索 62.12 | 语义文本相似度 68.33 | 平均 67.49
推理性能(Intel Xeon Platinum 8573C,8 线程)
bitnet-embedding-0.6B 在 pp128 批次下达到 870.90 tokens/秒,相比 FP16 的 382.15 tokens/秒提速 2.28 倍。
bitnet-embedding-270m 在 pp256 批次下达到 2119.50 tokens/秒,相比 FP16 的 1221.28 tokens/秒提速 1.74 倍。
支持语言
模型在多语言数据上训练,支持包括阿拉伯语、保加利亚语、加泰罗尼亚语、捷克语、丹麦语、德语、希腊语、英语、西班牙语、爱沙尼亚语、波斯语、芬兰语、法语、希伯来语、印地语、克罗地亚语、匈牙利语、印尼语、意大利语、日语、韩语、立陶宛语、拉脱维亚语、马其顿语、马来语、荷兰语、挪威语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、阿尔巴尼亚语、塞尔维亚语、瑞典语、泰语、土耳其语、乌克兰语、乌尔都语、越南语和中文在内的多种语言。
常见问题
是否需要为查询添加指令?
是的,这是模型的训练方式,否则会出现性能下降。任务定义应为描述任务的一句话指令。文档侧无需添加指令。
模型使用何种池化策略?
模型使用最后 token 池化,取最后一个非填充 token 的嵌入作为句子表示,并进行 L2 归一化。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
