模型介绍
中文整理模型用途
EmbeddingGemma 2 是由 Google DeepMind 构建的开源多模态嵌入模型,将文本(含代码)、图像、视频和音频输入及其组合映射到统一的 768 维向量空间。模型总计 740M 参数,包含 270M 参数文本模型以及可模块化加载的视觉(170M)和音频(300M)编码器。
主要能力
原生多模态:在单一共享的 768 维嵌入空间中统一文本、图像、视频和音频四种模态。
多语言和代码支持:理解 100+ 语言,代码任务比前代提升约 14%。
灵活部署:结合 270M 参数文本骨干(130M transformer + 140M 嵌入器)与可选择性加载的视觉和音频编码器,开发者可仅加载所需模态。
Matryoshka 表示学习(MRL):原生支持 128d、256d、512d 和 768d 截断嵌入,可在质量损失最小的情况下实现最高 6 倍的向量存储成本降低。
上下文长度:8K token 上下文窗口,可处理数分钟音频或视频。
任务导向表示:使用轻量级文本指令前缀优化不同任务的嵌入,如搜索、分类、聚类、语义相似度等。
输入输出
支持模态:文本、图像、视频、音频
上下文窗口:8,192 tokens
原生输出维度:768
MRL 截断维度:128, 256, 512
运行要求
总参数:740M
文本骨干:130M
嵌入器:140M
视觉编码器:170M
音频编码器:300M
架构配置:24 层,模型维度 512,隐藏维度 2048,滑动窗口 1024 tokens,词汇表大小 262,144
注意力机制:GQA/MQA
激活函数:Gated FFN with GELU
池化方式:Mean Pooling
投影层:512→768
数值精度:推荐 bfloat16 或 float32,不建议使用 float16(float16 可能导致 NaN 或静默降级)
基本用法
任务指令前缀:EmbeddingGemma 2 训练时使用短任务指令前缀作为文本输入前缀。使用正确的前缀可提升质量;省略前缀仍可工作但会降低精度。前缀仅适用于文本,图像、视频和音频无需前缀。
非对称任务(如检索):查询使用查询前缀,语料库项使用文档前缀。
对称任务(如分类、相似度):所有被比较的输入使用相同的任务前缀。
文档格式:有标题的文档应格式化为 "title: {标题} text: {内容}",无标题时使用 "title: none"。
选择性编码器加载:视觉和音频编码器是独立组件。文本仅需 270M 参数,文本+图像 440M,文本+音频 570M,全模态 740M。
维度截断:768 维输出向量可截断为 512、256 或 128 维。截断后必须进行 L2 归一化,否则会降低排序质量。查询和文档必须使用相同维度。
多模态输入:单一输入可混合文本、图像、视频和音频,使用共享的 8,192 token 上下文。不同模态消耗 token 的速率不同:文本每子词 1 token,图像每张约 280 token,视频每帧约 140 token,音频每秒约 25 token。
限制
训练数据:训练数据的质量和多样性显著影响模型能力。训练数据的偏差或空白可能导致模型局限性。模型支持 100+ 语言,但各语言表现可能不一致。
上下文和任务复杂度:模型在可通过明确提示和指令框定的任务上表现良好。开放式或高度复杂的任务可能具有挑战性。
语言歧义和细微差别:自然语言本身复杂。模型可能难以理解细微差别、讽刺或比喻性语言。
任务指令使用:对于文本任务,省略推荐的任务前缀可能导致次优嵌入质量。
许可证
Apache 2.0
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
