闲社服务运行正常AI智能体自动化平台

embeddinggemma-2

google/embeddinggemma-2

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

EmbeddingGemma 2 是由 Google DeepMind 构建的开源多模态嵌入模型,将文本(含代码)、图像、视频和音频输入及其组合映射到统一的 768 维向量空间。模型总计 740M 参数,包含 270M 参数文本模型以及可模块化加载的视觉(170M)和音频(300M)编码器。 原生多模态:在单一共享的 768 维嵌入空间中统一文本、图像、视频和音频四种模态。 多语言和代码支持:理解 100+ 语言,代码任务比前代提升约 14%。

向量检索图像分析
模型详情

模型介绍

中文整理

模型用途

EmbeddingGemma 2 是由 Google DeepMind 构建的开源多模态嵌入模型,将文本(含代码)、图像、视频和音频输入及其组合映射到统一的 768 维向量空间。模型总计 740M 参数,包含 270M 参数文本模型以及可模块化加载的视觉(170M)和音频(300M)编码器。

主要能力

原生多模态:在单一共享的 768 维嵌入空间中统一文本、图像、视频和音频四种模态。

多语言和代码支持:理解 100+ 语言,代码任务比前代提升约 14%。

灵活部署:结合 270M 参数文本骨干(130M transformer + 140M 嵌入器)与可选择性加载的视觉和音频编码器,开发者可仅加载所需模态。

Matryoshka 表示学习(MRL):原生支持 128d、256d、512d 和 768d 截断嵌入,可在质量损失最小的情况下实现最高 6 倍的向量存储成本降低。

上下文长度:8K token 上下文窗口,可处理数分钟音频或视频。

任务导向表示:使用轻量级文本指令前缀优化不同任务的嵌入,如搜索、分类、聚类、语义相似度等。

输入输出

支持模态:文本、图像、视频、音频

上下文窗口:8,192 tokens

原生输出维度:768

MRL 截断维度:128, 256, 512

运行要求

总参数:740M

文本骨干:130M

嵌入器:140M

视觉编码器:170M

音频编码器:300M

架构配置:24 层,模型维度 512,隐藏维度 2048,滑动窗口 1024 tokens,词汇表大小 262,144

注意力机制:GQA/MQA

激活函数:Gated FFN with GELU

池化方式:Mean Pooling

投影层:512→768

数值精度:推荐 bfloat16 或 float32,不建议使用 float16(float16 可能导致 NaN 或静默降级)

基本用法

任务指令前缀:EmbeddingGemma 2 训练时使用短任务指令前缀作为文本输入前缀。使用正确的前缀可提升质量;省略前缀仍可工作但会降低精度。前缀仅适用于文本,图像、视频和音频无需前缀。

非对称任务(如检索):查询使用查询前缀,语料库项使用文档前缀。

对称任务(如分类、相似度):所有被比较的输入使用相同的任务前缀。

文档格式:有标题的文档应格式化为 "title: {标题} text: {内容}",无标题时使用 "title: none"。

选择性编码器加载:视觉和音频编码器是独立组件。文本仅需 270M 参数,文本+图像 440M,文本+音频 570M,全模态 740M。

维度截断:768 维输出向量可截断为 512、256 或 128 维。截断后必须进行 L2 归一化,否则会降低排序质量。查询和文档必须使用相同维度。

多模态输入:单一输入可混合文本、图像、视频和音频,使用共享的 8,192 token 上下文。不同模态消耗 token 的速率不同:文本每子词 1 token,图像每张约 280 token,视频每帧约 140 token,音频每秒约 25 token。

限制

训练数据:训练数据的质量和多样性显著影响模型能力。训练数据的偏差或空白可能导致模型局限性。模型支持 100+ 语言,但各语言表现可能不一致。

上下文和任务复杂度:模型在可通过明确提示和指令框定的任务上表现良好。开放式或高度复杂的任务可能具有挑战性。

语言歧义和细微差别:自然语言本身复杂。模型可能难以理解细微差别、讽刺或比喻性语言。

任务指令使用:对于文本任务,省略推荐的任务前缀可能导致次优嵌入质量。

许可证

Apache 2.0

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部