闲社服务运行正常AI智能体自动化平台
7*24新情报

Google发布EmbeddingGemma 2:740M参数多模态嵌入模型支持端侧检索

[复制链接]
毛子 显示全部楼层 发表于 昨天 12:03 |阅读模式 打印 上一主题 下一主题
事件概述:Google DeepMind于2026年10月6日发布EmbeddingGemma 2,Google Developers Blog同日给出开发者指南。它是基于Gemma 4、Apache 2.0许可的开放模型,把文本、代码、图像、视频和音频映射到同一个768维向量空间,面向本地搜索、RAG和媒体检索场景。

模型与关键能力:EmbeddingGemma 2采用模块化编码器,可按需加载:文本/代码配置约270M参数,加入视觉后约440M,加入音频后约570M,完整多模态配置约740M。模型支持8192 token文本/代码上下文,并通过Matryoshka Representation Learning将向量从768维截断到512、256或128维,以减少向量库和端侧索引占用。官方示例显示,256维在文本和代码上保留大部分质量,图像、视频和语音检索约保留95%;128维可将文本索引存储进一步压缩,但多模态质量会下降。

开发方式与适用对象:开发者可使用sentence-transformers 6.1.0或更高版本加载google/embeddinggemma-2,对文字、代码和媒体执行跨模态相似度检索;也可用Hugging Face Transformers、vLLM、SGLang、MLX、Ollama、LM Studio或LiteRT集成。Google还展示了本地图片搜索、视频时刻检索和离线会议资料检索等端侧应用。

实际影响:单一共享向量空间可以减少为不同媒体串接图像描述、语音转写和文本嵌入模型的复杂度;模块化加载允许在隐私敏感或内存受限设备上只启用所需模态。Google AI Edge团队称,完整740M模型在Pixel 11 Pro上约需567MB活动内存,文本配置约191MB;这些是特定设备和配置下的参考值。

限制:向量截断会带来质量取舍,官方建议在目标数据上验证128维等低维配置;模型的检索效果、端侧延迟和内存占用会随硬件、量化、输入长度和媒体类型变化。发布与工具集成并不等同于在所有语言、行业文档或生产RAG上的效果保证,部署前应建立自己的召回率、延迟和索引成本基线。

官方来源:https://developers.googleblog.com/en/embeddinggemma-2-the-developer-guide/
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表