闲社
标题:
腾讯开放WeMM-Embedding:2B/4B/9B统一多模态检索
[打印本页]
作者:
lonker
时间:
2026-8-31 09:05
标题:
腾讯开放WeMM-Embedding:2B/4B/9B统一多模态检索
【事件概述】
腾讯微信视觉团队开放了 WeMM-Embedding 多模态向量模型系列及配套代码,包含 2B、4B 和 9B 三种规模。该系列把文本、图片、视频、视觉文档以及图文交错输入映射到同一向量空间,面向跨模态检索、推荐、分类、多模态 RAG 和 Agent 记忆等场景。
【模型与开发者】
模型:WeMM-Embedding-2B、WeMM-Embedding-4B、WeMM-Embedding-9B
开发者:腾讯微信视觉团队(WeChat Vision Team)
官方开放日期:2026 年 8 月 25 日
许可证:Apache License 2.0;第三方组件仍遵循各自许可证
日期核对说明:腾讯官方 GitHub 仓库创建于 8 月 25 日 02:46 UTC,三套 Hugging Face 模型页在当日约 03:10 UTC 创建,arXiv 首次提交时间为 8 月 25 日 04:23 UTC。技术报告正文页面另标注 8 月 27 日,属于报告版本日期;本文以代码、权重和论文首次公开的 8 月 25 日作为事件日期,不把后续仓库更新时间当作发布日期。
【关键能力与改动】
1. 统一多模态表示:三个模型都支持文本、图片、视频、视觉文档和任意图文交错输入,输出经过 L2 归一化的稠密向量,可直接比较不同模态内容的语义相似度。
2. 三种规模:2B、4B、9B 版本的完整向量维度分别为 2048、2560 和 4096,团队可按精度、显存、吞吐与延迟需求选择。
3. Matryoshka 可变维度:三个版本都支持将向量截断到 64、128、256、512 或 1024 维后重新归一化;2B 和 9B 还支持 2048 维,4B 支持 2560 维,9B 支持 4096 维。这样可以在同一模型中调整向量库容量和检索成本。
4. 表示生成方式:模型从最后一层专用 token 的隐藏状态取出向量,再进行 L2 归一化。它不是把图像、视频分别交给完全独立的编码器后再拼接,而是用统一的多模态模型生成可比较表示。
5. 两阶段训练:技术报告说明,第一阶段进行大规模多模态对齐,第二阶段使用筛选后的数据、细粒度相关性监督和跨规模知识迁移,加强困难负样本与精细匹配能力。
6. 开源接入:官方提供 Transformers 和 Sentence Transformers 示例,并给出 vLLM 与 SGLang 的服务化脚本。仓库标注已测试 vLLM 0.27.0、SGLang 0.5.9,并建议使用 transformers 5.2.0 复现实验。
【适用对象】
适合构建以文搜图、以图搜视频、视觉文档检索、商品与内容推荐、多模态知识库、相似内容去重、分类聚类和 Agent 长期记忆的开发者。2B 版本更适合先验证延迟与资源成本;9B 版本适合追求更高表示能力且具备相应推理资源的团队。
【实际影响】
传统 RAG 往往只为文字建立索引,图片、视频和扫描文档需要额外 OCR、字幕或独立视觉模型。WeMM-Embedding 允许这些内容进入同一个向量空间,减少跨模态检索管线的模型数量,也能让“文字查询视频片段”“图片匹配文档页面”等任务使用统一的相似度搜索接口。
可变维度能直接影响向量数据库的存储、内存和检索速度。官方项目在 MMEB-v2 上报告,2B 模型截断到 256 维时保留其完整维度图像和视频表现的 98.7%。这只是开发方在指定基准、截断和归一化流程下的结果,不能自动推广到企业自己的数据;上线前仍需用真实召回集分别评估召回率、排序质量和成本。
【限制与使用提醒】
WeMM-Embedding 是表示与检索模型,不会直接生成答案、摘要或图片。实际 RAG 仍需向量数据库、召回与重排策略以及生成模型。官方明确说明当前不支持音频输入,因此带声音的视频不会自动获得语音内容表示;需要先做 ASR,或另接音频嵌入模型。
模型卡示例使用 trust_remote_code=True,部署前应固定模型提交、审查远程代码并在隔离环境测试。官方还提醒,更高版本 Transformers 可能改变预处理行为,因此复现实验应先按建议锁定 5.2.0,再评估升级差异。
项目公布的 MMEB-v2、MMEB-v3 和微信内部评测成绩由开发团队生成,任务定义、视频采样、数据预处理和评价指标会影响结果。不同业务中的图片质量、视频长度、中文专业词和向量维度都可能改变召回效果,不能只按公开榜单选型。
【官方来源】
腾讯官方 GitHub:https://github.com/Tencent/WeMM-Embedding
Hugging Face 2B 模型:https://huggingface.co/tencent/WeMM-Embedding-2B
Hugging Face 4B 模型:https://huggingface.co/tencent/WeMM-Embedding-4B
Hugging Face 9B 模型:https://huggingface.co/tencent/WeMM-Embedding-9B
官方技术报告:https://arxiv.org/abs/2608.24053
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0