闲社
标题:
H Company开源NeoMME:260M与800M原生多模态编码器
[打印本页]
作者:
meteor1982
时间:
2026-9-4 12:02
标题:
H Company开源NeoMME:260M与800M原生多模态编码器
【事件概述】
H Company 团队于 2026 年 9 月 3 日发布并开放 NeoMME 系列模型。NeoMME 是面向文本与图像表征的多语言、多模态编码器,包含 260M 和 800M 两种规模;它不沿用独立预训练视觉塔或因果语言模型,而是让同一个双向 Transformer 直接处理文本 token 与原始图像块。
【模型与开发者】
模型:NeoMME-260M、NeoMME-800M,以及对应的 NeoMME-Retriever 检索版本
开发者:Aurélien Lac、Tony Wu;H Company 提供支持与训练计算资源
官方发布日期:2026 年 9 月 3 日
开源许可:Apache License 2.0
主要用途:多模态特征提取、视觉文档检索、视觉 RAG、下游分类与标注任务
日期核对说明:Hugging Face 官方团队文章明确标注 2026 年 9 月 3 日,模型仓库也在同期开放。本文以团队文章发布日期作为公开发布事件日期,不把模型页的动态更新时间当成发布日期。
【关键能力与改动】
1. 单塔原生多模态:文本使用分解式 token embedding,图像则切分为不重叠的 32×32 图像块并经小型 MLP 投影,随后统一进入同一个双向 Transformer。模型不是把现成视觉编码器接到语言模型上,而是从头联合学习两种输入。
2. 动态图像分辨率:图片保持原有长宽比和尺寸,信息密集的高分辨率文档页会使用更多视觉 token,较小图片则使用较少 token。
3. 长双向上下文:两种规模均支持 16,384 token 上下文。官方称该容量可容纳最多两张标准 3840×2160 的 4K UHD 图像,但实际可用数量会随分辨率、文本长度和预处理方式变化。
4. 多语言训练:团队从头训练了 13.1 万词元的 BPE tokenizer,训练内容覆盖多语言文本、代码、数学、自然图像和文档图像。
5. 掩码扩散式预训练:NeoMME 以离散掩码扩散文本去噪目标从头预训练。在多模态样本中,图像块保持可见,模型重建被遮盖文本,以减少仅依赖上下文猜词、忽略图像证据的捷径。
6. 双检索头:NeoMME-Retriever 一次前向计算同时返回紧凑的 dense embedding 和保留局部匹配能力的 late-interaction embedding。开发者可先用 dense 向量快速召回,再用 late interaction 对候选页面重排。
7. Transformers 支持:模型已进入 Hugging Face Transformers 的新实现,并提供 Sentence Transformers 的 dense 与 late-interaction 独立检查点,便于继续微调。
【官方评测与效率】
团队在视觉文档检索基准 ViDoRe v3 上报告,NeoMME-Retriever-260M 的 nDCG@10 为 0.523,800M 版本为 0.556。在同为 2048×2048 输入、单张 NVIDIA L40S 的测试中,260M 版本编码约 51 页/秒。
对于高分辨率页面,late-interaction 索引原始占用较大。团队使用分层 token pooling 与非对称量化后,在其 ViDoRe v3 实验中将平均每页存储从约 1.5 MB 降到 6 kB,同时保留超过 95% 的基线 nDCG@10。
以上跑分、吞吐和压缩比例均来自作者指定硬件、图像预处理、批大小、数据集与实现。其中部分基准结果来自团队自行评测,不能直接视为所有语言、文档类型或生产硬件上的保证。
【适用对象】
NeoMME 适合需要本地或自托管多模态检索的开发者,包括扫描 PDF、图表、表格、版面复杂文档的搜索,以及视觉 RAG 的首阶段页面召回。260M 版本更适合吞吐和显存敏感的索引任务;800M 版本适合愿意增加资源以换取更高检索质量的场景。
如果业务只需要纯文本语义检索,传统文本 embedding 可能更简单、更节省存储。若需要根据图片生成长文本回答,NeoMME 本身不是自回归生成模型,还需要把检索到的页面交给视觉语言模型完成最终生成。
【实际影响】
视觉文档检索常见方案会同时携带视觉塔、投影层和语言模型,模型规模与推理路径较重。NeoMME 用一个双向编码器统一图像块和文本 token,为文档索引、跨模态查询和下游微调提供了更紧凑的基础模型选择。
一次前向同时生成 dense 与 late-interaction 表征,也让大型文档库可以采用两阶段检索:先用低成本 ANN 索引缩小候选范围,再用细粒度图文匹配重排,从而在搜索速度、索引空间和准确度之间做更灵活的取舍。Apache 2.0 许可则便于研究和商业团队在遵守许可证的前提下评估、修改与部署。
【限制与使用提醒】
NeoMME 的主要公开下游验证集中在视觉文档检索,不能据此认定它在通用图像分类、开放世界识别、视觉问答或生成任务上同样领先。260M 基础检查点只返回上下文化 token 表征,必须增加或微调任务专用头;需要直接检索 embedding 的用户应选择 Retriever 检查点。
模型卡明确说明,NeoMME 尚未完成全面的安全、偏差或隐私评估。训练数据包含机器生成的图像转录,可能继承数据中的语言、文化、版面和 OCR 偏差。涉及真实用户和敏感文档时,不能因模型已开源就省略内部评估。
动态高分辨率输入会增加 token 数量、显存和延迟。late-interaction 虽能保留局部匹配,但未压缩索引会占用大量存储;激进 pooling 和二值量化则会牺牲一部分检索质量。生产部署应使用自己的中文文档、扫描质量、表格、印章、小字体和长尾查询建立评测集。
团队发布文章的早期示例使用 Transformers 主分支,当前模型卡已经给出标准 transformers 安装方式。不同环境的可用版本可能不同,落地时仍应固定依赖版本、保存模型哈希并进行兼容测试。涉及合同、身份材料、医疗或内部文件时,还要设置访问控制、脱敏、向量库隔离和结果人工复核。
【官方来源】
Hugging Face 团队发布:https://huggingface.co/blog/Hcompany/neomme
NeoMME-260M 模型卡:https://huggingface.co/Hcompany/NeoMME-260M
NeoMME 模型合集:https://huggingface.co/collections/Hcompany/neomme
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0