腾讯发布 EVIE-Preview-4.5B 视觉文档检索模型
腾讯于 2026 年 8 月 17 日在官方 GitHub 与 Hugging Face 仓库发布 EVIE-Preview-4.5B。这是一款面向视觉文档检索的多向量编码模型:输入可以是文档页面图片与自然语言查询,输出查询和页面的 token 级向量,再通过晚交互 MaxSim 计算相关性。它的目标是从图表、表格、科学报告、财务文件和扫描表单中找出与问题最相关的页面,而不是直接生成答案。
模型与关键能力
- 4.54B 参数:模型以 Qwen3.5-4B 视觉语言模型为骨干,官方模型卡标注 BF16 检查点约 8.5GB,并采用 Apache 2.0 许可证。
- 128 维原生多向量:EVIE 将查询 token 和文档视觉 token 投影到 128 维空间,通过 token 级 MaxSim 完成晚交互检索。较窄的向量有助于降低多向量索引的存储与评分开销。
- 视觉页面直接检索:文档不必先完整转换为纯文本即可建立页面向量,适合同时包含图片、布局、图表和表格的资料库。
- 多语言查询:官方列出的查询语言包括英语、法语、德语、意大利语、西班牙语、葡萄牙语和中文,也覆盖包含日文页面的检索评测。
- 两档页面预算:模型训练时使用每页 768 个视觉 token;同一检查点也提供 1792 token 的测试时外推配置,用更大的页面表示换取更高的索引与推理成本。
- 两条集成路径:官方提供 ColPali Engine 的推理方式,也给出 Sentence Transformers MultiVectorEncoder 接口,便于接入已有向量检索与 RAG 流程。
适合哪些用户
EVIE 更适合建设企业视觉知识库、财报与合同页面检索、论文图表检索、多语言档案搜索或视觉 RAG 的团队。典型链路是先用 EVIE 找到相关页面,再把页面交给 OCR、视觉语言模型或业务解析器生成答案和结构化结果。
实际影响与限制
- 它是检索器,不是答案生成器:模型返回向量和相关性分数,不会直接完成 OCR、摘要或问答;生产系统仍需要后续阅读、生成与引用校验组件。
- Preview 版本仍有运行时细节:ColPali 路径需要在加载后开启双向注意力,并在每次查询前重置 rope_deltas。模型卡称截至发布时的部分 colpali-engine 版本默认使用因果掩码,若漏掉这些步骤会影响结果。
- 1792 token 属于测试时外推:官方明确说明训练预算是 768 token,1792 并非重新训练的检查点。不同分辨率和业务文档上的收益需要单独验证。
- 多向量索引依然不小:官方估算 100 万页在 BF16 下,768 token 配置约需 179.2GiB 原始索引,1792 token 配置约需 420.5GiB;上线前仍要规划量化、分片、缓存和重排策略。
- 托管推理未开启:模型页标记 inference: false,通常需要自行准备 GPU 与推理环境。Sentence Transformers 路径在模型卡发布时还要求从源码安装尚未进入 PyPI 的 6.0.0 版本。
- 榜单结果应自行复核:官方模型卡给出了 ViDoRe 评测和复现脚本,但比较结果来自各厂商公开数据与特定设置;本文不据此宣称在所有业务数据上优于其他模型。
官方来源
腾讯官方模型页、架构与部署说明:tencent/EVIE-Preview-4.5B
腾讯官方代码仓库:Tencent/EVIE-Preview-4.5B
基础模型页面:Qwen/Qwen3.5-4B |