返回顶部
7*24新情报

腾讯发布EVIE-Preview-4.5B:面向多语言视觉文档检索

[复制链接]
快乐好 显示全部楼层 发表于 6 小时前 |阅读模式 打印 上一主题 下一主题
腾讯发布 EVIE-Preview-4.5B 视觉文档检索模型

腾讯于 2026 年 8 月 17 日在官方 GitHub 与 Hugging Face 仓库发布 EVIE-Preview-4.5B。这是一款面向视觉文档检索的多向量编码模型:输入可以是文档页面图片与自然语言查询,输出查询和页面的 token 级向量,再通过晚交互 MaxSim 计算相关性。它的目标是从图表、表格、科学报告、财务文件和扫描表单中找出与问题最相关的页面,而不是直接生成答案。

模型与关键能力


  • 4.54B 参数:模型以 Qwen3.5-4B 视觉语言模型为骨干,官方模型卡标注 BF16 检查点约 8.5GB,并采用 Apache 2.0 许可证。
  • 128 维原生多向量:EVIE 将查询 token 和文档视觉 token 投影到 128 维空间,通过 token 级 MaxSim 完成晚交互检索。较窄的向量有助于降低多向量索引的存储与评分开销。
  • 视觉页面直接检索:文档不必先完整转换为纯文本即可建立页面向量,适合同时包含图片、布局、图表和表格的资料库。
  • 多语言查询:官方列出的查询语言包括英语、法语、德语、意大利语、西班牙语、葡萄牙语和中文,也覆盖包含日文页面的检索评测。
  • 两档页面预算:模型训练时使用每页 768 个视觉 token;同一检查点也提供 1792 token 的测试时外推配置,用更大的页面表示换取更高的索引与推理成本。
  • 两条集成路径:官方提供 ColPali Engine 的推理方式,也给出 Sentence Transformers MultiVectorEncoder 接口,便于接入已有向量检索与 RAG 流程。


适合哪些用户

EVIE 更适合建设企业视觉知识库、财报与合同页面检索、论文图表检索、多语言档案搜索或视觉 RAG 的团队。典型链路是先用 EVIE 找到相关页面,再把页面交给 OCR、视觉语言模型或业务解析器生成答案和结构化结果。

实际影响与限制


  • 它是检索器,不是答案生成器:模型返回向量和相关性分数,不会直接完成 OCR、摘要或问答;生产系统仍需要后续阅读、生成与引用校验组件。
  • Preview 版本仍有运行时细节:ColPali 路径需要在加载后开启双向注意力,并在每次查询前重置 rope_deltas。模型卡称截至发布时的部分 colpali-engine 版本默认使用因果掩码,若漏掉这些步骤会影响结果。
  • 1792 token 属于测试时外推:官方明确说明训练预算是 768 token,1792 并非重新训练的检查点。不同分辨率和业务文档上的收益需要单独验证。
  • 多向量索引依然不小:官方估算 100 万页在 BF16 下,768 token 配置约需 179.2GiB 原始索引,1792 token 配置约需 420.5GiB;上线前仍要规划量化、分片、缓存和重排策略。
  • 托管推理未开启:模型页标记 inference: false,通常需要自行准备 GPU 与推理环境。Sentence Transformers 路径在模型卡发布时还要求从源码安装尚未进入 PyPI 的 6.0.0 版本。
  • 榜单结果应自行复核:官方模型卡给出了 ViDoRe 评测和复现脚本,但比较结果来自各厂商公开数据与特定设置;本文不据此宣称在所有业务数据上优于其他模型。


官方来源

腾讯官方模型页、架构与部署说明:tencent/EVIE-Preview-4.5B

腾讯官方代码仓库:Tencent/EVIE-Preview-4.5B

基础模型页面:Qwen/Qwen3.5-4B
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

快速回复 返回顶部 返回列表