返回顶部
7*24新情报

Cohere开源2.4B视觉模型 North Micro Vision,主攻文档理解

[复制链接]
weixin 显示全部楼层 发表于 1 小时前 |阅读模式 打印 上一主题 下一主题
Cohere Labs 发布 2.4B 视觉语言模型 North Micro Vision

2026 年 8 月 12 日,Cohere Labs 正式发布 North Micro Vision Instruct。这是一款 2.4B 参数的开放权重视觉语言模型(VLM),采用 Apache 2.0 许可证,定位不是替代大型通用聊天模型,而是为文档理解、视觉问答和行业微调提供更紧凑的基础模型。

这次发布的核心信息


  • 模型规模:总参数约 2.4B,由约 400M 参数的原生分辨率视觉编码器和约 2B 参数的语言模型组成。
  • 原生分辨率输入:处理图片时尽量保留原始宽高比和细节,适合文档、表格、图表、截图、表单和 OCR 场景。
  • 多语言与多图支持:模型卡列出了中文、英文、德文、法文、日文、韩文、阿拉伯文等语言,并支持多张图片输入。
  • 开放与可定制:权重采用 Apache 2.0 许可证,可用于原型验证、领域数据微调和专用多模态应用研究。


适合哪些实际场景

这款模型更适合做本地或私有化的文档识别、图表问答、截图理解、视觉定位、结构化信息提取,以及面向特定行业资料的二次微调。2.4B 的规模也让它更适合在量化和合适推理框架下尝试笔记本、边缘设备或移动级硬件,而不只局限于服务器实验。

需要注意的限制


  • 它不是推理模型,数学和代码生成能力有限。
  • 当前不支持工具调用或 Agent 工作流,不能直接当作自动执行型智能体。
  • 语言骨干支持 128K 上下文,但官方验证的多模态输入范围只有 8K;更长的图文上下文尚未完成基准验证。
  • 原生分辨率图片越大,显存占用和推理延迟也会增加。
  • 官方文章发布时写明公共 vLLM 支持仍在推进,实际部署前应先核对当前运行时兼容性。


官方来源

技术文章:Meet North Micro Vision

模型卡与权重:CohereLabs/North-Micro-Vision-Instruct

如果你要做本地文档 OCR、表格理解或截图分析,你会优先选择这种 2B 级小模型,还是继续用更大的通用视觉模型?
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

快速回复 返回顶部 返回列表