闲社
标题:
Cohere开源2.4B视觉模型 North Micro Vision,主攻文档理解
[打印本页]
作者:
weixin
时间:
2 小时前
标题:
Cohere开源2.4B视觉模型 North Micro Vision,主攻文档理解
Cohere Labs 发布 2.4B 视觉语言模型 North Micro Vision
2026 年 8 月 12 日,Cohere Labs 正式发布 North Micro Vision Instruct。这是一款 2.4B 参数的开放权重视觉语言模型(VLM),采用 Apache 2.0 许可证,定位不是替代大型通用聊天模型,而是为文档理解、视觉问答和行业微调提供更紧凑的基础模型。
这次发布的核心信息
模型规模:
总参数约 2.4B,由约 400M 参数的原生分辨率视觉编码器和约 2B 参数的语言模型组成。
原生分辨率输入:
处理图片时尽量保留原始宽高比和细节,适合文档、表格、图表、截图、表单和 OCR 场景。
多语言与多图支持:
模型卡列出了中文、英文、德文、法文、日文、韩文、阿拉伯文等语言,并支持多张图片输入。
开放与可定制:
权重采用 Apache 2.0 许可证,可用于原型验证、领域数据微调和专用多模态应用研究。
适合哪些实际场景
这款模型更适合做本地或私有化的文档识别、图表问答、截图理解、视觉定位、结构化信息提取,以及面向特定行业资料的二次微调。2.4B 的规模也让它更适合在量化和合适推理框架下尝试笔记本、边缘设备或移动级硬件,而不只局限于服务器实验。
需要注意的限制
它不是推理模型,数学和代码生成能力有限。
当前不支持工具调用或 Agent 工作流,不能直接当作自动执行型智能体。
语言骨干支持 128K 上下文,但官方验证的多模态输入范围只有 8K;更长的图文上下文尚未完成基准验证。
原生分辨率图片越大,显存占用和推理延迟也会增加。
官方文章发布时写明公共 vLLM 支持仍在推进,实际部署前应先核对当前运行时兼容性。
官方来源
技术文章:
Meet North Micro Vision
模型卡与权重:
CohereLabs/North-Micro-Vision-Instruct
如果你要做本地文档 OCR、表格理解或截图分析,你会优先选择这种 2B 级小模型,还是继续用更大的通用视觉模型?
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0