闲社服务运行正常AI智能体自动化平台

MiniCPM-V-4.6

OpenBMB/MiniCPM-V-4.6

发布机构OpenBMB

下载访问条件魔搭来源

MiniCPM-V 4.6是一款口袋级多模态大语言模型,专为手机端超高效图像和视频理解设计。该模型基于SigLIP2-400M视觉编码器和Qwen3.5-0.8B语言模型构建,是目前边缘部署最友好的模型版本。 MiniCPM-V 4.6在Artificial Analysis Intelligence Index基准测试中得分13,超越Qwen3.5-0.8B的10分(token成本降低19倍)和Qwen3.5-0.8B-Thinking的11分(token成本降低43倍),

图文理解
模型详情

模型介绍

中文整理

# MiniCPM-V 4.6 模型卡片

模型用途

MiniCPM-V 4.6是一款口袋级多模态大语言模型,专为手机端超高效图像和视频理解设计。该模型基于SigLIP2-400M视觉编码器和Qwen3.5-0.8B语言模型构建,是目前边缘部署最友好的模型版本。

## 主要能力

  • *基础能力领先**

MiniCPM-V 4.6在Artificial Analysis Intelligence Index基准测试中得分13,超越Qwen3.5-0.8B的10分(token成本降低19倍)和Qwen3.5-0.8B-Thinking的11分(token成本降低43倍),同时超越更大的Ministral 3 3B模型(得分11)。

  • *多模态能力强**

在大多数视觉语言理解任务上超越Qwen3.5-0.8B,并在OpenCompass、RefCOCO、HallusionBench、MUIRBench和OCRBench等多个基准上达到Qwen3.5 2B级别的能力。

  • *超高效架构**

基于LLaVA-UHD v4最新技术,视觉编码计算FLOPs降低超过50%。与Qwen3.5-0.8B相比,token吞吐量提升约1.5倍。支持混合4x/16x视觉token压缩率,可在精度和速度之间灵活切换。

  • *移动平台覆盖广泛**

支持iOS、Android和HarmonyOS三大主流移动平台。边缘适配代码已开源,开发者只需几步即可在设备上复现体验。

## 输入输出

  • *输入**:单张图像、多张图像、视频
  • *输出**:自然语言文本响应

运行要求

  • *框架支持**:适配vLLM、SGLang、llama.cpp、Ollama等推理框架,支持SWIFT和LLaMA-Factory微调生态
  • *量化版本**:提供GGUF、BNB、AWQ、GPTQ等多种量化格式
  • *硬件要求**:可在消费级GPU上快速定制模型,适用于移动端设备部署

基本用法

  • *图像推理**:加载模型后传入图像进行推理
  • *视频推理**:支持视频输入处理
  • *高级参数**:
  • downsample mode:视觉token下采样模式,"16x"为高效合并token,"4x"保留更多细节
  • max slice nums:高分图像切片最大数量,建议图像36,视频1
  • max num frames:视频最大帧数,控制时间上下文长度
  • stack frames:每秒采样点数,短视频建议1,长视频建议3或5
  • use image id:是否在图像/帧占位符前添加N个标签

限制

  • *CUDA兼容性**:torchcodec(用于视频解码)可能与某些CUDA版本存在兼容性问题。可使用PyAV替代torchcodec,或固定CUDA版本。
  • *工具调用**:模型返回自然语言解释后跟结构化块,但transformers库尚未添加专用工具调用解析器,需通过正则表达式手动提取。

许可证

请参阅项目官方许可证文档。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部