模型介绍
中文整理# MiniCPM-V 4.6 模型卡片
模型用途
MiniCPM-V 4.6是一款口袋级多模态大语言模型,专为手机端超高效图像和视频理解设计。该模型基于SigLIP2-400M视觉编码器和Qwen3.5-0.8B语言模型构建,是目前边缘部署最友好的模型版本。
## 主要能力
- *基础能力领先**
MiniCPM-V 4.6在Artificial Analysis Intelligence Index基准测试中得分13,超越Qwen3.5-0.8B的10分(token成本降低19倍)和Qwen3.5-0.8B-Thinking的11分(token成本降低43倍),同时超越更大的Ministral 3 3B模型(得分11)。
- *多模态能力强**
在大多数视觉语言理解任务上超越Qwen3.5-0.8B,并在OpenCompass、RefCOCO、HallusionBench、MUIRBench和OCRBench等多个基准上达到Qwen3.5 2B级别的能力。
- *超高效架构**
基于LLaVA-UHD v4最新技术,视觉编码计算FLOPs降低超过50%。与Qwen3.5-0.8B相比,token吞吐量提升约1.5倍。支持混合4x/16x视觉token压缩率,可在精度和速度之间灵活切换。
- *移动平台覆盖广泛**
支持iOS、Android和HarmonyOS三大主流移动平台。边缘适配代码已开源,开发者只需几步即可在设备上复现体验。
## 输入输出
- *输入**:单张图像、多张图像、视频
- *输出**:自然语言文本响应
运行要求
- *框架支持**:适配vLLM、SGLang、llama.cpp、Ollama等推理框架,支持SWIFT和LLaMA-Factory微调生态
- *量化版本**:提供GGUF、BNB、AWQ、GPTQ等多种量化格式
- *硬件要求**:可在消费级GPU上快速定制模型,适用于移动端设备部署
基本用法
- *图像推理**:加载模型后传入图像进行推理
- *视频推理**:支持视频输入处理
- *高级参数**:
- downsample mode:视觉token下采样模式,"16x"为高效合并token,"4x"保留更多细节
- max slice nums:高分图像切片最大数量,建议图像36,视频1
- max num frames:视频最大帧数,控制时间上下文长度
- stack frames:每秒采样点数,短视频建议1,长视频建议3或5
- use image id:是否在图像/帧占位符前添加N个标签
限制
- *CUDA兼容性**:torchcodec(用于视频解码)可能与某些CUDA版本存在兼容性问题。可使用PyAV替代torchcodec,或固定CUDA版本。
- *工具调用**:模型返回自然语言解释后跟结构化块,但transformers库尚未添加专用工具调用解析器,需通过正则表达式手动提取。
许可证
请参阅项目官方许可证文档。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
