模型介绍
中文整理# MiniCPM5-2B 模型卡片
模型概述
MiniCPM5-2B 是 MiniCPM5 系列的第二款模型,是一款 20 亿参数的密集 Transformer 模型,专为设备端部署、本地运行和资源受限场景设计。该模型在 20 亿参数级别的开源模型中达到 SOTA 水平,整体性能具有竞争力,在代码推理、数学推理、长上下文理解、工具使用和多种智能体任务方面表现突出。
## 主要能力
- 20 亿参数级别开源模型 SOTA 性能
- 可与 40 亿参数级别模型竞争
- 原生长上下文支持,上下文长度达 131,072 tokens
- 代码推理、数学推理、长上下文理解、工具调用、智能体任务能力突出
- 适用于本地助手、代码智能体、工具调用工作流和推理场景
## 技术规格
- **模型类型**:因果语言模型
- **架构**:标准 LlamaForCausalLM
- **参数总量**:2,516,756,480
- **非嵌入参数**:1,981,982,720
- **层数**:42
- **注意力头数量**:Q 使用 16 个头,KV 使用 2 个头(采用 GQA)
- **上下文长度**:131,072
## 输入输出格式
- **输入**:文本提示
- **输出**:文本生成
- **工具调用**:输出 XML 格式的工具调用
运行要求
模型支持多种部署格式,可根据运行时环境选择:
- **BF16/FP16**:适用于 Transformers、vLLM、SGLang
- **GGUF**:适用于 llama.cpp、Ollama、LM Studio
- **MLX**:适用于 Apple Silicon(4bit 量化)
- **GPTQ**:4bit 量化模型
- **DSpark**:用于推理加速的草稿模型
- **LiteRT**:适用于 Android、iOS、桌面端、IoT 设备
基本用法
- *推荐采样参数**:
- temperature=1.0
- top p=0.95
- min p=0.0
- *如遇重复输出**,可尝试:
- temperature=1.0
- top p=0.95
- min p=0.0
- repetition penalty=1.05
- *工具调用**:推荐使用 SGLang 作为后端,模型输出 XML 格式的工具调用,SGLang 内置解析器可将其转换为 OpenAI 兼容格式。
- *部署框架**:支持 Transformers、vLLM、SGLang、llama.cpp、Ollama、LM Studio、MLX、LiteRT-LM 等主流推理框架。
- *微调框架**:支持 TRL+PEFT、LLaMA-Factory、ms-swift、unsloth。
限制
- 采样参数支持情况因推理框架而异
- 在 llama.cpp 中,默认 min p=0.05 可能导致重复输出,建议设为 min p=0.0
许可证
模型权重采用开源许可证,具体许可证信息请参阅模型发布页面。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
