闲社服务运行正常AI智能体自动化平台

MiniCPM5-2B

OpenBMB/MiniCPM5-2B

发布机构OpenBMB

下载访问条件魔搭来源

MiniCPM5-2B 是 MiniCPM5 系列的第二款模型,是一款 20 亿参数的密集 Transformer 模型,专为设备端部署、本地运行和资源受限场景设计。该模型在 20 亿参数级别的开源模型中达到 SOTA 水平,整体性能具有竞争力,在代码推理、数学推理、长上下文理解、工具使用和多种智能体任务方面表现突出。 20 亿参数级别开源模型 SOTA 性能 原生长上下文支持,上下文长度达 131,072 tokens

文字对话推理思考编程开发
模型详情

模型介绍

中文整理

# MiniCPM5-2B 模型卡片

模型概述

MiniCPM5-2B 是 MiniCPM5 系列的第二款模型,是一款 20 亿参数的密集 Transformer 模型,专为设备端部署、本地运行和资源受限场景设计。该模型在 20 亿参数级别的开源模型中达到 SOTA 水平,整体性能具有竞争力,在代码推理、数学推理、长上下文理解、工具使用和多种智能体任务方面表现突出。

## 主要能力

  • 20 亿参数级别开源模型 SOTA 性能
  • 可与 40 亿参数级别模型竞争
  • 原生长上下文支持,上下文长度达 131,072 tokens
  • 代码推理、数学推理、长上下文理解、工具调用、智能体任务能力突出
  • 适用于本地助手、代码智能体、工具调用工作流和推理场景

## 技术规格

  • **模型类型**:因果语言模型
  • **架构**:标准 LlamaForCausalLM
  • **参数总量**:2,516,756,480
  • **非嵌入参数**:1,981,982,720
  • **层数**:42
  • **注意力头数量**:Q 使用 16 个头,KV 使用 2 个头(采用 GQA)
  • **上下文长度**:131,072

## 输入输出格式

  • **输入**:文本提示
  • **输出**:文本生成
  • **工具调用**:输出 XML 格式的工具调用

运行要求

模型支持多种部署格式,可根据运行时环境选择:

  • **BF16/FP16**:适用于 Transformers、vLLM、SGLang
  • **GGUF**:适用于 llama.cpp、Ollama、LM Studio
  • **MLX**:适用于 Apple Silicon(4bit 量化)
  • **GPTQ**:4bit 量化模型
  • **DSpark**:用于推理加速的草稿模型
  • **LiteRT**:适用于 Android、iOS、桌面端、IoT 设备

基本用法

  • *推荐采样参数**:
  • temperature=1.0
  • top p=0.95
  • min p=0.0
  • *如遇重复输出**,可尝试:
  • temperature=1.0
  • top p=0.95
  • min p=0.0
  • repetition penalty=1.05
  • *工具调用**:推荐使用 SGLang 作为后端,模型输出 XML 格式的工具调用,SGLang 内置解析器可将其转换为 OpenAI 兼容格式。
  • *部署框架**:支持 Transformers、vLLM、SGLang、llama.cpp、Ollama、LM Studio、MLX、LiteRT-LM 等主流推理框架。
  • *微调框架**:支持 TRL+PEFT、LLaMA-Factory、ms-swift、unsloth。

限制

  • 采样参数支持情况因推理框架而异
  • 在 llama.cpp 中,默认 min p=0.05 可能导致重复输出,建议设为 min p=0.0

许可证

模型权重采用开源许可证,具体许可证信息请参阅模型发布页面。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部