模型介绍
中文整理# MiMo-V2.5-Pro 模型卡片
模型概述
MiMo-V2.5-Pro 是小米开源的混合专家(Mixture-of-Experts,MoE)语言模型,总参数1.02T,活跃参数42B。该模型采用混合注意力架构和3层多Token预测(MTP)技术,支持最高100万token的上下文长度。
## 主要能力
- *长上下文处理**:支持最高100万token的上下文窗口,在长上下文推理任务中表现优异。在512k长度下达到0.56 BFS和0.92 Parents分数,在1M长度下仍保持0.37和0.62的分数。
- *混合注意力架构**:交替使用滑动窗口注意力(SWA)和全局注意力(GA),比例6:1,滑动窗口大小128。该设计将KV-cache存储降低约7倍,同时通过可学习的注意力sink偏置维持长上下文性能。
- *多Token预测**:配备3个轻量级MTP模块,使用密集前馈网络。推理时输出速度提升3倍,并可加速强化学习训练中的 rollout。
- *代理能力**:经过监督微调(SFT)、大规模代理强化学习和多教师在线策略蒸馏(MOPD)训练,在复杂软件工程、代理任务和长时域任务上表现优异。
## 输入输出
- *输入格式**:文本提示,支持最高100万token上下文
- *输出格式**:文本响应
- *精度**:FP8(E4M3)混合精度
运行要求
- *硬件**:建议使用高性能GPU进行推理
- *部署框架**:推荐使用SGLang或vLLM进行部署
- *本地部署采样参数建议**:temperature=1.0,top_p=0.95
基本用法
模型可通过HuggingFace或ModelScope平台下载。官方建议按照SGLang MiMo-V2.5-Pro Cookbook或vLLM MiMo-V2.5-Pro Cookbook获取最新部署指南。
## 模型架构参数
总参数:1.02T
活跃参数:42B
隐藏层大小:6144
层数:70层(1层密集层 + 69层MoE层)
全注意力层数:10
滑动窗口注意力层数:60
注意力头数:128
KV头数:8(GQA)
路由专家数:384
每token激活专家数:8
MoE中间层大小:2048
滑动窗口大小:128
MTP层数:3
最大上下文长度:100万
## 训练数据
预训练使用27T tokens,采用FP8混合精度和原生32k序列长度训练。
## 后训练流程
采用三阶段后训练范式:
- 监督微调(SFT):使用精选数据对构建基础指令跟随能力
- 领域专项训练:使用领域特定的强化学习奖励信号,分别优化数学、安全、复杂代理工具使用等不同教师模型
- 多教师在线策略蒸馏(MOPD):通过动态在线强化学习,学生模型从自身输出中持续学习,并获得来自专家教师的精确token级指导
## 评估表现
在多项基准测试中表现优异,包括:
- 数学任务:GSM8K 8-shot达99.6%,MATH 4-shot达86.2%
- 代码任务:HumanEval+ 1-shot达75.6%,SWE-Bench达35.7%
- 中文任务:C-Eval 5-shot达91.5%,CMMLU 5-shot达90.2%
- 通用任务:MMLU 5-shot达89.4%,BBH 3-shot达88.4%
许可证
模型卡片原文未包含许可证相关信息。
## 联系方式
如有问题或反馈,可联系:mimo@xiaomi.com
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
