模型介绍
中文整理# MiMo-V2.5-Pro-FP4-DFlash 模型卡片
模型概述
MiMo-V2.5-Pro-FP4-DFlash是支撑MiMo-V2.5-Pro-UltraSpeed的底层模型,专为万亿参数规模推理设计。该模型通过FP4量化和块扩散投机解码技术,显著降低推理成本。
## 主要能力
- *FP4量化主干网络**
对MoE专家应用MXFP4量化(块大小32),保持注意力投影和其他模块更高精度,在大幅减小模型体积的同时保持接近无损的质量。
- *BF16 DFlash起草器**
采用块扩散投机解码,每次前向传播提出整个token块,由主干网络一次性验证,打破传统投机解码中串行起草的自回归瓶颈。
- *性能表现**
在通用推理和代码任务基准测试中,FP4量化模型与FP8基线质量接近,部分任务有所提升。
## 技术规格
- *主干网络架构**
总参数1.02万亿,活跃参数420亿,隐藏大小6144,70层,128个注意力头,8个KV头,最大上下文长度100万token。
- *DFlash起草器架构**
5层起草模型,隐藏大小6144,128个注意力头,8个KV头,滑动窗口大小1024,块大小8,捕获主干网络层[0,15,31,47,69]。
- *精度配置**
主干网络:MoE专家使用MXFP4,其他模块使用BF16混合精度;起草器:BF16。
运行要求
模型支持在SGLang中进行DFlash推理。起草器通过投机解码标志与主干网络一起启动,继承主干网络的张量/专家并行拓扑。
基本用法
使用SGLang部署时,--model参数指向本仓库,--speculative-draft-model-path参数指向dflash子目录。
限制
FP4量化仅应用于MoE专家模块,注意力投影等关键组件保持更高精度以确保输出质量。DFlash的mask块大小上限为8,以平衡验证开销和并发性能。
许可证
如需引用或使用该模型,请联系mimo@xiaomi.com或加入社区交流群。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
