闲社服务运行正常AI智能体自动化平台

MiMo-V2.5-Pro-FP4-DFlash

XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash

发布机构XiaomiMiMo

下载访问条件魔搭来源

MiMo-V2.5-Pro-FP4-DFlash是支撑MiMo-V2.5-Pro-UltraSpeed的底层模型,专为万亿参数规模推理设计。该模型通过FP4量化和块扩散投机解码技术,显著降低推理成本。 对MoE专家应用MXFP4量化(块大小32),保持注意力投影和其他模块更高精度,在大幅减小模型体积的同时保持接近无损的质量。 采用块扩散投机解码,每次前向传播提出整个token块,由主干网络一次性验证,打破传统投机解码中串行起草的自回归瓶颈。

文字对话推理思考编程开发
模型详情

模型介绍

中文整理

# MiMo-V2.5-Pro-FP4-DFlash 模型卡片

模型概述

MiMo-V2.5-Pro-FP4-DFlash是支撑MiMo-V2.5-Pro-UltraSpeed的底层模型,专为万亿参数规模推理设计。该模型通过FP4量化和块扩散投机解码技术,显著降低推理成本。

## 主要能力

  • *FP4量化主干网络**

对MoE专家应用MXFP4量化(块大小32),保持注意力投影和其他模块更高精度,在大幅减小模型体积的同时保持接近无损的质量。

  • *BF16 DFlash起草器**

采用块扩散投机解码,每次前向传播提出整个token块,由主干网络一次性验证,打破传统投机解码中串行起草的自回归瓶颈。

  • *性能表现**

在通用推理和代码任务基准测试中,FP4量化模型与FP8基线质量接近,部分任务有所提升。

## 技术规格

  • *主干网络架构**

总参数1.02万亿,活跃参数420亿,隐藏大小6144,70层,128个注意力头,8个KV头,最大上下文长度100万token。

  • *DFlash起草器架构**

5层起草模型,隐藏大小6144,128个注意力头,8个KV头,滑动窗口大小1024,块大小8,捕获主干网络层[0,15,31,47,69]。

  • *精度配置**

主干网络:MoE专家使用MXFP4,其他模块使用BF16混合精度;起草器:BF16。

运行要求

模型支持在SGLang中进行DFlash推理。起草器通过投机解码标志与主干网络一起启动,继承主干网络的张量/专家并行拓扑。

基本用法

使用SGLang部署时,--model参数指向本仓库,--speculative-draft-model-path参数指向dflash子目录。

限制

FP4量化仅应用于MoE专家模块,注意力投影等关键组件保持更高精度以确保输出质量。DFlash的mask块大小上限为8,以平衡验证开销和并发性能。

许可证

如需引用或使用该模型,请联系mimo@xiaomi.com或加入社区交流群。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部