模型介绍
中文整理# MiMo-V2-Flash 模型卡片
模型概述
MiMo-V2-Flash 是小米开发的大语言模型,采用混合专家(Mixture-of-Experts,MoE)架构,总参数309B,活跃参数15B。该模型专为高速推理和智能体工作流程设计,采用创新的混合注意力架构和多令牌预测(MTP)技术,在保持先进性能的同时显著降低推理成本。
## 主要能力
- *混合注意力架构**:模型采用滑动窗口注意力(SWA)和全局注意力(GA)交替配置,比例为5:1,窗口大小为128个令牌。通过可学习的注意力sink偏置,在将KV缓存减少近6倍的同时保持长上下文性能。
- *多令牌预测(MTP)**:配备轻量级MTP模块(每块0.33B参数),使用密集前馈网络。该模块在推理期间可将输出速度提升三倍,并加速强化学习训练中的 rollout 过程。
- *高效预训练**:使用FP8混合精度在27T令牌上训练,原生序列长度32k,支持最高256k上下文长度。
- *智能体能力**:通过多教师在线策略蒸馏(MOPD)和大规模智能体强化学习后训练,在SWE-Bench和复杂推理任务上表现出色。
## 输入输出
- *上下文长度**:256k令牌
- *支持的任务类型**:数学推理、代码生成与修复、长上下文理解、中英文理解、智能体任务(工具使用、网页开发等)
运行要求
- *推理精度**:支持FP8混合精度推理
- *推荐框架**:SGLang
- *消费级硬件部署**:通过KTransformers可将MoE专家计算卸载到CPU,在4× RTX 5090 + 2× AMD EPYC 9355配置下可实现最高35.7 tokens/s的解码速度
基本用法
- *系统提示词**:建议使用提供的英文或中文系统提示词
- *采样参数**:
- 数学、写作、网页开发任务:top_p=0.95,temperature=0.8
- 智能体任务(如 vibe-coding、工具使用):top_p=0.95,temperature=0.3
- *多轮工具调用**:在思考模式下的多轮工具调用中,用户需在后续请求的messages数组中保留所有历史推理内容
限制
部分基准测试结果标注星号,表示模型可能无法正确遵循提示词或输出格式要求。
许可证
请参考HuggingFace页面获取具体的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
