闲社服务运行正常AI智能体自动化平台

MiMo-V2-Flash

XiaomiMiMo/MiMo-V2-Flash

发布机构XiaomiMiMo

下载访问条件魔搭来源

MiMo-V2-Flash 是小米开发的大语言模型,采用混合专家(Mixture-of-Experts,MoE)架构,总参数309B,活跃参数15B。该模型专为高速推理和智能体工作流程设计,采用创新的混合注意力架构和多令牌预测(MTP)技术,在保持先进性能的同时显著降低推理成本。 混合注意力架构:模型采用滑动窗口注意力(SWA)和全局注意力(GA)交替配置,比例为5:1,窗口大小为128个令牌。通过可学习的注意力sink偏置,在将KV缓存减少近6倍的同时保持长上下文性能。

文字对话推理思考
模型详情

模型介绍

中文整理

# MiMo-V2-Flash 模型卡片

模型概述

MiMo-V2-Flash 是小米开发的大语言模型,采用混合专家(Mixture-of-Experts,MoE)架构,总参数309B,活跃参数15B。该模型专为高速推理和智能体工作流程设计,采用创新的混合注意力架构和多令牌预测(MTP)技术,在保持先进性能的同时显著降低推理成本。

## 主要能力

  • *混合注意力架构**:模型采用滑动窗口注意力(SWA)和全局注意力(GA)交替配置,比例为5:1,窗口大小为128个令牌。通过可学习的注意力sink偏置,在将KV缓存减少近6倍的同时保持长上下文性能。
  • *多令牌预测(MTP)**:配备轻量级MTP模块(每块0.33B参数),使用密集前馈网络。该模块在推理期间可将输出速度提升三倍,并加速强化学习训练中的 rollout 过程。
  • *高效预训练**:使用FP8混合精度在27T令牌上训练,原生序列长度32k,支持最高256k上下文长度。
  • *智能体能力**:通过多教师在线策略蒸馏(MOPD)和大规模智能体强化学习后训练,在SWE-Bench和复杂推理任务上表现出色。

## 输入输出

  • *上下文长度**:256k令牌
  • *支持的任务类型**:数学推理、代码生成与修复、长上下文理解、中英文理解、智能体任务(工具使用、网页开发等)

运行要求

  • *推理精度**:支持FP8混合精度推理
  • *推荐框架**:SGLang
  • *消费级硬件部署**:通过KTransformers可将MoE专家计算卸载到CPU,在4× RTX 5090 + 2× AMD EPYC 9355配置下可实现最高35.7 tokens/s的解码速度

基本用法

  • *系统提示词**:建议使用提供的英文或中文系统提示词
  • *采样参数**:
  • 数学、写作、网页开发任务:top_p=0.95,temperature=0.8
  • 智能体任务(如 vibe-coding、工具使用):top_p=0.95,temperature=0.3
  • *多轮工具调用**:在思考模式下的多轮工具调用中,用户需在后续请求的messages数组中保留所有历史推理内容

限制

部分基准测试结果标注星号,表示模型可能无法正确遵循提示词或输出格式要求。

许可证

请参考HuggingFace页面获取具体的许可证信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部