模型介绍
中文整理Mistral-Nemo-Base-2407 模型卡片
模型概述
Mistral-Nemo-Base-2407 是由 Mistral AI 与 NVIDIA 联合训练的 12B 参数预训练生成式文本模型,在相同或更小规模的模型中表现显著优异。
许可证
Apache 2.0
主要能力
支持 128k 上下文窗口训练
训练数据包含大量多语言和代码数据
可作为 Mistral 7B 的直接替代模型
模型架构
Transformer 模型,采用以下架构配置:
层数:40
隐藏维度:5120
头维度:128
前馈维度:14436
激活函数:SwiGLU
注意力头数:32
KV 头数:8(采用 GQA)
词汇表大小:约 128k
旋转嵌入参数:theta = 1M
基准测试
常识推理基准
HellaSwag(0-shot):83.5%
Winogrande(0-shot):76.8%
OpenBookQA(0-shot):60.6%
CommonSenseQA(0-shot):70.4%
TruthfulQA(0-shot):50.3%
知识问答基准
MMLU(5-shot):68.0%
TriviaQA(5-shot):73.8%
NaturalQuestions(5-shot):31.2%
多语言基准(MMLU)
法语:62.3%
德语:62.7%
西班牙语:64.6%
意大利语:61.3%
葡萄牙语:63.3%
俄语:59.2%
中文:59.0%
日语:59.0%
输入输出
输入:文本提示
输出:生成的文本
运行要求
支持三种框架:Mistral Inference、Transformers、NeMo
使用 Transformers 时需从源码安装
推荐温度参数:0.3(与其他 Mistral 模型不同,Nemo 需要较低温度)
基本用法
可通过 Mistral Inference、Transformers 或 NVIDIA NeMo 框架使用
限制说明
Mistral-Nemo-Base-2407 是预训练基础模型,不具备任何内容审核机制
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
