闲社服务运行正常AI智能体自动化平台

Mistral-Nemo-Base-2407

mistralai/Mistral-Nemo-Base-2407

发布机构Mistral AI已核实

下载访问条件国内镜像可用

Mistral-Nemo-Base-2407 是由 Mistral AI 与 NVIDIA 联合训练的 12B 参数预训练生成式文本模型,在相同或更小规模的模型中表现显著优异。 可作为 Mistral 7B 的直接替代模型 Transformer 模型,采用以下架构配置:

编程开发
模型详情

模型介绍

中文整理

Mistral-Nemo-Base-2407 模型卡片

模型概述

Mistral-Nemo-Base-2407 是由 Mistral AI 与 NVIDIA 联合训练的 12B 参数预训练生成式文本模型,在相同或更小规模的模型中表现显著优异。

许可证

Apache 2.0

主要能力

支持 128k 上下文窗口训练

训练数据包含大量多语言和代码数据

可作为 Mistral 7B 的直接替代模型

模型架构

Transformer 模型,采用以下架构配置:

层数:40

隐藏维度:5120

头维度:128

前馈维度:14436

激活函数:SwiGLU

注意力头数:32

KV 头数:8(采用 GQA)

词汇表大小:约 128k

旋转嵌入参数:theta = 1M

基准测试

常识推理基准

HellaSwag(0-shot):83.5%

Winogrande(0-shot):76.8%

OpenBookQA(0-shot):60.6%

CommonSenseQA(0-shot):70.4%

TruthfulQA(0-shot):50.3%

知识问答基准

MMLU(5-shot):68.0%

TriviaQA(5-shot):73.8%

NaturalQuestions(5-shot):31.2%

多语言基准(MMLU)

法语:62.3%

德语:62.7%

西班牙语:64.6%

意大利语:61.3%

葡萄牙语:63.3%

俄语:59.2%

中文:59.0%

日语:59.0%

输入输出

输入:文本提示

输出:生成的文本

运行要求

支持三种框架:Mistral Inference、Transformers、NeMo

使用 Transformers 时需从源码安装

推荐温度参数:0.3(与其他 Mistral 模型不同,Nemo 需要较低温度)

基本用法

可通过 Mistral Inference、Transformers 或 NVIDIA NeMo 框架使用

限制说明

Mistral-Nemo-Base-2407 是预训练基础模型,不具备任何内容审核机制

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部