闲社服务运行正常AI智能体自动化平台

Mistral-Nemo-Instruct-2407

mistralai/Mistral-Nemo-Instruct-2407

发布机构Mistral AI已核实

下载访问条件国内镜像可用

Mistral-Nemo-Instruct-2407 是一个大语言模型(LLM),基于 Mistral-Nemo-Base-2407 进行指令微调。由 Mistral AI 与 NVIDIA 联合训练,在参数规模相近或更小的模型中表现优异。 支持 128k 上下文窗口训练。训练数据包含大量多语言和代码数据。可作为 Mistral 7B 的直接替代方案。支持函数调用功能。 Transformer 模型,包含 40 层。隐藏维度为 5120,头维度为 128,前馈隐藏维度为 14

编程开发
模型详情

模型介绍

中文整理

模型名称:Mistral-Nemo-Instruct-2407

模型用途

Mistral-Nemo-Instruct-2407 是一个大语言模型(LLM),基于 Mistral-Nemo-Base-2407 进行指令微调。由 Mistral AI 与 NVIDIA 联合训练,在参数规模相近或更小的模型中表现优异。

主要能力

支持 128k 上下文窗口训练。训练数据包含大量多语言和代码数据。可作为 Mistral 7B 的直接替代方案。支持函数调用功能。

模型架构

Transformer 模型,包含 40 层。隐藏维度为 5120,头维度为 128,前馈隐藏维度为 14336。激活函数采用 SwiGLU。注意力头数为 32,KV 头数为 8(采用 GQA)。词表大小约为 128k。采用 Rotary embeddings(theta = 1M)。

基准测试性能

主要基准测试(零样本):HellaSwag 83.5%、Winogrande 76.8%、OpenBookQA 60.6%、CommonSenseQA 70.4%、TruthfulQA 50.3%。主要基准测试(五样本):MMLU 68.0%、TriviaQA 73.8%、NaturalQuestions 31.2%。多语言 MMLU:西班牙语 64.6%、葡萄牙语 63.3%、德语 62.7%、法语 62.3%、意大利语 61.3%、俄语 59.2%、中文 59.0%、日语 59.0%。

运行要求

支持三种框架:Mistral Inference、Transformers、NeMo。使用 Transformers 时需从源码安装,建议版本 4.42.0 或更高。建议使用较低的温度参数,推荐值为 0.3。

基本用法

可通过 mistral-inference 的 mistral-chat 命令进行对话。使用 Transformers 生成文本时需加载模型并调用生成接口。函数调用功能需在工具调用和结果中包含 9 位字母数字字符的调用 ID。

限制

该指令微调模型是对基础模型微调效果的快速演示,没有内置任何内容审核机制。在需要内容审核的环境中部署时需自行添加相应防护措施。

许可证

Apache 2.0 许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部