模型介绍
中文整理模型名称:Mistral-Nemo-Instruct-2407
模型用途
Mistral-Nemo-Instruct-2407 是一个大语言模型(LLM),基于 Mistral-Nemo-Base-2407 进行指令微调。由 Mistral AI 与 NVIDIA 联合训练,在参数规模相近或更小的模型中表现优异。
主要能力
支持 128k 上下文窗口训练。训练数据包含大量多语言和代码数据。可作为 Mistral 7B 的直接替代方案。支持函数调用功能。
模型架构
Transformer 模型,包含 40 层。隐藏维度为 5120,头维度为 128,前馈隐藏维度为 14336。激活函数采用 SwiGLU。注意力头数为 32,KV 头数为 8(采用 GQA)。词表大小约为 128k。采用 Rotary embeddings(theta = 1M)。
基准测试性能
主要基准测试(零样本):HellaSwag 83.5%、Winogrande 76.8%、OpenBookQA 60.6%、CommonSenseQA 70.4%、TruthfulQA 50.3%。主要基准测试(五样本):MMLU 68.0%、TriviaQA 73.8%、NaturalQuestions 31.2%。多语言 MMLU:西班牙语 64.6%、葡萄牙语 63.3%、德语 62.7%、法语 62.3%、意大利语 61.3%、俄语 59.2%、中文 59.0%、日语 59.0%。
运行要求
支持三种框架:Mistral Inference、Transformers、NeMo。使用 Transformers 时需从源码安装,建议版本 4.42.0 或更高。建议使用较低的温度参数,推荐值为 0.3。
基本用法
可通过 mistral-inference 的 mistral-chat 命令进行对话。使用 Transformers 生成文本时需加载模型并调用生成接口。函数调用功能需在工具调用和结果中包含 9 位字母数字字符的调用 ID。
限制
该指令微调模型是对基础模型微调效果的快速演示,没有内置任何内容审核机制。在需要内容审核的环境中部署时需自行添加相应防护措施。
许可证
Apache 2.0 许可证
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
