模型介绍
中文整理模型名称
Mistral-Nemo-Instruct-FP8-2407
模型类型
大型语言模型(LLM),基于Mistral-Nemo-Base-2407的量化指令微调版本
主要能力
在相同或更小规模的模型中表现显著优异。支持128k上下文窗口,训练数据包含大量多语言和代码数据。可作为Mistral 7B的直接替代品。
模型架构
层数:40
维度:5120
头维度:128
隐藏层维度:14336
激活函数:SwiGLU
注意力头数:32
KV头数:8(采用GQA)
词表大小:约128k
旋转位置编码:theta = 1M
基准测试性能
主要基准测试(HellaSwag零样本:83.5%,Winogrande零样本:76.8%,OpenBookQA零样本:60.6%,CommonSenseQA零样本:70.4%,TruthfulQA零样本:50.3%,MMLU五样本:68.0%,TriviaQA五样本:73.8%,NaturalQuestions五样本:31.2%)
多语言MMLU测试(法语:62.3%,德语:62.7%,西班牙语:64.6%,意大利语:61.3%,葡萄牙语:63.3%,俄语:59.2%,中文:59.0%,日语:59.0%)
运行要求
需要使用vLLM库。需安装vLLM最新版本及mistral common库。
基本用法
通过vLLM库进行部署和使用。可在服务器/客户端模式下运行。
限制
该指令微调模型是一个快速演示,表明基础模型可以轻松微调以达到出色的性能。模型目前没有任何内容审核机制。开发团队期待与社区合作,探索如何让模型更好地遵守安全准则,以满足需要内容审核的部署环境需求。
许可证
Apache 2.0许可证
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
