闲社服务运行正常AI智能体自动化平台

Mistral-Nemo-Instruct-FP8-2407

mistralai/Mistral-Nemo-Instruct-FP8-2407

发布机构Mistral AI已核实

下载访问条件国内镜像可用

Mistral-Nemo-Instruct-FP8-2407 大型语言模型(LLM),基于Mistral-Nemo-Base-2407的量化指令微调版本 在相同或更小规模的模型中表现显著优异。支持128k上下文窗口,训练数据包含大量多语言和代码数据。可作为Mistral 7B的直接替代品。

编程开发
模型详情

模型介绍

中文整理

模型名称

Mistral-Nemo-Instruct-FP8-2407

模型类型

大型语言模型(LLM),基于Mistral-Nemo-Base-2407的量化指令微调版本

主要能力

在相同或更小规模的模型中表现显著优异。支持128k上下文窗口,训练数据包含大量多语言和代码数据。可作为Mistral 7B的直接替代品。

模型架构

层数:40

维度:5120

头维度:128

隐藏层维度:14336

激活函数:SwiGLU

注意力头数:32

KV头数:8(采用GQA)

词表大小:约128k

旋转位置编码:theta = 1M

基准测试性能

主要基准测试(HellaSwag零样本:83.5%,Winogrande零样本:76.8%,OpenBookQA零样本:60.6%,CommonSenseQA零样本:70.4%,TruthfulQA零样本:50.3%,MMLU五样本:68.0%,TriviaQA五样本:73.8%,NaturalQuestions五样本:31.2%)

多语言MMLU测试(法语:62.3%,德语:62.7%,西班牙语:64.6%,意大利语:61.3%,葡萄牙语:63.3%,俄语:59.2%,中文:59.0%,日语:59.0%)

运行要求

需要使用vLLM库。需安装vLLM最新版本及mistral common库。

基本用法

通过vLLM库进行部署和使用。可在服务器/客户端模式下运行。

限制

该指令微调模型是一个快速演示,表明基础模型可以轻松微调以达到出色的性能。模型目前没有任何内容审核机制。开发团队期待与社区合作,探索如何让模型更好地遵守安全准则,以满足需要内容审核的部署环境需求。

许可证

Apache 2.0许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部