闲社服务运行正常AI智能体自动化平台

Qwen2-0.5B

Qwen/Qwen2-0.5B

发布机构Qwen

下载访问条件魔搭来源

Qwen2是新一代Qwen大语言模型系列。该系列包含从0.5亿到720亿参数不等的基座语言模型和指令微调语言模型,其中包括混合专家模型。此模型库包含0.5B参数的Qwen2基座语言模型。 与当前最先进的开源语言模型(包括此前发布的Qwen1.5)相比,Qwen2在语言理解、语言生成、多语言能力、编码、数学、推理等多项基准测试中表现优异,具有与闭源模型竞争的实力。 Qwen2是一个包含不同参数规模的解码器语言模型系列。每个参数规模都发布基座语言模型和对话微调模型。该模型基于Tr

文字对话推理思考编程开发
模型详情

模型介绍

中文整理

Qwen2-0.5B

简介

Qwen2是新一代Qwen大语言模型系列。该系列包含从0.5亿到720亿参数不等的基座语言模型和指令微调语言模型,其中包括混合专家模型。此模型库包含0.5B参数的Qwen2基座语言模型。

与当前最先进的开源语言模型(包括此前发布的Qwen1.5)相比,Qwen2在语言理解、语言生成、多语言能力、编码、数学、推理等多项基准测试中表现优异,具有与闭源模型竞争的实力。

模型详情

Qwen2是一个包含不同参数规模的解码器语言模型系列。每个参数规模都发布基座语言模型和对话微调模型。该模型基于Transformer架构,使用SwiGLU激活函数、注意力QKV偏置、组查询注意力等技术。此外,还提供了适配多种自然语言和代码的改进分词器。

运行要求

Qwen2代码已集成到最新版的Hugging Face Transformers中。建议安装transformers>=4.37.0版本。

基本用法

不建议将基座语言模型直接用于文本生成。建议对该模型进行后训练,例如监督微调、人类反馈强化学习、持续预训练等。

性能

基座模型的评估主要关注自然语言理解、通用问答、编码、数学、科学知识、推理、多语言能力等方面的模型性能。

评估数据集包括:

英语任务:MMLU(5-shot)、MMLU-Pro(5-shot)、GPQA(5-shot)、Theorem QA(5-shot)、BBH(3-shot)、HellaSwag(10-shot)、Winogrande(5-shot)、TruthfulQA(0-shot)、ARC-C(25-shot)

编码任务:EvalPlus(0-shot)、MultiPL-E(0-shot)

数学任务:GSM8K(4-shot)、MATH(4-shot)

中文任务:C-Eval(5-shot)、CMMLU(5-shot)

多语言任务:Multi-Exam、Multi-Understanding、Multi-Mathematics、Multi-Translation

许可证

如需引用本工作,请引用相关论文。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部