模型介绍
中文整理Qwen2-0.5B
简介
Qwen2是新一代Qwen大语言模型系列。该系列包含从0.5亿到720亿参数不等的基座语言模型和指令微调语言模型,其中包括混合专家模型。此模型库包含0.5B参数的Qwen2基座语言模型。
与当前最先进的开源语言模型(包括此前发布的Qwen1.5)相比,Qwen2在语言理解、语言生成、多语言能力、编码、数学、推理等多项基准测试中表现优异,具有与闭源模型竞争的实力。
模型详情
Qwen2是一个包含不同参数规模的解码器语言模型系列。每个参数规模都发布基座语言模型和对话微调模型。该模型基于Transformer架构,使用SwiGLU激活函数、注意力QKV偏置、组查询注意力等技术。此外,还提供了适配多种自然语言和代码的改进分词器。
运行要求
Qwen2代码已集成到最新版的Hugging Face Transformers中。建议安装transformers>=4.37.0版本。
基本用法
不建议将基座语言模型直接用于文本生成。建议对该模型进行后训练,例如监督微调、人类反馈强化学习、持续预训练等。
性能
基座模型的评估主要关注自然语言理解、通用问答、编码、数学、科学知识、推理、多语言能力等方面的模型性能。
评估数据集包括:
英语任务:MMLU(5-shot)、MMLU-Pro(5-shot)、GPQA(5-shot)、Theorem QA(5-shot)、BBH(3-shot)、HellaSwag(10-shot)、Winogrande(5-shot)、TruthfulQA(0-shot)、ARC-C(25-shot)
编码任务:EvalPlus(0-shot)、MultiPL-E(0-shot)
数学任务:GSM8K(4-shot)、MATH(4-shot)
中文任务:C-Eval(5-shot)、CMMLU(5-shot)
多语言任务:Multi-Exam、Multi-Understanding、Multi-Mathematics、Multi-Translation
许可证
如需引用本工作,请引用相关论文。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
