模型介绍
中文整理AquilaMoE:高效的大规模MoE模型训练方法
模型用途
AquilaMoE是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B混合专家(Mixture of Experts)语言模型。该模型采用创新的EfficientScale训练方法,通过两阶段流程(Scale-Up扩展和Scale-Out扩展)在优化性能的同时最大程度减少数据需求。
主要能力
AquilaMoE模型系列随着参数规模增大,在多项任务上的性能显著提升。Scale-Up和Scale-Out策略均能有效增强模型表现。
基础模型评估结果显示,AquilaMoE-8×16B在ARC-c任务上达到43.05分,ARC-e任务达65.61分,hellaswag任务达73.94分,gsm8k数学推理任务达54.51分,mmlu任务达61分,bbh任务达46.04分。
微调后的AquilaMoE-SFT在各项基准上进一步提升:gsm8k达71.27分,humaneval代码任务达40.24分,mmlu达59.93分。在AlpacaEval 2.0评测中,AquilaMoE-SFT得分21.1,优于GPT 3.5 Turbo(11/06版本19.3分,03/01版本18.1分)。
输入输出
该模型支持4096个token的上下文长度。输入为中英文文本,输出为文本生成结果。训练和推理时每个token激活8个专家中的2个,共使用约300亿参数。
运行要求
模型为8×16B规模的MoE架构,包含40层Transformer结构,隐藏维度5120,中间维度20480。推理时需支持大规模参数加载。
基本用法
AquilaMoE基础模型可通过微调实现优异性能。用户可基于下游任务对模型进行指令微调(SFT)以适配具体应用场景。
限制
AquilaMoE Instruct模型仅作为基础模型易微调获得优异性能的快速演示,未内置任何内容审核机制。模型可能产生不当输出,部署于需要内容审核的环境时需自行添加相应机制。
许可证
AquilaMoE项目基于Apache 2.0许可证。AquilaMoE系列模型基于BAAI Aquila模型许可证协议。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
