闲社服务运行正常AI智能体自动化平台

AquilaDense-16B

BAAI/AquilaDense-16B

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

AquilaMoE:高效的大规模MoE模型训练方法 AquilaMoE是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B混合专家(Mixture of Experts)语言模型。该模型采用创新的EfficientScale训练方法,通过两阶段流程(Scale-Up扩展和Scale-Out扩展)在优化性能的同时最大程度减少数据需求。 AquilaMoE模型系列随着参数规模增大,在多项任务上的性能显著提升。Scale-Up和Scale-Out策略均能有效

文字对话
模型详情

模型介绍

中文整理

AquilaMoE:高效的大规模MoE模型训练方法

模型用途

AquilaMoE是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B混合专家(Mixture of Experts)语言模型。该模型采用创新的EfficientScale训练方法,通过两阶段流程(Scale-Up扩展和Scale-Out扩展)在优化性能的同时最大程度减少数据需求。

主要能力

AquilaMoE模型系列随着参数规模增大,在多项任务上的性能显著提升。Scale-Up和Scale-Out策略均能有效增强模型表现。

基础模型评估结果显示,AquilaMoE-8×16B在ARC-c任务上达到43.05分,ARC-e任务达65.61分,hellaswag任务达73.94分,gsm8k数学推理任务达54.51分,mmlu任务达61分,bbh任务达46.04分。

微调后的AquilaMoE-SFT在各项基准上进一步提升:gsm8k达71.27分,humaneval代码任务达40.24分,mmlu达59.93分。在AlpacaEval 2.0评测中,AquilaMoE-SFT得分21.1,优于GPT 3.5 Turbo(11/06版本19.3分,03/01版本18.1分)。

输入输出

该模型支持4096个token的上下文长度。输入为中英文文本,输出为文本生成结果。训练和推理时每个token激活8个专家中的2个,共使用约300亿参数。

运行要求

模型为8×16B规模的MoE架构,包含40层Transformer结构,隐藏维度5120,中间维度20480。推理时需支持大规模参数加载。

基本用法

AquilaMoE基础模型可通过微调实现优异性能。用户可基于下游任务对模型进行指令微调(SFT)以适配具体应用场景。

限制

AquilaMoE Instruct模型仅作为基础模型易微调获得优异性能的快速演示,未内置任何内容审核机制。模型可能产生不当输出,部署于需要内容审核的环境时需自行添加相应机制。

许可证

AquilaMoE项目基于Apache 2.0许可证。AquilaMoE系列模型基于BAAI Aquila模型许可证协议。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部