模型介绍
中文整理AquilaMoE:基于Scale-Up与Scale-Out策略的高效MoE模型训练
模型用途
AquilaMoE是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B混合专家(Mixture of Experts,MoE)语言模型。该模型采用创新的EfficientScale训练方法,通过两阶段流程优化性能并最大程度减少数据需求。
主要能力
AquilaMoE是一款双语(中英文)大语言模型,采用MoE架构,共8个专家模块,每个token激活2个专家,约使用30B参数。模型支持4096个token的上下文长度。EfficientScale方法包含三个关键阶段:准备阶段、Scale-Up阶段和Scale-Out阶段,实现从小型密集模型到大型MoE模型的高效知识迁移。
输入输出
输入:最长4096个token的中文或英文文本
输出:文本生成
运行要求
该模型基于Aquila3 8×16B配置训练,具体参数如下:
上下文长度:4096
QKV偏置:启用
层数:40
隐藏层维度:5120
中间层维度:20480
KV组:8
训练token数:545B
学习率:1.5e-4
批量大小:24M
基本用法
AquilaMoE基础模型可通过微调获得优异性能。AquilaMoE-SFT为监督微调后的版本,在多项基准测试中表现优异。在AlpacaEval 2.0评估中,AquilaMoE-SFT得分21.1,优于GPT 3.5 Turbo(2023年11月6日版本,得分19.3)和GPT 3.5 Turbo(2023年3月1日版本,得分18.1)。
限制
AquilaMoE Instruct模型仅作为基础模型可轻松微调以获得优异性能的快速演示,未包含任何内容审核机制。团队期待与社区合作,探索如何使模型更好地遵守安全准则,以满足需要内容审核的部署环境需求。
许可证
AquilaMoE项目基于Apache 2.0许可证;AquilaMoE系列模型基于BAAI Aquila模型许可证协议。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
