模型介绍
中文整理AquilaMoE 模型卡片
模型名称与开发团队
AquilaMoE 是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B Mixture of Experts(MoE)语言模型。
模型用途
AquilaMoE 是一个大规模双语(中文和英文)语言模型,采用MoE架构设计,用于自然语言处理任务。该模型通过EfficientScale训练方法实现高效训练,在减少数据需求的同时优化性能。
主要能力
该模型支持中英双语处理,具备以下核心能力:
语言理解与生成、问答、代码编写、数学推理、阅读理解等任务。每个token激活8个专家中的2个,约激活30B参数。
输入输出
输入:文本序列,支持最长4096个token的上下文长度。
输出:文本生成结果,包括回答、续写、翻译等多种形式。
运行要求
模型配置:
上下文长度:4096
QKV偏置:启用
层数:40
隐藏层维度:5120
中间层维度:20480
KV组数:8
训练token数:545B
学习率:1.5e-4
批量大小:24M
硬件需求:大规模GPU集群训练,推理需要支持大模型运行的硬件环境。
基本用法
EfficientScale训练流程包含三个阶段:
准备阶段:训练小规模密集模型,准备训练和验证数据集。
Scale-Up阶段:使用小模型权重初始化大模型,进行连续预训练。提供三种权重初始化策略:函数保持初始化(FPI)、高级知识初始化(AKI)、AKI-Pro。
Scale-Out阶段:将密集模型转换为MoE模型,使用Sparse Upcycling方法初始化MoE权重,进行连续预训练。训练中使用负载均衡损失和max z-loss防止训练崩溃。
性能表现
基础模型在多个基准测试上表现优异,随着参数规模增大性能显著提升。微调后的AquilaMoE-SFT在AlpacaEval 2.0测试中达到21.1分,优于GPT 3.5 Turbo。
限制
AquilaMoE Instruct模型是一个快速演示版本,展示基础模型可以通过微调获得良好性能。该模型没有任何内容审核机制,社区可参与讨论如何添加安全防护机制以满足需要内容审核的部署环境需求。
许可证
AquilaMoE项目基于Apache 2.0许可证。AquilaMoE系列模型基于BAAI Aquila模型许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
