闲社服务运行正常AI智能体自动化平台

AquilaMoE-SFT

BAAI/AquilaMoE-SFT

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

AquilaMoE:基于Scale-Up与Scale-Out策略的高效MoE模型训练 AquilaMoE是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B混合专家(Mixture of Experts,MoE)语言模型。该模型采用创新的EfficientScale训练方法,通过两阶段流程优化性能并最大程度减少数据需求。 AquilaMoE是一款双语(中英文)大语言模型,采用MoE架构,共8个专家模块,每个token激活2个专家,约使用30B参数。模型

文字对话
模型详情

模型介绍

中文整理

AquilaMoE:基于Scale-Up与Scale-Out策略的高效MoE模型训练

模型用途

AquilaMoE是由北京人工智能研究院(BAAI)语言基础模型与软件团队开发的双语8×16B混合专家(Mixture of Experts,MoE)语言模型。该模型采用创新的EfficientScale训练方法,通过两阶段流程优化性能并最大程度减少数据需求。

主要能力

AquilaMoE是一款双语(中英文)大语言模型,采用MoE架构,共8个专家模块,每个token激活2个专家,约使用30B参数。模型支持4096个token的上下文长度。EfficientScale方法包含三个关键阶段:准备阶段、Scale-Up阶段和Scale-Out阶段,实现从小型密集模型到大型MoE模型的高效知识迁移。

输入输出

输入:最长4096个token的中文或英文文本

输出:文本生成

运行要求

该模型基于Aquila3 8×16B配置训练,具体参数如下:

上下文长度:4096

QKV偏置:启用

层数:40

隐藏层维度:5120

中间层维度:20480

KV组:8

训练token数:545B

学习率:1.5e-4

批量大小:24M

基本用法

AquilaMoE基础模型可通过微调获得优异性能。AquilaMoE-SFT为监督微调后的版本,在多项基准测试中表现优异。在AlpacaEval 2.0评估中,AquilaMoE-SFT得分21.1,优于GPT 3.5 Turbo(2023年11月6日版本,得分19.3)和GPT 3.5 Turbo(2023年3月1日版本,得分18.1)。

限制

AquilaMoE Instruct模型仅作为基础模型可轻松微调以获得优异性能的快速演示,未包含任何内容审核机制。团队期待与社区合作,探索如何使模型更好地遵守安全准则,以满足需要内容审核的部署环境需求。

许可证

AquilaMoE项目基于Apache 2.0许可证;AquilaMoE系列模型基于BAAI Aquila模型许可证协议。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部