模型介绍
中文整理AquilaMoE:高效的大规模MoE模型训练方法
模型用途
AquilaMoE是由北京人工智能研究院(BAAI)开发的双语8×16B混合专家(Mixture of Experts)语言模型,采用创新的EfficientScale训练方法,通过两阶段流程(Scale-Up扩展和Scale-Out扩展)在减少数据需求的同时优化性能。
主要能力
该模型支持中英双语处理,在连续预训练过程中保持并降低损失。EfficientScale方法利用从较小模型转移的知识,实现高效的大规模模型训练,显著提升训练效率。模型在多项基准测试中表现优异,随着参数规模增加,性能持续提升。
输入输出
输入:文本(中文或英文)
输出:文本(中文或英文)
运行要求
模型为8×16B架构,每个token激活8个专家中的2个,使用约300亿参数。上下文长度为4096。训练时使用load balancing loss和max z-loss防止训练崩溃。
基本用法
AquilaMoE基础模型可轻松微调以实现优异性能。AquilaMoE-SFT是经过监督微调的版本,在多项基准测试中表现良好。
限制
AquilaMoE Instruct模型仅作为演示版本,展示基础模型可被轻松微调以达到优异性能。该模型不具备任何内容审核机制。期待与社区合作,探索如何使模型更好地遵守安全准则,以满足需要内容审核的部署环境需求。
许可证
AquilaMoE项目基于Apache 2.0许可证;AquilaMoE系列模型基于BAAI Aquila模型许可证协议。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
