模型介绍
中文整理Qwen3-Next-80B-A3B-Instruct
模型概述
Qwen3-Next-80B-A3B-Instruct 是 Qwen3-Next 系列的首个模型,采用纯指令模式(非思考模式),不生成思维过程块。
主要能力
混合注意力机制:结合 Gated DeltaNet 和 Gated Attention,支持超长上下文建模。
高稀疏度混合专家模型:共512位专家,激活10位,共享1位专家,极大降低每token计算量。
稳定性优化:采用零中心化且带权重衰减的LayerNorm等技术。
多Token预测:提升预训练性能并加速推理。
超长上下文支持:原生支持262,144个token,通过YaRN方法可扩展至100万个token。
输入输出
输入:文本提示
输出:文本回复(纯指令模式,不包含思考块)
运行要求
总参数量:800亿
激活参数量:30亿
非嵌入参数量:790亿
隐藏层维度:2048
层数:48层
专家数量:512
激活专家数:10
共享专家数:1
上下文长度:原生262,144 token,可扩展至1,010,000 token
基本用法
推理框架:推荐使用llama.cpp
采样参数建议:Temperature=0.7,TopP=0.8,TopK=20,MinP=0
输出长度:建议使用16,384个token
长文本处理:超过32K token时推荐使用RoPE缩放技术
超长文本:使用YaRN方法处理,可支持最长100万token上下文
Agent使用:推荐使用Qwen-Agent以获得最佳工具调用能力
限制
仅支持指令模式,不生成思维过程块
静态YaRN缩放可能导致较短文本性能下降,建议仅在处理长上下文时启用
许可证
许可证信息未在文档中明确说明
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
