闲社服务运行正常AI智能体自动化平台

Qwen3-Next-80B-A3B-Instruct-GGUF

Qwen/Qwen3-Next-80B-A3B-Instruct-GGUF

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen3-Next-80B-A3B-Instruct Qwen3-Next-80B-A3B-Instruct 是 Qwen3-Next 系列的首个模型,采用纯指令模式(非思考模式),不生成思维过程块。 混合注意力机制:结合 Gated DeltaNet 和 Gated Attention,支持超长上下文建模。

文字对话
模型详情

模型介绍

中文整理

Qwen3-Next-80B-A3B-Instruct

模型概述

Qwen3-Next-80B-A3B-Instruct 是 Qwen3-Next 系列的首个模型,采用纯指令模式(非思考模式),不生成思维过程块。

主要能力

混合注意力机制:结合 Gated DeltaNet 和 Gated Attention,支持超长上下文建模。

高稀疏度混合专家模型:共512位专家,激活10位,共享1位专家,极大降低每token计算量。

稳定性优化:采用零中心化且带权重衰减的LayerNorm等技术。

多Token预测:提升预训练性能并加速推理。

超长上下文支持:原生支持262,144个token,通过YaRN方法可扩展至100万个token。

输入输出

输入:文本提示

输出:文本回复(纯指令模式,不包含思考块)

运行要求

总参数量:800亿

激活参数量:30亿

非嵌入参数量:790亿

隐藏层维度:2048

层数:48层

专家数量:512

激活专家数:10

共享专家数:1

上下文长度:原生262,144 token,可扩展至1,010,000 token

基本用法

推理框架:推荐使用llama.cpp

采样参数建议:Temperature=0.7,TopP=0.8,TopK=20,MinP=0

输出长度:建议使用16,384个token

长文本处理:超过32K token时推荐使用RoPE缩放技术

超长文本:使用YaRN方法处理,可支持最长100万token上下文

Agent使用:推荐使用Qwen-Agent以获得最佳工具调用能力

限制

仅支持指令模式,不生成思维过程块

静态YaRN缩放可能导致较短文本性能下降,建议仅在处理长上下文时启用

许可证

许可证信息未在文档中明确说明

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部