闲社服务运行正常AI智能体自动化平台

Qwen3-Next-80B-A3B-Instruct

Qwen/Qwen3-Next-80B-A3B-Instruct

发布机构Qwen

下载访问条件魔搭来源

Qwen3-Next-80B-A3B-Instruct Qwen3-Next-80B-A3B-Instruct是Qwen3-Next系列的首款模型,仅支持指令模式(非思考模式),不生成shell命令。 混合注意力机制:结合Gated DeltaNet和Gated Attention,实现超长上下文的高效建模。

文字对话推理思考
模型详情

模型介绍

中文整理

Qwen3-Next-80B-A3B-Instruct

模型概述

Qwen3-Next-80B-A3B-Instruct是Qwen3-Next系列的首款模型,仅支持指令模式(非思考模式),不生成shell命令。

主要能力

混合注意力机制:结合Gated DeltaNet和Gated Attention,实现超长上下文的高效建模。

高稀疏度混合专家模型:MoE层采用极低的激活率,大幅降低每token的FLOPs,同时保持模型容量。

稳定性优化:采用零中心化和权重衰减的LayerNorm等技术,增强预训练和后训练的稳定性。

多Token预测:提升预训练模型性能并加速推理。

性能表现

Qwen3-Next-80B-A3B-Base在下游任务上优于Qwen3-32B-Base,训练成本仅为10%,在超过32K tokens的上下文场景下推理吞吐量提升10倍。

Qwen3-Next-80B-A3B-Instruct在部分基准测试上与Qwen3-235B-A22B-Instruct-2507表现相当,在处理长达256K tokens的超长上下文任务时具有显著优势。

输入输出

输入:用户消息,支持Chat模板格式。

输出:模型生成的文本回复。

运行要求

推荐使用高性能GPU。模型总参数80B,激活参数约3B。

支持Transformers、vLLM(≥0.10.2)、SGLang(≥0.5.2)等推理框架。

标准上下文长度为256K tokens。通过RoPE缩放配置可扩展至约1M tokens。

基本用法

使用Transformers加载模型:

```python

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3-Next-80B-A3B-Instruct"

tokenizer = AutoTokenizer.from_pretrained(model_name)

model = AutoModelForCausalLM.from_pretrained(

model_name,

dtype="auto",

device_map="auto",

)

prompt = "Give me a short introduction to large language model."

messages = [{"role": "user", "content": prompt}]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)

model_inputs = tokenizer([text], return_tensors="pt").to(model.device)

generated_ids = model.generate(**model_inputs, max_new_tokens=16384)

output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist()

content = tokenizer.decode(output_ids, skip_special_tokens=True)

print(content)

```

使用vLLM部署:

```bash

vllm serve Qwen/Qwen3-Next-80B-A3B-Instruct --port 8000 --tensor-parallel-size 4 --max-model-len 262144

```

使用SGLang部署:

```bash

python -m sglang.launch server --model-path Qwen/Qwen3-Next-80B-A3B-Instruct --port 30000 --tp-size 4 --context-length 262144 --mem-fraction-static 0.8

```

扩展上下文长度示例(vLLM):

```bash

VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":262144}' --max-model-len 1010000

```

限制

仅支持instruct模式,不支持思考模式。

不生成shell命令。

许可证

引用自Qwen3技术报告和Qwen2.5-1M技术报告。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部