模型介绍
中文整理Qwen3-Next-80B-A3B-Instruct
模型概述
Qwen3-Next-80B-A3B-Instruct是Qwen3-Next系列的首款模型,仅支持指令模式(非思考模式),不生成shell命令。
主要能力
混合注意力机制:结合Gated DeltaNet和Gated Attention,实现超长上下文的高效建模。
高稀疏度混合专家模型:MoE层采用极低的激活率,大幅降低每token的FLOPs,同时保持模型容量。
稳定性优化:采用零中心化和权重衰减的LayerNorm等技术,增强预训练和后训练的稳定性。
多Token预测:提升预训练模型性能并加速推理。
性能表现
Qwen3-Next-80B-A3B-Base在下游任务上优于Qwen3-32B-Base,训练成本仅为10%,在超过32K tokens的上下文场景下推理吞吐量提升10倍。
Qwen3-Next-80B-A3B-Instruct在部分基准测试上与Qwen3-235B-A22B-Instruct-2507表现相当,在处理长达256K tokens的超长上下文任务时具有显著优势。
输入输出
输入:用户消息,支持Chat模板格式。
输出:模型生成的文本回复。
运行要求
推荐使用高性能GPU。模型总参数80B,激活参数约3B。
支持Transformers、vLLM(≥0.10.2)、SGLang(≥0.5.2)等推理框架。
标准上下文长度为256K tokens。通过RoPE缩放配置可扩展至约1M tokens。
基本用法
使用Transformers加载模型:
```python
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-Next-80B-A3B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
dtype="auto",
device_map="auto",
)
prompt = "Give me a short introduction to large language model."
messages = [{"role": "user", "content": prompt}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(**model_inputs, max_new_tokens=16384)
output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist()
content = tokenizer.decode(output_ids, skip_special_tokens=True)
print(content)
```
使用vLLM部署:
```bash
vllm serve Qwen/Qwen3-Next-80B-A3B-Instruct --port 8000 --tensor-parallel-size 4 --max-model-len 262144
```
使用SGLang部署:
```bash
python -m sglang.launch server --model-path Qwen/Qwen3-Next-80B-A3B-Instruct --port 30000 --tp-size 4 --context-length 262144 --mem-fraction-static 0.8
```
扩展上下文长度示例(vLLM):
```bash
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":262144}' --max-model-len 1010000
```
限制
仅支持instruct模式,不支持思考模式。
不生成shell命令。
许可证
引用自Qwen3技术报告和Qwen2.5-1M技术报告。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
