闲社服务运行正常AI智能体自动化平台

Qwen3-Next-80B-A3B-Thinking-FP8

Qwen/Qwen3-Next-80B-A3B-Thinking-FP8

发布机构Qwen

下载访问条件魔搭来源

Qwen3-Next-80B-A3B-Thinking-FP8 Qwen3-Next-80B-A3B-Thinking-FP8是一个基于Qwen3-Next系列的首个FP8量化模型,专为复杂推理任务设计。该模型仅支持思考模式(thinking mode),默认聊天模板会自动包含思考提示,因此模型输出仅包含思考内容属于正常现象。 混合注意力机制:结合门控DeltaNet和门控注意力,高效处理超长上下文建模。

文字对话推理思考
模型详情

模型介绍

中文整理

Qwen3-Next-80B-A3B-Thinking-FP8

模型用途

Qwen3-Next-80B-A3B-Thinking-FP8是一个基于Qwen3-Next系列的首个FP8量化模型,专为复杂推理任务设计。该模型仅支持思考模式(thinking mode),默认聊天模板会自动包含思考提示,因此模型输出仅包含思考内容属于正常现象。

主要能力

该模型采用以下关键技术架构:

混合注意力机制:结合门控DeltaNet和门控注意力,高效处理超长上下文建模。

高稀疏度混合专家模型(MoE):包含512个专家,每次激活10个专家,1个共享专家,实现极低的激活比例,大幅降低每token的FLOPs同时保持模型容量。稳定性优化:采用零中心化和权重衰减的LayerNorm技术,增强预训练和后训练的稳定性。

多Token预测(MTP):提升预训练模型性能并加速推理。

性能表现方面,该模型在复杂推理任务上表现优异,在多项基准测试中超越Qwen3-30B-A3B-Thinking-2507、Qwen3-32B-Thinking以及Gemini-2.5-Flash-Thinking。

输入输出

输入格式:文本提示

输出格式:文本响应,包含思考过程

原生上下文长度:262,144个token

最大可扩展上下文长度:1,010,000个token

运行要求

模型格式:FP8量化(细粒度FP8,块大小128)

推理框架:支持sglang和vllm

推荐配置:4 GPU张量并行

默认上下文长度:256K tokens

内存建议:若遇到内存不足问题,可减少上下文长度;但由于模型推理可能需要更长的token序列,建议上下文长度不低于131,072个token。

基本用法

通过sglang或vllm启动OpenAI兼容的API服务端点。使用sglang时命令示例(4 GPU,256K上下文长度):使用vllm时命令示例类似。

采样参数建议:Temperature=0.6,TopP=0.95,TopK=20,MinP=0。可通过调整presence penalty参数(0到2之间)减少重复输出,但较高值可能导致语言混用和性能下降。

输出长度建议:大多数查询使用32,768个token;数学和编程竞赛等高复杂度基准测试建议设置为81,920个token。

输出格式标准化建议:数学问题提示中加入"Please reason step by step, and put your final answer within \boxed{}.";多选题提示中加入JSON结构指定答案格式。

多轮对话中,历史消息只需包含最终输出部分,无需包含思考内容。

超长文本处理:对于总长度显著超过262,144个token的对话,建议使用RoPE缩放技术。已在YaRN方法下验证模型在100万token上下文长度下的性能。启用YaRN可通过修改config.json的rope scaling字段或通过命令行参数传递。

限制

仅支持思考模式,不支持非思考模式输出。

可能生成比前代模型更长的思考内容。

推荐用于高度复杂的推理任务。

许可证

许可证信息未在该模型卡中明确提供。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部