模型介绍
中文整理Qwen3-Next-80B-A3B-Thinking-FP8
模型用途
Qwen3-Next-80B-A3B-Thinking-FP8是一个基于Qwen3-Next系列的首个FP8量化模型,专为复杂推理任务设计。该模型仅支持思考模式(thinking mode),默认聊天模板会自动包含思考提示,因此模型输出仅包含思考内容属于正常现象。
主要能力
该模型采用以下关键技术架构:
混合注意力机制:结合门控DeltaNet和门控注意力,高效处理超长上下文建模。
高稀疏度混合专家模型(MoE):包含512个专家,每次激活10个专家,1个共享专家,实现极低的激活比例,大幅降低每token的FLOPs同时保持模型容量。稳定性优化:采用零中心化和权重衰减的LayerNorm技术,增强预训练和后训练的稳定性。
多Token预测(MTP):提升预训练模型性能并加速推理。
性能表现方面,该模型在复杂推理任务上表现优异,在多项基准测试中超越Qwen3-30B-A3B-Thinking-2507、Qwen3-32B-Thinking以及Gemini-2.5-Flash-Thinking。
输入输出
输入格式:文本提示
输出格式:文本响应,包含思考过程
原生上下文长度:262,144个token
最大可扩展上下文长度:1,010,000个token
运行要求
模型格式:FP8量化(细粒度FP8,块大小128)
推理框架:支持sglang和vllm
推荐配置:4 GPU张量并行
默认上下文长度:256K tokens
内存建议:若遇到内存不足问题,可减少上下文长度;但由于模型推理可能需要更长的token序列,建议上下文长度不低于131,072个token。
基本用法
通过sglang或vllm启动OpenAI兼容的API服务端点。使用sglang时命令示例(4 GPU,256K上下文长度):使用vllm时命令示例类似。
采样参数建议:Temperature=0.6,TopP=0.95,TopK=20,MinP=0。可通过调整presence penalty参数(0到2之间)减少重复输出,但较高值可能导致语言混用和性能下降。
输出长度建议:大多数查询使用32,768个token;数学和编程竞赛等高复杂度基准测试建议设置为81,920个token。
输出格式标准化建议:数学问题提示中加入"Please reason step by step, and put your final answer within \boxed{}.";多选题提示中加入JSON结构指定答案格式。
多轮对话中,历史消息只需包含最终输出部分,无需包含思考内容。
超长文本处理:对于总长度显著超过262,144个token的对话,建议使用RoPE缩放技术。已在YaRN方法下验证模型在100万token上下文长度下的性能。启用YaRN可通过修改config.json的rope scaling字段或通过命令行参数传递。
限制
仅支持思考模式,不支持非思考模式输出。
可能生成比前代模型更长的思考内容。
推荐用于高度复杂的推理任务。
许可证
许可证信息未在该模型卡中明确提供。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
