模型介绍
中文整理Qwen3.8-Flash-Next
模型概述
Qwen3.8-Flash-Next是支撑Qwen4架构的实验性预览版本,是一个带有视觉编码器的因果语言模型,训练阶段包括预训练和后训练。该模型代表了基础模型向更大参数规模和更长上下文窗口发展的方向,重点在于提升计算效率而非单纯扩展参数数量。
模型用途
该模型适用于需要处理长上下文、多模态理解、代码生成、代理任务等多种场景。模型支持文本、图像和视频输入,可用于代码编写代理、多语言软件工程、办公自动化、专业任务处理、前沿代理任务、工具使用、科学推理、视觉理解等多种应用场景。
主要能力
混合注意力与QSA:采用Gated DeltaNet与Qwen稀疏注意力(QSA)配对,QSA在微块级别操作,显著降低长上下文延迟,特别适合代理工作负载。
门控残差:通过逐元素数据依赖的读门和每分支标量写门来调节信息流,在保持训练稳定性的同时实现更细粒度的表达能力。
N-gram嵌入:通过短n-gram索引实现参数扩展,在内存受限的加速器上高效运行,同时不牺牲质量。
定制训练配方:Muon和AdamW优化器应用于特定权重类别,遵循重拟定的缩放定律,消除了传统的批次大小预热,直接从目标批次大小开始,大幅减少优化器步骤。
输入输出
支持文本、图像、视频三种输入形式。模型默认以思考模式运行,生成思考内容(以\n...\n\n标识)后输出最终回复。用户可通过配置API参数禁用思考内容获得直接回复。输出支持超长内容生成,建议为推理内容设置最大输出262,144个token,为最终回复设置最大输出131,072个token。
运行要求
参数规模:总参数125B,激活参数6B,另有51B n-gram嵌入参数和4B MTP参数。隐藏层维度2560,token嵌入维度248,320。模型层数48层,隐藏层布局为12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))。专家数量512个,激活专家数量为10个路由专家加1个共享专家。上下文长度原生支持262,144个token,可通过RoPE缩放扩展至1,000,000个token。
推荐使用最新版本的推理框架以确保最佳性能和兼容性。建议使用SGLang、KTransformers或vLLM等专业推理引擎进行部署。
基本用法
推荐通过Qwen Cloud API使用以获得简化集成。模型可通过SGLang、vLLM、TokenSpeed等主流推理框架部署。
采样参数建议:思考模式下使用temperature=1.0、top p=0.95、top k=20、min p=0.0、presence penalty=0.0、repetition penalty=1.0;指导模式(非思考模式)使用temperature=0.7、top p=0.80、top k=20、min p=0.0、presence penalty=1.5、repetition penalty=1.0。
对于超长文本处理,当输入输出总长度超过262,144个token时,建议使用YaRN技术(如YaRN)来处理。vLLM、SGLang和TokenSpeed等框架均支持YaRN。
视频理解方面,建议将视频预处理器配置中最长边参数设置为469,762,048(对应224k视频token),以支持小时级视频的高帧率采样。
限制
模型默认保留所有历史消息中的思考块(保留思考),以维护完整的推理链。这一行为对代理场景中的决策一致性和减少冗余推理至关重要,但也可能影响KV缓存利用率。用户可通过设置preserve thinking为False来禁用此行为,仅保留最新用户消息的思考块。
在多轮代理任务中,较低的推理努力不一定能减少整体任务完成时间,可能导致分析不足、更多失败和重试,反而增加总延迟和token消耗。
许可证
该仓库包含Hugging Face Transformers格式的后训练模型权重和配置文件。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
