模型介绍
中文整理# Qwen3.8-Flash-Next-FP8 模型卡片
模型概述
Qwen3.8-Flash-Next-FP8 是一个基于 FP8 量化权重和配置的因果语言模型,包含视觉编码器。该模型采用细粒度 FP8 量化方法,块大小为 128,性能与原始模型几乎一致。
## 主要能力
- *语言模型能力**
- 混合注意力机制:结合 Gated DeltaNet 与 Qwen 稀疏注意力(QSA),在微块级别操作,显著降低长上下文延迟
- Gated Residual:通过元素级数据依赖的读门和每分支标量写门调制信息流,在保持训练稳定性的同时实现细粒度表达能力
- N-gram 嵌入:通过短 n-gram 索引实现高效参数扩展,适用于内存受限的加速器
- 上下文长度:原生支持 262,144 个 token,可扩展至 1,000,000 个 token
- *视觉语言能力**
- 多模态工具使用
- 应用重建
- 移动设备使用
- 计算机使用
- 视觉网页开发
- 具身智能
- 长视频理解
- 视觉数学问题求解
- 科学图表分析
## 输入输出
- *输入格式**
- 纯文本输入
- 图像输入
- 视频输入
- *输出格式**
- 默认启用思考模式,生成思考内容(以\n... \n\n标识)后输出最终回复
- 支持禁用思考模式以获取直接回复
运行要求
- *兼容性**
- Hugging Face Transformers
- vLLM
- SGLang
- TokenSpeed
- *量化规格**
- 细粒度 FP8 量化
- 块大小:128
- *推荐配置**
- 生产环境或高吞吐量场景推荐使用专用推理引擎:SGLang、KTransformers 或 vLLM
- 建议使用最新框架版本以确保最佳性能和兼容性
基本用法
- *采样参数**
思考模式:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
指令模式(非思考模式):temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
- *思考行为控制**
支持通过 enable_thinking、preserve_thinking 和 reasoning_effort 参数控制思考行为。
- *超长文本处理**
原生支持 262,144 token 上下文长度。超出此限制的长程任务建议使用 RoPE 缩放技术(如 YaRN)。当前开源框架均实现静态 YaRN,缩放因子不随输入长度变化,可能影响短文本性能。建议仅在处理长上下文时修改 rope 参数配置。
- *输出长度建议**
为优化智能体任务性能,建议分配充足输出长度:
- 推理内容:最大输出长度 262,144 token
- 最终回复:最大输出长度 131,072 token
注意事项
- 思考模式默认启用,如需直接回复需通过 API 参数配置禁用
- 多轮智能体任务中,较低的推理投入不一定减少总体任务完成时间,可能导致分析不足、更多失败和重试,反而增加总体延迟和 token 消耗
- 采样参数支持因推理框架而异
许可证
请参考模型仓库中的许可证文件。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
