模型介绍
中文整理Qwen3.8-27B-FP8
模型用途
Qwen3.8-27B-FP8是一个后训练量化模型,采用FP8细粒度量化(块大小128),兼容Hugging Face Transformers、vLLM、SGLang、TokenSpeed等推理框架。该模型是基于Qwen3.5架构开发的稠密模型,参数量27B,原生支持视觉语言理解,可处理图像和视频输入,适用于复杂的多步骤任务。主要能力
核心能力:编码、专业工作、研究和长程代理任务方面的全面改进。代理执行能力:更强的自主规划能力和环境反馈处理能力,实现更可靠的端到端任务完成。下游兼容性:支持主流评测框架和开发工具,便于集成到现有技术栈。灵活思考控制:思考模式默认开启,可按请求禁用;可通过reasoning effort调节推理深度;通过preserve thinking保留历史消息的推理上下文。视觉语言理解:原生支持图像和视频理解,可处理STEM图表、文档以及时长数小时的视频。
输入输出
支持纯文本、图像和视频三种输入形式。上下文长度原生支持262,144个token,可扩展至1,000,000个token。模型默认处于思考模式,会在生成最终回复前输出思考内容。
运行要求
推荐使用最新版本的推理框架以确保最佳性能和兼容性。生产环境或高吞吐量场景建议使用专用推理引擎,如SGLang、vLLM或TokenSpeed。
基本用法
思考模式与推理控制:模型默认开启思考模式,生成以\n... \n\n标识的思考内容后输出最终回复。可通过设置enable thinking为false禁用思考模式。preserve thinking默认开启,保留所有历史消息的思考块以维持完整的推理链;可通过设置preserve thinking为false仅保留最新用户消息的思考块。推理深度可通过reasoning effort参数调节:xhigh(默认)适用于需要深入分析的复杂任务,medium平衡准确性和速度,low优化速度和成本。
采样参数建议:思考模式推荐temperature=1.0、top p=0.95、top k=20、min p=0.0、presence penalty=0.0、repetition penalty=1.0。指导模式(非思考模式)推荐temperature=0.7、top p=0.80、top k=20、min p=0.0、presence penalty=1.5、repetition penalty=1.0。
超长文本处理:模型原生支持262,144个token的上下文长度。对于总长度超过此限制的长程任务,建议使用RoPE缩放技术(如YaRN)处理。YaRN目前支持vLLM、SGLang和TokenSpeed。注意:开源框架实现的静态YaRN缩放因子是固定的,无论输入长度如何,可能影响较短文本的性能。建议仅在处理长上下文时修改rope参数配置。
长视频理解:视频预处理器配置中的size参数经过保守配置。建议将视频预处理器配置文件中的longest edge参数设置为469,762,048(对应224k视频token),以支持更高帧率采样,从而在长视频上实现更优性能。
限制
模型默认处于思考模式,会在最终回复前生成思考内容,可能增加输出token数量和延迟。在多轮代理任务中,较低的推理 effort不一定能减少总体任务完成时间;虽然单轮响应更快,但可能导致分析不足、更多失败和重试,反而增加总延迟和token消耗。静态YaRN的缩放因子是固定的,可能对较短文本的性能产生负面影响。
许可证
原始卡片中未包含许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
