模型介绍
中文整理# Qwen3.6-35B-A3B-FP8 模型卡片
模型概述
Qwen3.6-35B-A3B-FP8 是一个带有视觉编码器的因果语言模型,采用预训练和后训练阶段。该模型是 Qwen3.5 系列的首个开源权重版本,基于社区反馈开发,专注于稳定性和实际应用,为开发者提供更直观、响应更快、更高效的开发体验。
## 主要能力
- *代理编程能力**:模型在处理前端工作流和仓库级推理方面更加流畅和精准,能够更好地完成代码生成、代码修改等开发任务。
- *思考保留功能**:引入新选项,可保留历史消息中的推理上下文,简化迭代开发流程,减少开销。
- *多模态能力**:支持文本、图像和视频输入,具备视觉理解和视频理解能力。
- *工具调用能力**:擅长工具调用,可用于构建代理应用。
## 输入输出格式
- *输入**:支持纯文本、图像、视频输入
- *输出**:文本响应,默认生成思考内容(以\n... \n\n开头),可配置为直接响应模式
- *上下文长度**:原生支持 262,144 个 Token,可扩展至 1,010,000 个 Token
- *输出长度建议**:常规查询建议 32,768 个 Token;数学和编程竞赛等复杂问题建议 81,920 个 Token
运行要求
- *模型规格**:
- 总参数:350 亿
- 激活参数:30 亿
- 专家数量:256 个
- 激活专家:8 个路由专家 + 1 个共享专家
- 隐藏层维度:2048
- 层数:40 层
- *量化方式**:细粒度 FP8 量化,块大小为 128,性能与原始模型几乎相同
- *硬件建议**:推荐使用 8 GPU 进行张量并行
- *兼容框架**:Hugging Face Transformers、vLLM、SGLang、KTransformers
基本用法
- *API 调用**:通过 OpenAI 兼容的 API 调用模型服务
- *采样参数建议**:
- 通用任务思考模式:temperature=1.0, top_p=0.95, top_k=20, presence_penalty=1.5, repetition_penalty=1.0
- 精确编码任务思考模式(如 Web 开发):temperature=0.6, top_p=0.95, top_k=20, presence_penalty=0.0, repetition_penalty=1.0
- 指令模式(非思考模式):temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5, repetition_penalty=1.0
- *思考模式**:模型默认处于思考模式,会在响应前生成推理过程。如需直接响应,需通过 API 参数配置禁用思考。
- *思考保留**:可启用保留历史消息思考轨迹的功能,有助于代理场景中保持推理一致性。
- *长文本处理**:对于超过 262,144 Token 的长程任务,建议使用 YaRN 技术扩展上下文支持。
限制
- 不支持 Qwen3 的软切换功能(/think 和 /nothink)
- 静态 YaRN 缩放因子在不同输入长度下保持不变,可能影响较短文本的性能
- 仅在处理长上下文需求时建议修改 rope 参数配置
许可证
本仓库包含 FP8 量化模型权重和 Hugging Face Transformers 格式的配置文件。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
