模型详情
模型介绍
中文整理# Qwen3.6-35B-A3B 模型卡片
模型概述
Qwen3.6-35B-A3B 是阿里云发布的开源大语言模型,包含视觉编码器。该模型基于 Qwen3.5 系列发布后的社区反馈开发,专注于稳定性和实际应用场景,为开发者提供更直观、响应更快、更高效的开发体验。
## 模型类型
- **架构**:因果语言模型,带视觉编码器
- **训练阶段**:预训练和后训练
- **总参数**:350亿
- **激活参数**:30亿
- **隐藏层维度**:2048
- **词表大小**:248320
- **层数**:40
- **上下文长度**:原生支持262,144 tokens,可扩展至1,010,000 tokens
## 主要能力
- *智能编码**:模型在前端工作流和代码仓库级推理方面有显著提升,能够更流畅和精确地处理编码任务。
- *思考保留**:新增选项可保留历史消息中的推理上下文,优化迭代开发流程,减少开销。
- *视觉语言理解**:支持图像和视频理解任务,包括 STEM 问题解答、通用视觉问答、文档理解、空间智能和视频理解等。
- *长上下文处理**:原生支持超长上下文,适合处理复杂的长程任务。
## 输入输出
- *支持输入格式**:
- 纯文本
- 图像(单张或多张)
- 视频
- *输出格式**:文本响应
- *工作模式**:
- 思考模式(默认):模型先生成推理过程,再输出最终答案
- 指令模式(非思考模式):直接输出响应,不包含推理过程
运行要求
- *推荐框架**:SGLang、vLLM、KTransformers、Hugging Face Transformers
- *硬件建议**:
- 使用 8 GPU 进行张量并行推理
- 推荐使用最新版本的推理框架以确保最佳性能和兼容性
- *内存配置**:
- 默认上下文长度为 262,144 tokens
- 如遇内存溢出错误,可考虑减少上下文窗口
- 为保持思考能力,建议至少维持 128K tokens 的上下文长度
- *输出长度建议**:
- 大多数查询建议使用 32,768 tokens
- 复杂数学和编程竞赛类问题建议设置至 81,920 tokens
基本用法
- *API 调用**:通过 OpenAI 兼容 API 调用模型服务
- *采样参数建议**:
- 思考模式(通用任务):temperature=1.0, top_p=0.95, top_k=20, presence_penalty=1.5, repetition_penalty=1.0
- 思考模式(精确编码任务):temperature=0.6, top_p=0.95, top_k=20, presence_penalty=0.0, repetition_penalty=1.0
- 指令模式:temperature=0.7, top_p=0.80, top_k=20, presence_penalty=1.5, repetition_penalty=1.0
- *工具调用**:支持工具调用功能,可通过 Qwen-Agent 或 MCP 配置定义可用工具
- *超长文本处理**:可通过 YaRN 技术扩展上下文处理能力,支持多种推理框架
限制
- 不支持 Qwen3 的软开关功能(/think 和 /nothink)
- 思考模式为默认工作模式,如需直接响应需通过 API 参数配置禁用思考
- 静态 YaRN 缩放因子在不同输入长度下保持恒定,可能对较短文本性能产生影响
- 仅在需要处理长上下文时建议修改 rope 参数配置
许可证
本模型权重和配置文件采用开源许可证发布,具体许可证信息请参阅模型仓库。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
