模型介绍
中文整理# Qwen3.5-35B-A3B-GPTQ-Int4 模型卡片
模型概述
Qwen3.5-35B-A3B-GPTQ-Int4 是一个基于因果语言模型并配备视觉编码器的后训练模型,采用 GPTQ 4-bit量化技术。该模型以 Hugging Face Transformers 格式提供,支持多种推理框架。
## 主要能力
- *统一视觉语言基础**:通过多模态 token 的早期融合训练,在推理、编码、代理和视觉理解基准测试中达到与 Qwen3 相当的跨代水平,优于 Qwen3-VL 模型。
- *高效混合架构**:结合门控 Delta 网络与稀疏专家混合架构,实现高吞吐量推理,最小化延迟和成本开销。
- *可扩展强化学习泛化**:在百万级智能体环境中扩展强化学习,配合逐步复杂的任务分布,实现稳健的真实世界适应性。
- *全球语言覆盖**:扩展支持 201 种语言和方言,支持全球部署,具备细致的文化和区域理解能力。
- *下一代训练基础设施**:多模态训练效率接近文本训练的两倍,异步 RL 框架支持大规模智能体脚手架和环境编排。
## 模型规格
- *参数规模**:总参数 35B,激活参数 3B
- *隐藏层维度**:2048
- *词表大小**:248320
- *层数**:40
- *上下文长度**:原生支持 262,144 tokens,可扩展至 1,010,000 tokens
- *量化方式**:GPTQ 4-bit
## 输入输出
- *支持输入**:文本、图像、视频
- *输出**:文本响应
- *默认模式**:思考模式,模型会在生成最终响应前输出思考内容
运行要求
- *兼容性**:Hugging Face Transformers、vLLM、SGLang、KTransformers
- *推荐框架**:生产环境建议使用 SGLang、vLLM 或 KTransformers 以获得最佳性能和吞吐量
- *内存建议**:如遇内存不足错误,建议减少上下文窗口;为保持思考能力,建议保持至少 128K tokens 的上下文长度
基本用法
- *启动服务**:支持通过 OpenAI 兼容 API 提供服务
- *采样参数建议**:
- 思考模式下通用任务:temperature=1.0, top_p=0.95, top_k=20
- 思考模式下精确编码任务:temperature=0.6, top_p=0.95, top_k=20
- 指令模式(非思考)通用任务:temperature=0.7, top_p=0.8, top_k=20
- 指令模式推理任务:temperature=1.0, top_p=1.0, top_k=40
- *输出长度建议**:大多数查询建议使用 32,768 tokens 输出长度;复杂数学和编程竞赛基准测试建议设置 81,920 tokens
- *禁用思考**:可通过 API 参数配置获取直接响应,参考官方示例
限制
- 不支持 Qwen3 的软切换功能(/think 和 /nothink)
- 默认启用思考模式
- 所有开源框架实现静态 YaRN,扩展因子在短文本上可能影响性能
- 采样参数支持因推理框架而异
许可证
(原始内容中未提供具体许可证信息)
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
