模型详情
模型介绍
中文整理# Qwen3.5-2B 模型卡片
模型概述
Qwen3.5-2B 是一个带有视觉编码器的因果语言模型,采用预训练和后训练相结合的方式构建。该模型参数量为20亿,原生支持262,144个token的上下文长度。
模型用途
该模型主要用于原型开发、任务特定微调以及其他研究和开发目的。鉴于其参数规模,不建议直接用于生产环境。
## 主要能力
- *统一视觉语言基础**:通过多模态token的早期融合训练,在推理、编码、代理和视觉理解基准测试中达到与Qwen3相当的跨代水平。
- *高效混合架构**:结合门控Delta网络与稀疏专家混合架构,实现高吞吐量推理,最小化延迟和成本开销。
- *可扩展强化学习泛化**:在百万级智能体环境中扩展强化学习,采用逐步复杂的任务分布,实现稳健的实时世界适应性。
- *全球语言覆盖**:扩展支持201种语言和方言,支持全球部署,具备细致的文化和区域理解能力。
- *下一代训练基础设施**:与纯文本训练相比,多模态训练效率接近100%,支持异步强化学习框架,可处理大规模智能体脚手架和环境编排。
## 输入输出
- *支持输入类型**:纯文本、图像、视频
- *输出模式**:支持非思考模式和思考模式两种生成方式。Qwen3.5-2B默认运行在非思考模式。
- *上下文长度**:原生支持262,144个token
运行要求
- *兼容框架**:Hugging Face Transformers、vLLM、SGLang、KTransformers
- *内存要求**:默认上下文长度为262,144个token。如遇内存溢出错误,建议减小上下文窗口大小。
- *推荐配置**:对于生产环境或高吞吐量场景,推荐使用SGLang、KTransformers或vLLM等专业推理引擎。
基本用法
- *API调用**:支持OpenAI兼容的API接口,可通过标准HTTP请求或OpenAI SDK调用。
- *采样参数建议**:
- 非思考模式文本任务:temperature=1.0, top p=1.00, top k=20, presence penalty=2.0, repetition penalty=1.0
- 非思考模式视觉语言任务:temperature=0.7, top p=0.80, top k=20, presence penalty=1.5, repetition penalty=1.0
- 思考模式文本任务:temperature=1.0, top p=0.95, top k=20, presence penalty=1.5, repetition penalty=1.0
- 思考模式视觉语言或精确编码任务:temperature=0.6, top p=0.95, top k=20, presence penalty=0.0, repetition penalty=1.0
- *输出长度建议**:大多数查询建议使用32,768个token的输出长度。对于数学和编程竞赛等高度复杂问题的基准测试,建议将最大输出长度设置为81,920个token。
- *思考模式启用**:Qwen3.5不支持软切换功能(/think和/nothink)。需通过API参数配置启用思考模式。
限制
- *思考模式限制**:在思考模式下使用推荐采样参数时,Qwen3.5-2B相比其他Qwen3.5模型更容易进入思考循环,可能导致生成无法正常终止。建议根据具体使用场景进一步调整采样参数,并利用API的流式生成模式以便及时检测和中断异常生成行为。
- *默认模式**:Qwen3.5-2B默认运行在非思考模式。
许可证
原始资料中未提供具体的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
