模型详情
模型介绍
中文整理# Qwen3.5-0.8B 模型卡片
模型用途
该模型为后训练模型,采用Hugging Face Transformers格式存储。适用于原型开发、任务特定微调及其他研究开发用途。模型支持与Hugging Face Transformers、vLLM、SGLang、KTransformers等框架兼容运行。
## 主要能力
- *模型类型**:带视觉编码器的因果语言模型
- *训练阶段**:预训练与后训练
- *语言模型参数**:
- 参数量:0.8B
- 隐藏层维度:1024
- 词表大小:248320
- 层数:24
- 上下文长度:262144个token
- *架构特点**:
- Gated Delta Networks与稀疏专家混合架构
- 多步预测训练(MTP)
- 支持多语言:涵盖201种语言和方言
- *运行模式**:
- 支持非思考模式和思考模式
- 0.8B版本默认运行在非思考模式
## 输入输出
- *输入格式**:
- 纯文本输入
- 图像输入
- 视频输入
- *输出格式**:
- 文本回复
- 通过Chat Completions API调用
运行要求
- *兼容框架**:
- Hugging Face Transformers(需最新版本)
- vLLM(需主分支版本)
- SGLang(需主分支版本)
- KTransformers
- *内存要求**:
- 默认上下文长度为262144个token
- 如遇内存溢出错误,建议减小上下文窗口
- *依赖环境**:
- transformers
- torchvision
- pillow
基本用法
- *API服务启动**:
可通过SGLang、vLLM等推理框架启动OpenAI兼容的API服务。
- *采样参数建议**:
- 非思考模式文本任务:temperature=1.0, top p=1.00, top k=20, presence penalty=2.0, repetition penalty=1.0
- 非思考模式视觉任务:temperature=0.7, top p=0.80, top k=20, presence penalty=1.5, repetition penalty=1.0
- 思考模式文本任务:temperature=1.0, top p=0.95, top k=20, presence penalty=1.5, repetition penalty=1.0
- 思考模式视觉或精确编码任务:temperature=0.6, top p=0.95, top k=20, presence penalty=0.0, repetition penalty=1.0
- *输出长度建议**:
- 大多数查询建议使用32768个token的输出长度
- 数学和编程竞赛等复杂问题建议设置为81920个token
限制
- *思考模式限制**:
- 0.8B版本默认运行在非思考模式
- 在思考模式下使用推荐采样参数时,0.8B版本相比其他Qwen3.5模型更容易进入思考循环,可能导致无法正常终止生成
- 建议根据具体使用场景进一步调整采样参数,并利用流式生成模式及时检测和中断异常生成行为
- *软切换限制**:
- Qwen3.5不支持Qwen3的软切换功能(/think和/nothink命令)
许可证
请参阅模型仓库中的许可证文件。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
