闲社服务运行正常AI智能体自动化平台

Qwen3.5-35B-A3B-FP8

Qwen/Qwen3.5-35B-A3B-FP8

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen3.5-35B-A3B-FP8是一个基于Transformer的因果语言模型,支持视觉编码器,采用FP8量化技术。该模型适用于需要强大语言理解、推理、编码和视觉理解能力的应用场景。 该模型具备以下核心能力:统一视觉语言基础,支持多模态理解和生成;高效混合架构,结合门控Delta网络和稀疏专家混合网络实现高吞吐量推理;可扩展的强化学习泛化能力,支持百万级智能体环境训练;支持201种语言和方言;原生上下文长度达262,144个token,可扩展至1,010,000个tok

文字对话图文理解推理思考
模型详情

模型介绍

中文整理

Qwen3.5-35B-A3B-FP8 模型卡片

模型用途

Qwen3.5-35B-A3B-FP8是一个基于Transformer的因果语言模型,支持视觉编码器,采用FP8量化技术。该模型适用于需要强大语言理解、推理、编码和视觉理解能力的应用场景。

主要能力

该模型具备以下核心能力:统一视觉语言基础,支持多模态理解和生成;高效混合架构,结合门控Delta网络和稀疏专家混合网络实现高吞吐量推理;可扩展的强化学习泛化能力,支持百万级智能体环境训练;支持201种语言和方言;原生上下文长度达262,144个token,可扩展至1,010,000个token。

输入输出

输入格式:支持纯文本、图像和视频输入。模型默认以思考模式运行,在生成最终响应前会输出思考内容(以\n... \n\n标识)。输出格式:文本响应,可通过API参数配置禁用思考模式以获得直接响应。

运行要求

推理框架:兼容Hugging Face Transformers、vLLM、SGLang、KTransformers等主流框架。量化方法:细粒度FP8量化,块大小为128,性能与原始模型基本一致。显存建议:建议使用至少8张GPU进行张量并行推理。上下文长度:默认262,144个token,若遇显存不足可降低上下文窗口,但为保持思考能力建议至少保留128K token。

基本用法

通过API调用时,建议根据任务类型选择不同采样参数:通用任务的思考模式推荐temperature=1.0、top p=0.95、top k=20、presence penalty=1.5、repetition penalty=1.0;精确编码任务的思考模式推荐temperature=0.6、top p=0.95、top k=20;非思考模式通用任务推荐temperature=0.7、top p=0.8、top k=20;非思考模式推理任务推荐temperature=1.0、top p=1.0、top k=40。输出长度建议设置为32,768个token以获得最佳效果。

限制

该模型不支持Qwen3的软切换功能(/think和/nothink命令)。模型默认启用思考模式,需通过API参数配置才能获得无思考的直接响应。使用超长上下文时,所有开源框架采用静态YaRN缩放因子,可能对较短文本性能产生影响,建议仅在处理长上下文需求时修改相关配置。

许可证

本模型权重以FP8量化格式发布,具体许可证信息请参阅模型仓库。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部