模型介绍
中文整理# Qwen3.5-122B-A10B-FP8 模型卡片
模型概述
Qwen3.5-122B-A10B-FP8 是一个包含视觉编码器的因果语言模型,采用 FP8 量化技术。该模型基于 Hugging Face Transformers 格式,提供后训练权重和配置文件,兼容多种推理框架。
## 模型架构
总参数量:1220 亿
激活参数量:100 亿
隐藏层维度:3072
词表大小:248320
层数:48
上下文长度:原生支持 262144 个 Token,最大可扩展至 101 万个 Token
## 主要能力
统一视觉语言基础:采用多模态 Token 早期融合训练,在推理、编码、代理和视觉理解基准测试中达到与 Qwen3 相当的跨代水平,优于 Qwen3-VL 模型。
高效混合架构:结合门控 Delta 网络与稀疏专家混合架构,实现高吞吐量推理,最小化延迟和成本开销。
可扩展强化学习:跨百万级智能体环境进行强化学习训练,具备逐步复杂的任务分布,实现稳健的实时适应性。
全球语言覆盖:支持 201 种语言和方言,支持全球部署,具备细致的文化和区域理解能力。
## 输入输出
支持纯文本输入、图像输入、视频输入。通过 Chat Completions API 进行交互,默认进入思考模式生成响应内容。
运行要求
兼容框架:Hugging Face Transformers、vLLM、SGLang、KTransformers
量化方法:细粒度 FP8 量化,块大小为 128,性能与原始模型几乎一致。
内存建议:若遇到内存溢出错误,可考虑减少上下文窗口。为保持思考能力,建议上下文长度至少维持 128K Token。
基本用法
推荐使用最新版本的推理框架以确保最佳性能和兼容性。生产环境或高吞吐量场景建议使用 SGLang、KTransformers 或 vLLM 等专用服务引擎。
采样参数设置建议:
- 思考模式下的一般任务:temperature=1.0, top_p=0.95, top_k=20, presence_penalty=1.5, repetition_penalty=1.0
- 思考模式下的精确编码任务:temperature=0.6, top_p=0.95, top_k=20, presence_penalty=0.0, repetition_penalty=1.0
- 指令模式(非思考)下的一般任务:temperature=0.7, top_p=0.8, top_k=20, presence_penalty=1.5, repetition_penalty=1.0
- 指令模式下的推理任务:temperature=1.0, top_p=1.0, top_k=40, presence_penalty=2.0, repetition_penalty=1.0
输出长度建议:大多数查询建议使用 32768 个 Token 的输出长度;数学和编程竞赛等高度复杂问题的基准测试建议设置为 81920 个 Token。
限制
不支持 Qwen3 的软切换功能,即 /think 和 /nothink 命令。
所有主流开源框架均实现静态 YaRN,这意味着缩放因子不会根据输入长度变化,可能影响较短文本的性能。建议仅在处理长上下文需要时修改 rope 参数配置。
许可证
请参阅模型仓库中的许可证文件获取详细信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
