模型详情
模型介绍
中文整理# Qwen3.5-27B-FP8 模型卡片
模型概述
Qwen3.5-27B-FP8 是一个包含视觉编码器的因果语言模型,采用 FP8 量化权重和后训练配置。量化方法为细粒度 fp8 量化,块大小为 128,性能与原始模型几乎一致。
## 模型架构
- **参数规模**: 27B
- **隐藏层维度**: 5120
- **词表大小**: 248320(填充后)
- **层数**: 64
- **隐藏层布局**: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
- **Gated DeltaNet**: V 使用 48 个线性注意力头,QK 使用 16 个,头维度 128
- **Gated Attention**: Q 使用 24 个注意力头,KV 使用 4 个,头维度 256
- **旋转位置嵌入维度**: 64
- **前馈网络中间维度**: 17408
- **多步预测 (MTP)**: 已训练
## 主要能力
- **统一视觉语言基础**: 多模态 token 早融合训练,在推理、编码、代理和视觉理解基准测试中与 Qwen3 持平,优于 Qwen3-VL 模型
- **高效混合架构**: Gated Delta Networks 结合稀疏专家混合架构,实现高吞吐量推理,最低延迟和成本开销
- **可扩展强化学习**: 跨百万智能体环境的强化学习,支持逐步复杂的任务分布,实现稳健的真实世界适应性
- **全球语言覆盖**: 扩展支持 201 种语言和方言
- **下一代训练基础设施**: 多模态训练效率接近文本训练的两倍,异步 RL 框架支持大规模智能体脚手架和环境编排
## 输入输出
- **原生上下文长度**: 262,144 tokens
- **可扩展上下文长度**: 最高 1,010,000 tokens
- **输入形式**: 文本、图像、视频
- **输出模式**: 默认启用思考模式,生成思考内容后输出最终回复。可通过 API 参数禁用思考模式以获得直接回复。
运行要求
- **兼容框架**: Hugging Face Transformers、vLLM、SGLang、KTransformers
- **推荐配置**: 8 GPU 张量并行
- **内存建议**: 遇到内存溢出错误时,可考虑减少上下文窗口。为保持思考能力,建议保持至少 128K tokens 的上下文长度。
- **输出长度建议**: 大多数查询建议使用 32,768 tokens 输出长度;数学和编程竞赛等高度复杂问题的基准测试建议设置最大输出长度为 81,920 tokens。
许可证
模型权重和配置文件采用阿里巴巴开源许可证,具体许可证信息请参阅模型仓库。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
