模型介绍
中文整理Qwen3-30B-A3B-FP8 模型卡片
模型概述
Qwen3-30B-A3B-FP8是阿里云Qwen3系列中的混合专家(MoE)模型FP8量化版本。该模型为因果语言模型,经过预训练和后训练阶段开发。
参数规模:总参数30.5B,激活参数3.3B,非嵌入参数29.9B。模型包含48层Transformer结构,注意力机制采用分组查询注意力(GQA),Q头数量为32,KV头数量为4。MoE结构包含128个专家,其中8个专家被激活。
上下文长度:原生支持32,768个tokens,使用YaRN技术可扩展至131,072个tokens。
主要能力
Qwen3是Qwen系列的最新一代大语言模型,提供密集型和混合专家型模型。核心能力包括:
思考模式与非思考模式无缝切换:单一模型内可灵活切换思考模式(用于复杂逻辑推理、数学和编程)和非思考模式(用于高效通用对话),确保在各种场景下达到最优性能。
推理能力显著提升:在数学、代码生成和常识逻辑推理方面超越了前代QwQ-32B(思考模式)和Qwen2.5-Instruct模型(非思考模式)。
人类偏好对齐表现出色:在创意写作、角色扮演、多轮对话和指令遵循方面表现优异,提供更自然、更具吸引力的对话体验。智能体能力专业:支持在思考和非思考模式下精确集成外部工具,在复杂智能体任务中达到开源模型领先性能。
多语言支持:支持100多种语言和方言,具备强大的多语言指令遵循和翻译能力。
输入输出
输入格式:文本提示(prompt),支持多语言输入
输出格式:文本响应
在思考模式下,模型会生成包含在think标签内的推理内容,随后输出最终响应。在非思考模式下,模型直接输出最终响应,不包含推理过程。
运行要求
该模型为FP8量化版本,采用细粒度FP8量化方法,块大小为128。推荐使用最新版本的transformers(0.4.6.post1或更高)、vllm(0.8.5或更高)或SGLang进行推理。
分布式推理注意事项:在使用transformers进行多设备分布式推理时,细粒度FP8方法存在已知问题。当使用多设备推理时,可能需要设置环境变量CUDA_LAUNCH_BLOCKING=1。
硬件要求:具体硬件需求请参考官方文档和博客。
基本用法
模型切换:可通过设置enable_thinking参数控制思考模式。默认情况下,思考能力处于启用状态。
思考模式参数配置:建议使用Temperature=0.6、TopP=0.95、TopK=20、MinP=0。不建议使用贪婪解码,可能导致性能下降和无限重复。
非思考模式参数配置:建议使用Temperature=0.7、TopP=0.8、TopK=20、MinP=0。
软切换机制:当enable_thinking=True时,用户可在提示或系统消息中添加/think和/no_think来动态控制模型的思考模式。模型将遵循多轮对话中最新的指令。
长文本处理:模型原生支持32,768 tokens的上下文长度。对于超过此限制的对话,建议使用YaRN技术处理长文本。默认最大位置嵌入设置为40,960,其中32,768个tokens预留用于输出,8,192个tokens用于典型提示。
输出长度建议:大多数查询建议使用32,768 tokens的输出长度。对于数学和编程竞赛等高度复杂问题的基准测试,建议设置最大输出长度为38,912 tokens。
标准化输出格式建议:数学问题提示中包含"Please reason step by step, and put your final answer within \boxed{}.";多选题提示中添加JSON结构指定答案格式。
多轮对话注意事项:历史模型输出应仅包含最终输出部分,不需要包含思考内容。
支持框架:transformers、SGLang、vLLM、Ollama、LMStudio、MLX-LM、llama.cpp、KTransformers等。
许可证
具体许可证信息请参考官方仓库。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
