模型介绍
中文整理Qwen3-235B-A22B-MLX-6bit 模型卡片
模型概述
Qwen3是通义千问系列最新一代大语言模型,提供密集模型和混合专家(MoE)模型的完整系列。Qwen3基于大规模训练,在推理、指令遵循、智能体能力和多语言支持方面实现了突破性进展。
模型用途
通用对话、复杂逻辑推理、数学问题求解、代码生成、多语言翻译与指令遵循、智能体工具调用
主要能力
思考模式与非思考模式无缝切换:单一模型内可在复杂逻辑推理模式(思考模式)和高效通用对话模式(非思考模式)之间灵活切换
推理能力显著提升:在数学、代码生成和常识逻辑推理方面超越前代QwQ-32B(思考模式)和Qwen2.5-Instruct(非思考模式)
人类偏好对齐优秀:擅长创意写作、角色扮演、多轮对话和指令遵循,提供更自然、更具吸引力的对话体验
智能体能力出色:支持在思考和非思考模式下精确集成外部工具,在复杂智能体任务中达到开源模型领先水平
多语言支持:支持100种以上语言和方言,具备强大的多语言指令遵循和翻译能力
输入输出
输入:文本形式的用户提示或对话,可包含系统消息和历史对话记录
输出:文本形式的响应,在思考模式下包含<think >...</think >推理块和最终回答,在非思考模式下直接输出最终回答
模型规格
类型:因果语言模型
训练阶段:预训练和后训练
总参数:2350亿
激活参数:220亿
非嵌入参数:2340亿
层数:94
注意力头数:Q头64个,KV头4个
专家总数:128
激活专家数:8
上下文长度:原生支持32,768个tokens,通过YaRN支持131,072个tokens
运行要求
依赖库:transformers(版本≥4.52.4)、mlx lm(版本≥0.25.2)
长上下文处理:推荐使用transformers、llama.cpp、vLLM或SGLang等支持YaRN的推理框架
基本用法
思考模式设置:enable thinking=True(默认启用),模型将生成<think >...</think >推理块后输出最终回答
非思考模式设置:enable thinking=False,完全禁用思考行为,模型直接输出最终回答
软切换机制:当enable thinking=True时,可在用户提示或系统消息中使用/think和/no think动态切换思考模式
采样参数建议:思考模式使用Temperature=0.6、TopP=0.95、TopK=20、MinP=0;非思考模式使用Temperature=0.7、TopP=0.8、TopK=20、MinP=0;不要使用贪婪解码
输出长度建议:大多数查询建议输出长度32,768 tokens;数学和编程竞赛等复杂问题建议最大输出长度38,912 tokens
长文本处理:对话总长度超过32,768 tokens时推荐使用YaRN技术进行RoPE缩放
智能体使用:推荐使用Qwen-Agent以充分发挥模型的工具调用能力,支持MCP配置文件定义工具
最佳实践
数学问题:在提示中包含"Please reason step by step, and put your final answer within \boxed{}."
多选题:在提示中添加JSON结构要求模型仅输出选项字母
多轮对话:历史记录只需包含最终输出部分,无需包含思考内容
许可证
许可证信息未在原文中提供
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
