模型详情
模型介绍
中文整理# Qwen3-235B-A22B 模型卡片
模型概述
Qwen3-235B-A22B 是阿里云Qwen系列最新一代大语言模型,采用密集模型和混合专家(MoE)架构。
模型用途
该模型适用于复杂逻辑推理、数学问题求解、代码生成、创意写作、角色扮演、多轮对话、指令遵循以及多语言处理等场景。支持在单一模型内无缝切换思考模式和非思考模式,以优化不同任务的表现。
## 主要能力
- *思考模式**:适用于复杂逻辑推理、数学和编码任务,模型会生成详细的推理过程(think内容),然后给出最终答案。
- *非思考模式**:适用于高效、通用对话场景,直接生成响应,不包含推理过程。
- *核心能力**:
- 推理能力显著提升,在数学、代码生成和常识逻辑推理方面超越前代模型
- 优秀的人类偏好对齐,擅长创意写作、角色扮演和多轮对话
- 强大的代理能力,支持与外部工具精确集成
- 支持超过100种语言和方言,具备多语言指令遵循和翻译能力
## 输入输出
- *输入**:文本提示(用户指令或对话内容)
- *输出**:生成的文本响应
- *上下文长度**:
- 原生支持32,768个tokens
- 使用YaRN方法可扩展至131,072个tokens
运行要求
- *参数规模**:
- 总参数:2350亿
- 激活参数:220亿
- 非嵌入参数:2340亿
- *模型结构**:
- 层数:94层
- 注意力头数量:64个Q头,4个KV头(GQA)
- 专家数量:128个
- 激活专家数量:8个
- *框架支持**:
- 推荐使用transformers>=0.4.6.post1或vllm>=0.8.5
- 本地部署支持:Ollama、LMStudio、MLX-LM、llama.cpp、KTransformers
- 推理部署支持:vLLM、SGLang
基本用法
- *思考模式配置**:
- Temperature:0.6
- TopP:0.95
- TopK:20
- MinP:0
- 注意:禁止使用贪婪解码,可能导致性能下降和无限重复
- *非思考模式配置**:
- Temperature:0.7
- TopP:0.8
- TopK:20
- MinP:0
- *模式切换**:
- 硬切换:通过设置enable thinking参数为True或False
- 软切换:在提示中使用/think或/no think指令动态控制(仅在enable thinking=True时有效)
- *输出长度建议**:
- 大多数查询建议输出32,768个tokens
- 复杂数学和编程竞赛题目建议38,912个tokens
- *长文本处理**:
- 上下文长度不超过32,768个tokens时,不建议启用YaRN
- 静态YaRN可能影响短文本性能
- 仅在处理长上下文时添加rope scaling配置
限制
- 思考模式下必须使用采样策略,禁止贪婪解码
- 短文本处理场景不建议启用YaRN,可能导致性能下降
- 多轮对话中,历史消息只需包含最终输出,无需包含思考内容
许可证
如需引用该模型,请参考相关学术文献。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
