模型介绍
中文整理Qwen3-14B 模型卡片
模型概述
Qwen3-14B是通义千问系列最新一代大型语言模型,提供密集型和混合专家模型。该模型在推理、指令遵循、智能体能力和多语言支持方面实现了突破性进展。
模型用途
主要用于自然语言对话和文本生成任务。模型支持两种工作模式:思考模式适用于复杂逻辑推理、数学和编程任务;非思考模式适用于高效的通用对话场景。支持超过100种语言和方言的处理。
主要能力
模型支持在单一模型内无缝切换思考模式和非思考模式。推理能力显著提升,在数学、代码生成和常识逻辑推理方面超越前代模型。人类偏好对齐表现出色,擅长创意写作、角色扮演、多轮对话和指令遵循。具备优秀的智能体能力,可精确集成外部工具,在复杂智能体任务中达到开源模型领先水平。
输入输出
输入格式为文本提示。输出为文本响应。原生支持32,768个token的上下文长度,使用YaRN方法可扩展至131,072个token。
运行要求
模型参数总量为14.8B,非嵌入参数为13.2B。模型层数为40层,注意力头采用GQA机制:Q头40个,KV头8个。推荐使用transformers 0.4.6.post1或更高版本,或vllm 0.8.5及以上版本进行推理。本地部署可使用Ollama、LMStudio、MLX-LM、llama.cpp和KTransformers等工具。
基本用法
模型默认启用思考模式。通过设置enable thinking参数可在两种模式间切换。思考模式建议使用Temperature=0.6、TopP=0.95、TopK=20、MinP=0;非思考模式建议使用Temperature=0.7、TopP=0.8、TopK=20、MinP=0。思考模式下不建议使用贪婪解码,可能导致性能下降和无限重复。用户可通过在提示中添加/think或/no think动态切换思考状态。
处理长文本时,如上下文长度超过32,768个token,建议启用YaRN技术进行扩展。默认最大位置嵌入设为40,960,其中32,768个token预留给输出,8,192个token用于常规提示。对于大多数短文本处理场景,无需启用YaRN。
限制
思考模式必须配合特定采样参数使用,禁用贪婪解码。长上下文场景启用YaRN可能对短文本性能产生影响。模型在多轮对话中,历史输出应仅包含最终响应部分,无需保留思考内容。
许可证
如需引用本模型,请参考相关学术文献。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
