模型介绍
中文整理Qwen3.8-2.4T-A95B 模型卡片
模型用途
Qwen3.8-2.4T-A95B 是通义千问开源模型系列中能力最强的生成式语言模型。基于 Qwen3.5 架构开发,在编码、专业工作、研究和长程智能体任务方面有显著提升。该模型首次将 Qwen-Max 级别的模型开源发布,能够完成复杂的多步骤任务。
主要能力
核心能力:全面提升编码、专业工作、研究和长程智能体任务的处理能力。
智能体执行:具备更强的自主规划能力,能更好地处理环境反馈,实现更可靠的任务端到端完成。
下游兼容性:广泛支持主流评测框架和开发工具,便于集成到现有技术栈。
灵活思考控制:可通过 reasoning effort 调整推理深度,支持 preserve thinking 保留历史消息的推理上下文。
输入输出
输入格式:纯文本输入,不支持多模态输入。
输出格式:纯文本输出。所有交互均需启用思考模式,且无法关闭思考功能。每个回复会自动在最终输出前包含以 \n... \n\n 包裹的推理内容。
上下文长度:原生支持 262,144 个 Token,最大可扩展至 1,010,000 个 Token。
运行要求
参数规模:总参数 2.4 万亿,激活参数 950 亿。
推荐框架:使用 SGLang、vLLM、TokenSpeed 等推理引擎进行部署。建议使用最新版本框架以确保最佳性能和兼容性。
采样参数建议:temperature=1.0, top p=0.95, top k=20, min p=0.0, presence penalty=0.0, repetition penalty=1.0。可根据需要将 presence penalty 参数调整至 0-2 范围以减少重复输出。
推理深度设置:reasoning effort 参数支持 xhigh(默认,适用于复杂分析任务)、medium(平衡准确率和速度)、low(优化速度和成本)三种模式。
preserve thinking:默认启用,为所有工作负载保留最佳开箱体验。
输出长度建议:对于智能体任务,建议分配充足的输出长度。在 100 万上下文长度内,建议将推理内容最大输出长度设置为 262,144 个 Token,最终回复最大输出长度设置为 131,072 个 Token。
基本用法
可通过以下方式部署使用:SGLang、vLLM、TokenSpeed 等推理框架,或使用 Qwen Cloud API 服务。
限制
该模型为纯文本模型,不支持任何多模态输入。所有交互必须启用思考模式,且无法关闭思考功能。
许可证
请参阅模型仓库中的许可证文件。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
