闲社服务运行正常AI智能体自动化平台

Qwen3.8-2.4T-A95B-FP8

Qwen/Qwen3.8-2.4T-A95B-FP8

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen3.8-2.4T-A95B-FP8 是一个基于 Qwen3.8 系列的后训练 FP8 量化模型,属于因果语言模型。该模型专注于编码任务、专业工作、研究领域以及长程智能体任务,旨在提供更强的自主规划能力和环境反馈处理能力,实现复杂多步骤任务的可靠完成。 模型在编码、专业工作、研究和长程智能体任务方面有全面提升。支持灵活的思考控制,可通过 reasoning effort 调整推理深度,支持 xhigh(复杂任务)、medium(平衡精度和速度)、low(优化速度和成本)

文字对话推理思考
模型详情

模型介绍

中文整理

Qwen3.8-2.4T-A95B-FP8 模型卡片

模型用途

Qwen3.8-2.4T-A95B-FP8 是一个基于 Qwen3.8 系列的后训练 FP8 量化模型,属于因果语言模型。该模型专注于编码任务、专业工作、研究领域以及长程智能体任务,旨在提供更强的自主规划能力和环境反馈处理能力,实现复杂多步骤任务的可靠完成。

主要能力

模型在编码、专业工作、研究和长程智能体任务方面有全面提升。支持灵活的思考控制,可通过 reasoning effort 调整推理深度,支持 xhigh(复杂任务)、medium(平衡精度和速度)、low(优化速度和成本)三种模式。preserve thinking 功能默认启用,可保留历史消息中的推理上下文。模型支持更广泛的主流评测框架和开发工具,便于集成到现有技术栈中。

输入输出

该模型为纯文本模型,不支持多模态输入。所有交互均需启用思考模式,且无法关闭思考功能。每个回复会自动在最终输出前包含以 \n... \n\n 包裹的推理内容。

运行要求

模型采用细粒度 FP8 量化,块大小为 128,量化后性能与原始模型基本一致。模型权重和配置文件采用 Hugging Face Transformers 格式,支持 vLLM、SGLang、TokenSpeed 等主流推理框架。建议使用最新版本的推理框架以确保最佳性能和兼容性。

基本用法

可通过 SGLang、vLLM、TokenSpeed 等推理框架部署使用。推荐采样参数设置为:temperature=1.0、top p=0.95、top k=20、min p=0.0、presence penalty=0.0、repetition penalty=1.0。对于复杂推理任务,建议将推理内容最大输出长度设置为 262,144 tokens,最终回复最大输出长度设置为 131,072 tokens,以充分发挥模型在智能体任务中的性能。

限制

该模型为纯文本模型,不支持图像等多模态输入。所有交互必须启用思考模式,无法禁用。

许可证

模型采用 Qwen 许可证。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部