模型介绍
中文整理Qwen3.8-2.4T-A95B-FP8 模型卡片
模型用途
Qwen3.8-2.4T-A95B-FP8 是一个基于 Qwen3.8 系列的后训练 FP8 量化模型,属于因果语言模型。该模型专注于编码任务、专业工作、研究领域以及长程智能体任务,旨在提供更强的自主规划能力和环境反馈处理能力,实现复杂多步骤任务的可靠完成。
主要能力
模型在编码、专业工作、研究和长程智能体任务方面有全面提升。支持灵活的思考控制,可通过 reasoning effort 调整推理深度,支持 xhigh(复杂任务)、medium(平衡精度和速度)、low(优化速度和成本)三种模式。preserve thinking 功能默认启用,可保留历史消息中的推理上下文。模型支持更广泛的主流评测框架和开发工具,便于集成到现有技术栈中。
输入输出
该模型为纯文本模型,不支持多模态输入。所有交互均需启用思考模式,且无法关闭思考功能。每个回复会自动在最终输出前包含以 \n... \n\n 包裹的推理内容。
运行要求
模型采用细粒度 FP8 量化,块大小为 128,量化后性能与原始模型基本一致。模型权重和配置文件采用 Hugging Face Transformers 格式,支持 vLLM、SGLang、TokenSpeed 等主流推理框架。建议使用最新版本的推理框架以确保最佳性能和兼容性。
基本用法
可通过 SGLang、vLLM、TokenSpeed 等推理框架部署使用。推荐采样参数设置为:temperature=1.0、top p=0.95、top k=20、min p=0.0、presence penalty=0.0、repetition penalty=1.0。对于复杂推理任务,建议将推理内容最大输出长度设置为 262,144 tokens,最终回复最大输出长度设置为 131,072 tokens,以充分发挥模型在智能体任务中的性能。
限制
该模型为纯文本模型,不支持图像等多模态输入。所有交互必须启用思考模式,无法禁用。
许可证
模型采用 Qwen 许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
