闲社服务运行正常AI智能体自动化平台

GLM-5.3-Flash

ZhipuAI/GLM-5.3-Flash

发布机构ZhipuAI

下载访问条件魔搭来源

GLM-5.3-Flash是GLM-5系列首个原生多模态模型。总参数320B,活跃参数18B,在基准测试和实际工作负载上优于GLM-5.2,价格仅为十分之一,在编码和代理基准测试中接近Claude Opus 4.8。 该模型从全新训练的基座模型开始,架构和训练方案围绕能力和效率重新设计。GLM系列首次引入稀疏和线性注意力结合的混合架构,大幅降低长上下文服务成本,同时保持精确的长上下文能力。模型还采用Manifold-Constrained Hyper-Connections(

图文理解推理思考
模型详情

模型介绍

中文整理

GLM-5.3-Flash

模型简介

GLM-5.3-Flash是GLM-5系列首个原生多模态模型。总参数320B,活跃参数18B,在基准测试和实际工作负载上优于GLM-5.2,价格仅为十分之一,在编码和代理基准测试中接近Claude Opus 4.8。

主要能力

该模型从全新训练的基座模型开始,架构和训练方案围绕能力和效率重新设计。GLM系列首次引入稀疏和线性注意力结合的混合架构,大幅降低长上下文服务成本,同时保持精确的长上下文能力。模型还采用Manifold-Constrained Hyper-Connections(mHC)进一步提升扩展效率。结合最新的30T-token多模态预训练语料库,这些改进使GLM-5.3-Flash能够以更少算力提供更多智能。

运行要求

支持以下框架本地部署:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth。

基本用法

推理预算控制:GLM-5.3-Flash支持通过reasoning_effort参数控制思考预算,提供low、high、max三个级别。如未传递或设置其他值,默认为max。需使用low或high时需显式传递。基准测试和排行榜复现请保持默认的max。

聊天模板:GLM-5.3-Flash的聊天模板中,clear_thinking默认关闭。如需聊天场景使用,需显式传递clear_thinking=true。

限制

原文未提供关于模型限制的详细信息。

许可证

原文未提供关于许可证的详细信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部