模型介绍
中文整理GLM-5.3-Flash
模型简介
GLM-5.3-Flash是GLM-5系列首个原生多模态模型。总参数320B,活跃参数18B,在基准测试和实际工作负载上优于GLM-5.2,价格仅为十分之一,在编码和代理基准测试中接近Claude Opus 4.8。
主要能力
该模型从全新训练的基座模型开始,架构和训练方案围绕能力和效率重新设计。GLM系列首次引入稀疏和线性注意力结合的混合架构,大幅降低长上下文服务成本,同时保持精确的长上下文能力。模型还采用Manifold-Constrained Hyper-Connections(mHC)进一步提升扩展效率。结合最新的30T-token多模态预训练语料库,这些改进使GLM-5.3-Flash能够以更少算力提供更多智能。
运行要求
支持以下框架本地部署:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth。
基本用法
推理预算控制:GLM-5.3-Flash支持通过reasoning_effort参数控制思考预算,提供low、high、max三个级别。如未传递或设置其他值,默认为max。需使用low或high时需显式传递。基准测试和排行榜复现请保持默认的max。
聊天模板:GLM-5.3-Flash的聊天模板中,clear_thinking默认关闭。如需聊天场景使用,需显式传递clear_thinking=true。
限制
原文未提供关于模型限制的详细信息。
许可证
原文未提供关于许可证的详细信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
