模型介绍
中文整理GLM-5.3 模型卡片
模型概述
GLM-5.3 使用与 GLM-5.2 相同的基础模型,所有能力提升均来自后训练。与 GLM-5.2 相比,GLM-5.3 在复杂编码和长程任务方面有显著改进。
主要能力
更强的编码能力:GLM-5.3 是目前开源权重模型中最具编码能力的模型。在内部 Z.ai Code Bench 上比 GLM-5.2 提升 50%。在公开基准测试中达到开源最优水平,包括 Terminal Bench 3.0 和 Agents' Last Exam。
涌现的网络安全能力:随着后训练规模扩大,网络安全能力发展超出预期。GLM-5.3 在 CyberGym 漏洞发现任务上达到最先进水平。在漏洞利用链的高阶任务中提升最大,在利用基准测试上的表现是 GLM-5.2 的两倍以上。
基准测试表现
GLM-5.3 在多项基准测试中取得领先成绩:
Terminal Bench 3.0:28.3(GLM-5.2 为 4.6)
DeepSWE (v1.1):66.9(GLM-5.2 为 46.2)
CyberGym:84.5(GLM-5.2 为 77.2)
ExploitGym (2小时/6小时):105 / 130(GLM-5.2 为 29 / 39)
AutomationBench (v1.0.6):48.2(GLM-5.2 为 26.2)
运行要求
支持以下部署框架:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth。支持在 Ascend NPU 平台上部署,使用 vLLM-Ascend、xLLM 或 SGLang 框架。
基本用法
思考预算控制:通过 reasoning effort 参数控制思考预算,支持 low、high、max 三个级别。如不传递或设置其他值,默认为 max。基准测试和排行榜复现需保持默认的 max 设置。
聊天模板:clear thinking 参数如不传递默认为 false。聊天场景如需启用清晰思考,需显式传递 clear thinking=true。
限制
基准测试说明:部分基准测试存在特定评估条件限制。Terminal Bench 3.0 禁用工具搜索,每个任务运行三个回合取平均。CyberGym 和 ExploitGym 禁用网络工具并应用域名白名单以防止作弊。ExploitBench 限制代理与环境交互最多 300 轮。部分测试使用特定采样参数和超时设置。
许可证
原文未提供许可证相关信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
