闲社服务运行正常AI智能体自动化平台

GLM-5.3

ZhipuAI/GLM-5.3

发布机构ZhipuAI

下载访问条件魔搭来源

GLM-5.3 使用与 GLM-5.2 相同的基础模型,所有能力提升均来自后训练。与 GLM-5.2 相比,GLM-5.3 在复杂编码和长程任务方面有显著改进。 更强的编码能力:GLM-5.3 是目前开源权重模型中最具编码能力的模型。在内部 Z.ai Code Bench 上比 GLM-5.2 提升 50%。在公开基准测试中达到开源最优水平,包括 Terminal Bench 3.0 和 Agents' Last Exam。

文字对话编程开发
模型详情

模型介绍

中文整理

GLM-5.3 模型卡片

模型概述

GLM-5.3 使用与 GLM-5.2 相同的基础模型,所有能力提升均来自后训练。与 GLM-5.2 相比,GLM-5.3 在复杂编码和长程任务方面有显著改进。

主要能力

更强的编码能力:GLM-5.3 是目前开源权重模型中最具编码能力的模型。在内部 Z.ai Code Bench 上比 GLM-5.2 提升 50%。在公开基准测试中达到开源最优水平,包括 Terminal Bench 3.0 和 Agents' Last Exam。

涌现的网络安全能力:随着后训练规模扩大,网络安全能力发展超出预期。GLM-5.3 在 CyberGym 漏洞发现任务上达到最先进水平。在漏洞利用链的高阶任务中提升最大,在利用基准测试上的表现是 GLM-5.2 的两倍以上。

基准测试表现

GLM-5.3 在多项基准测试中取得领先成绩:

Terminal Bench 3.0:28.3(GLM-5.2 为 4.6)

DeepSWE (v1.1):66.9(GLM-5.2 为 46.2)

CyberGym:84.5(GLM-5.2 为 77.2)

ExploitGym (2小时/6小时):105 / 130(GLM-5.2 为 29 / 39)

AutomationBench (v1.0.6):48.2(GLM-5.2 为 26.2)

运行要求

支持以下部署框架:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth。支持在 Ascend NPU 平台上部署,使用 vLLM-Ascend、xLLM 或 SGLang 框架。

基本用法

思考预算控制:通过 reasoning effort 参数控制思考预算,支持 low、high、max 三个级别。如不传递或设置其他值,默认为 max。基准测试和排行榜复现需保持默认的 max 设置。

聊天模板:clear thinking 参数如不传递默认为 false。聊天场景如需启用清晰思考,需显式传递 clear thinking=true。

限制

基准测试说明:部分基准测试存在特定评估条件限制。Terminal Bench 3.0 禁用工具搜索,每个任务运行三个回合取平均。CyberGym 和 ExploitGym 禁用网络工具并应用域名白名单以防止作弊。ExploitBench 限制代理与环境交互最多 300 轮。部分测试使用特定采样参数和超时设置。

许可证

原文未提供许可证相关信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部