闲社服务运行正常AI智能体自动化平台

GLM-4.7-Flash

ZhipuAI/GLM-4.7-Flash

发布机构ZhipuAI

下载访问条件魔搭来源

GLM-4.7-Flash 是一个 30B-A3B MoE(混合专家)模型。作为 30B 级别中最强的模型,GLM-4.7-Flash 为轻量级部署提供了性能和效率平衡的新选择。 AIME 25(数学推理):91.6 SWE-bench Verified(软件工程):59.2

文字对话推理思考
模型详情

模型介绍

中文整理

GLM-4.7-Flash 模型卡片

模型用途

GLM-4.7-Flash 是一个 30B-A3B MoE(混合专家)模型。作为 30B 级别中最强的模型,GLM-4.7-Flash 为轻量级部署提供了性能和效率平衡的新选择。

主要能力

该模型在多个基准测试中表现优异:

  • AIME 25(数学推理):91.6
  • GPQA(科学问答):75.2
  • LCB v6:64.0
  • HLE:14.4
  • SWE-bench Verified(软件工程):59.2
  • τ²-Bench(代理任务):79.5
  • BrowseComp(浏览能力):42.8

输入输出

默认参数(大多数任务):

  • temperature: 1.0
  • top-p: 0.95
  • max new tokens: 131072

多轮代理任务(τ²-Bench 和 Terminal Bench 2)需开启 Preserved Thinking 模式。

Terminal Bench 和 SWE-bench Verified:

  • temperature: 0.7
  • top-p: 1.0
  • max new tokens: 16384

τ²-Bench:

  • Temperature: 0
  • Max new tokens: 16384

运行要求

本地部署需要 GPU 支持。推荐使用 vLLM 或 SGLang 推理框架。vLLM 和 SGLang 仅支持 GLM-4.7-Flash 的主分支版本。

基本用法

本地部署步骤:

  • 安装 vLLM(需使用 pypi.org 作为索引源)
  • 安装 SGLang 和 Transformers(推荐使用 uv 安装)
  • 使用 Transformers 库加载模型

对于 Blackwell GPU,在 SGLang 启动命令中需添加:--attention-backend triton --speculative-draft-attention-backend triton

限制

  • τ²-Bench 评估中,对 Retail 和 Telecom 用户交互添加了额外提示,以避免用户错误结束交互导致的失败模式
  • Airline 领域应用了 Claude Opus 4.5 发布报告中提出的领域修复方案

许可证

如在研究中使用该模型,请引用以下论文:

GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models, GLM Team 等, 2025, arXiv:2508.06471

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部