模型介绍
中文整理GLM-4.7-Flash 模型卡片
模型用途
GLM-4.7-Flash 是一个 30B-A3B MoE(混合专家)模型。作为 30B 级别中最强的模型,GLM-4.7-Flash 为轻量级部署提供了性能和效率平衡的新选择。
主要能力
该模型在多个基准测试中表现优异:
- AIME 25(数学推理):91.6
- GPQA(科学问答):75.2
- LCB v6:64.0
- HLE:14.4
- SWE-bench Verified(软件工程):59.2
- τ²-Bench(代理任务):79.5
- BrowseComp(浏览能力):42.8
输入输出
默认参数(大多数任务):
- temperature: 1.0
- top-p: 0.95
- max new tokens: 131072
多轮代理任务(τ²-Bench 和 Terminal Bench 2)需开启 Preserved Thinking 模式。
Terminal Bench 和 SWE-bench Verified:
- temperature: 0.7
- top-p: 1.0
- max new tokens: 16384
τ²-Bench:
- Temperature: 0
- Max new tokens: 16384
运行要求
本地部署需要 GPU 支持。推荐使用 vLLM 或 SGLang 推理框架。vLLM 和 SGLang 仅支持 GLM-4.7-Flash 的主分支版本。
基本用法
本地部署步骤:
- 安装 vLLM(需使用 pypi.org 作为索引源)
- 安装 SGLang 和 Transformers(推荐使用 uv 安装)
- 使用 Transformers 库加载模型
对于 Blackwell GPU,在 SGLang 启动命令中需添加:--attention-backend triton --speculative-draft-attention-backend triton
限制
- τ²-Bench 评估中,对 Retail 和 Telecom 用户交互添加了额外提示,以避免用户错误结束交互导致的失败模式
- Airline 领域应用了 Claude Opus 4.5 发布报告中提出的领域修复方案
许可证
如在研究中使用该模型,请引用以下论文:
GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models, GLM Team 等, 2025, arXiv:2508.06471
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
