【事件概述】
Z.ai 发布并开放了 GLM-5.3-Flash 权重。这是 GLM-5 系列首个原生多模态模型,面向代码与智能体任务、视觉理解和专业工作流,并通过混合注意力与稀疏专家设计降低长上下文推理成本。
【模型与开发者】
模型:GLM-5.3-Flash
开发者:Z.ai / zai-org
官方发布日期:2026 年 8 月 26 日,来自 Z.ai 官方发布博客。Hugging Face 模型仓库创建于 8 月 25 日 06:43 UTC,并在 8 月 26 日更新;该仓库时间属于发布前上传与发布日维护,本文以官方博客的 8 月 26 日作为事件日期。
许可证:MIT
【关键能力与架构】
1. 模型共有 320B 参数,每次推理激活约 18B 参数;官方配置包含 45 层、288 个路由专家和每 token 选择 8 个专家。
2. GLM-5 系列首次采用稀疏注意力与线性注意力混合架构:线性注意力负责局部状态建模,稀疏注意力通过索引器检索全局相关上下文。
3. IndexPool 会把四个索引器键向量加权汇聚为一个,以降低百万 token 上下文下索引器的延迟和内存开销;模型同时采用 Manifold-Constrained Hyper-Connections(mHC)。
4. 官方称使用 30T token 的多模态预训练语料,原生支持文本、图像、视频和文件输入。API 文档标注支持 1M token 上下文、函数调用、结构化输出和上下文缓存。
5. 面向视觉编码与 Agent 工作流,模型可理解界面、文档、图表和视频内容,并为浏览器操作、Computer Use、办公文档或代码执行生成决策和工具调用。实际点击、文件编辑和程序运行仍由外部 Agent 运行时及其权限完成,并不是模型权重单独就能执行。
6. 本地部署目前有 SGLang、vLLM、TokenSpeed 和 KTransformers 等官方指引,Hugging Face 公共权重采用 Transformers 格式。
【适用对象】
适合需要中英文代码生成、长上下文仓库分析、视觉界面理解、工具调用和多模态 Agent 的开发者,也适合研究混合注意力与超大规模稀疏 MoE 部署的团队。对于只需要普通聊天或轻量本地推理的个人设备,模型规模可能并不经济。
【实际影响】
18B 激活参数有助于控制每 token 计算量,但不能理解为模型只占 18B 参数的存储或显存。Hugging Face 元数据记录的 safetensors 文件总量约为 321GB,模型能否在具体服务器上运行还取决于权重精度、并行方案、KV 缓存、上下文长度和推理框架。官方没有给出通用最低硬件门槛,不能据此虚构单卡或消费级显卡可运行结论。
官方博客公布了多项代码、Agent 和视觉基准,并声称相较 GLM-5.2 有明显提升。这些成绩使用不同上下文长度、工具环境、超时设置和评审模型,属于项目方在特定评测协议下的结果,不应直接扩展为所有真实任务中的排名或能力保证。
【限制与使用提醒】
百万 token 是接口支持上限,不代表在任意长文档中都能稳定找回全部细节;上下文越长,显存、延迟和验证成本通常越高。官方 API 当前只支持启用 thinking,不能关闭。原生多模态输入不等于浏览器、桌面或文件系统权限,部署方必须为工具调用设置审批、沙箱和最小权限。模型仍可能产生事实错误、错误代码、错误视觉判断或不安全的操作计划,关键结果与外部动作必须人工复核。不同本地推理框架对新架构和多模态输入的支持程度也可能不同,部署前应按官方最新版本逐项验证。
【官方来源】
Z.ai 官方发布博客:https://z.ai/blog/glm-5.3-flash
Hugging Face 模型页:https://huggingface.co/zai-org/GLM-5.3-Flash
Z.ai API 文档:https://docs.z.ai/guides/llm/glm-5.3-flash |