GLM-5 中文指南:先选 GLM-5.3 还是 5.3-Flash,再谈部署
GLM-5 现在是一整个模型系列。官方仓库顶部已经从 GLM-5/5.1 更新到 GLM-5.3 与 GLM-5.3-Flash,继续照旧页面复制固定 vLLM 命令,很可能拿错模型、精度或模板参数。
1. 先分清两条 5.3 路线
| 模型 | 规模 | 官方说明中的结构 | 先看什么 |
|---|---|---|---|
| GLM-5.3 | 744B 总参数 / 40B 激活 | 沿用 5.2 基座,提升来自后训练 | 旗舰能力、多卡容量、真实编码任务 |
| GLM-5.3-Flash | 320B 总参数 / 18B 激活 | 新基座,混合稀疏与线性注意力,采用 mHC | 相对较低的服务开销、吞吐与长上下文 |
Flash 的名字容易让人误以为它能在普通笔记本上轻松运行。它仍有 320B 总参数和 18B 激活参数;权重存储、KV cache、框架开销和并发都会继续占用大量资源。是否能部署必须拿你的 GPU/NPU 数量、显存和服务目标计算,不能只看激活参数。
官方称 GLM-5.3 在内部 Z.ai Code Bench 上比 5.2 提升 50%,并报告多个公开榜单结果。这些数字能说明项目的优化方向,但其中包含厂商内部评测,本页不把它当作独立复现。
2. 选择 BF16 或 FP8 权重
官方 Download Model 表为 5.3 和 5.3-Flash 都提供 BF16、FP8,并同时链接 Hugging Face 与 ModelScope。先确认推理框架、设备和算子对该精度的支持,再下载权重。生产环境至少记录以下信息:
model_id: zai-org/GLM-5.3 或 GLM-5.3-Flash precision: BF16 或 FP8 weight_revision: 固定提交或快照 engine: SGLang / vLLM / Transformers / ... engine_version: 明确版本 chat_template: 与权重配套 reasoning_effort: low / high / max clear_thinking: true(聊天)
GLM-5.3 与更早 5.x 的基座和模板并不完全相同。不要只把模型名换掉就沿用旧容器和旧解析器;先读所选框架针对该模型的 recipe,再固定可回滚的组合。
3. 按模型选择推理框架
5.3-Flash 官方列出 SGLang、vLLM、TokenSpeed、Transformers、KTransformers 和 Unsloth。5.3 及更早模型列出 SGLang、vLLM、Transformers、KTransformers 与 Unsloth;Ascend NPU 另有 vLLM-Ascend、xLLM 和 SGLang 路径。
当前 README 没有维护一条通吃所有环境的启动命令,而是链接到各框架 recipe。这比旧稿中的固定镜像版本更可靠。部署顺序应是:锁定权重 revision,选择与设备匹配的框架文档,按 recipe 启动单副本,再逐步加张量并行、量化、并发和投机解码。
4. reasoning_effort 与 clear_thinking
GLM-5.3 和 5.3-Flash 接受 low、high、max 三档 reasoning_effort。未传参数,或传入不支持的值时,都会回退到 max。复现官方榜单时应保留默认 max;线上服务要分别测三档的正确率、延迟和输出长度,再做路由。
聊天模板的 clear_thinking 默认是 false。官方明确要求聊天场景显式传 true。若中间有 OpenAI 兼容网关、SDK 或代理框架,还要确认这个字段没有在转换过程中被丢弃。
5. 最小可用验证清单
服务起来后,先用四类小请求排除配置错误:普通问答检查模板结束符;短代码修改检查格式;一次函数调用检查参数 JSON;两轮对话检查 clear_thinking。随后再换成真实仓库任务,记录首 token 延迟、总时长、峰值显存、并发吞吐、长上下文稳定性和工具调用成功率。
微调方面,官方列出 Slime 0.3.0+ 与 ms-swift 4.4.0+。模型能加载不等于微调资源足够,训练前还要单独估算优化器状态、激活、checkpoint 和数据管线成本。
6. API、自托管与商业判断
官方仓库同时提供 Z.ai API 链接和可下载权重。API 可能产生服务费用,自托管则把成本转成硬件、运维和框架兼容工作。该仓库本身没有充值代理、额度转售或订阅分发流程,且源码仓库使用 Apache-2.0 许可,因此未按严重商业化项目隔离。实际使用权重和 API 前,仍应分别核对模型页面与服务条款。
7. 与 Qwen3-Coder 对比
Qwen3-Coder 官方仓库 同样面向开放权重的代理编码。它当前列出 Qwen3-Coder-Next、30B-A3B 与 480B-A35B 等尺寸;Next 基于 80B-A3B 基座,原生上下文为 256K,并强调本地开发。
GLM-5.3 主线是 744B-A40B,Flash 也有 320B-A18B,更适合已有大型推理基础设施的团队。硬件预算有限时,先评估 Qwen3-Coder 的较小变体;已经能够承载大规模 MoE,并需要 GLM 的推理预算与长链路行为时,再把 5.3/Flash 放进同一套任务集实测。
这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。
先判断这个项目是否适合你
采用建议
GLM-5 页面值得保留,但必须按模型系列而不是单一旧版本来写。实际选型先分清 5.3 与 Flash,再根据权重规模、推理框架、真实负载和可重复的内部评测决定 API 还是自托管。
原教程未展开的系统信息
核心功能
两条 5.3 模型路线
GLM-5.3 沿用 GLM-5.2 的基座,性能提升来自后训练;GLM-5.3-Flash 使用新基座,把稀疏注意力与线性注意力结合,并采用 mHC。
架构与数据流
GLM-5.3 是 744B-A40B 的 MoE 模型,沿用 GLM-5.2 基座并通过后训练升级;5.3-Flash 是 320B-A18B 的新基座,采用稀疏注意力与线性注意力混合架构、mHC,并使用 30T token 多模态语料。仓库本身以模型卡和下载、部署、微调入口为主,不是一个下载后直接运行的桌面应用。服务侧需选 SGLang、vLLM 等框架加载对应精度权重,再由调用方传入推理预算与聊天模板参数。
技术栈和运行条件
语言
开放权重模型与 Markdown 模型卡;推理端依赖所选 Python/C++ 框架
框架
MoE;5.3-Flash 使用稀疏与线性注意力混合架构和 mHC
关键依赖
- Hugging Face 或 ModelScope 上的 GLM-5 系列权重
- SGLang、vLLM、Transformers、KTransformers 或 Unsloth;5.3-Flash 还列出 TokenSpeed
- 与权重精度和并行方式相匹配的 GPU/NPU、显存与存储
- 微调可用 Slime 0.3.0+ 或 ms-swift 4.4.0+
运行环境
自托管模型服务或 Z.ai 官方 API;本地部署参数以各推理框架官方 recipe 为准
常见问题
GLM-5 官方仓库当前最新的是 GLM-5.1 吗?
不是。到 2026-09-23,主线已经是 GLM-5.3 与 GLM-5.3-Flash,仓库同时保留 5.2、5.1 和 5 的下载入口。
GLM-5.3 和 GLM-5.3-Flash 应该怎么选?
5.3 是 744B-A40B,沿用 5.2 基座;Flash 是新训练的 320B-A18B 基座,采用混合注意力和 mHC。先按硬件筛选,再用真实任务比较。
GLM-5.3 聊天时为什么要设置 clear_thinking=true?
官方说明聊天模板默认值是 false。聊天场景显式传 true,可以避免跨轮思考状态的处理方式偏离预期。
GLM-5.3 有可以固定的 GitHub release 版本吗?
没有。官方 Releases 页面目前为空。生产部署应固定权重 revision、推理框架、容器和配置,自己建立可回滚版本。