使用 Ollama 在本地运行 GLM-5:挑战者 open-weights
GLM-5 是智谱 AI(清华大学)推出的新一代开放权重模型系列。它提供 9B 和 32B 版本,采用宽松许可证,推理能力扎实,法语表现尚可,代码表现也不错。本指南介绍如何使用 Ollama 在本地安装 GLM-5,实测其在 RTX 4070 和 4090 上的性能,并在相同任务上将其与 Qwen3-32B 和 DeepSeek V3.2 进行比较。
#为何选择 GLM-5?
GLM-5 的知名度不及 Qwen3 或 DeepSeek,但它是近几个月推出的最成熟的中国开放权重模型之一。9B 版本面向配置较低的设备(12 GB 显存就足够),32B 版本则面向 RTX 4090 和 Mac Studio。按其宣称,在与 Qwen3-32B 相同的模型规模下,它在 MMLU 和 HumanEval 上的得分接近 GPT-4o-mini。
在实际使用中,GLM-5 在三个方面表现突出:结构化推理(thinking 模式与 Qwen3 类似)、法语能力(面对复杂提示时明显优于 Qwen3-9B),以及 Python 编程。令人失望的地方是:尽管承诺上下文可达 1M,本地运行时上下文窗口的上限仍为 128k,而且没有集成视觉能力(与 GLM-4V 不同)。
#硬件要求
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
- GLM-5 9B Q4_K_M
- ≈ 5.5 GB 显存。RTX 3060 12 GB,RTX 4060 8 GB(部分卸载),Mac M2 16 GB 统一内存,所有 RTX 4070 及以上型号。
- GLM-5 32B Q4_K_M
- 约需 19 GB 显存。配备 24 GB 显存的 RTX 4090 可以较为轻松地运行,RTX 3090 24 GB 也一样。使用 16 GB 显存的显卡(4080)时,需要降至 Q3_K_M 量化。
- GLM-5 32B Q5_K_M
- 约需 22–23 GB VRAM。RTX 4090 能装下,但剩余显存很少。若启用长上下文,请优先选择 Q4_K_M。
- Ollama 0.6.0+
- 对 GLM-5 的支持是逐步加入的。要正确支持其分词器和聊天模板,需要使用较新的 Ollama 版本。
- 磁盘
- 预计需要 6 GB(9B Q4)至 23 GB(32B Q5)的磁盘空间。如果同时保留多个量化版本,则需要更多空间。
#1. 从 Hugging Face 下载模型
智谱 AI 在 Hugging Face 上的 THUDM 组织中发布了官方权重。您需要关注以下两个仓库:
这些仓库包含 safetensors 格式的权重(FP16/BF16)。使用 Ollama 时,您需要 GGUF 格式。有两种选择:下载社区已转换好的 GGUF 文件,或自行转换。
#2. GGUF格式及必要时的转换
如果没有任何官方或社区提供的GGUF版本适用(如特殊变体或特定量化方式),则需通过llama.cpp进行转换。标准流程如下:
#3. 在 Ollama(本地)中安装GLM-5
拿到 GGUF 文件后,通过 Modelfile 导入 Ollama。在 GGUF 文件同目录下创建一个名为 Modelfile 的文件:
然后在 Ollama 中创建模型,确认其已注册,并启动它:
#4. 法语质量测试
对于一个主要使用中文和英文数据训练的模型来说,GLM-5 的法语能力是它的一大优势。以下三个实用提示词可用于快速评估:
- 01结构化推理“一个瓶子和它的瓶盖共花费 1.10 欧元。瓶子比瓶盖贵 1 欧元。瓶盖多少钱?请详细说明你的推理过程。”GLM-5 9B 应给出 0.05 欧元的答案,并列出方程。
- 02长文本摘要粘贴一篇2000词的文章,要求用法语将其概括成5个要点。32B版本能保持清晰的思路,9B版本在长上下文下会将内容缩减得过多。
- 03结合上下文的 Python 代码‘编写一个Python函数,解析以';'为分隔符的CSV文件,处理引号并返回字典生成器,不使用pandas。’ GLM-5生成的代码规范且符合Python习惯,而Qwen3-9B则倾向于直接导入csv,且未正确处理引号。
#5. RTX 4070 和 4090 上实测的 token/秒
使用 Ollama 0.6.x 测试,启用 OLLAMA_FLASH_ATTENTION=1,上下文8k,提示500个token,生成300个token。5次运行的平均值。
- RTX 4070 12 GB — GLM-5 9B Q4_K_M
- 约 55-60 tokens/sec。对于聊天来说很舒适,模型 100% 驻留在 VRAM 中。
- RTX 4070 12 GB — GLM-5 9B Q5_K_M
- ≈ 48–52 tokens/秒。质量略有提升,但经测量,速度有所下降。
- RTX 4090 24 GB — GLM-5 9B Q4_K_M
- ≈ 110–120 tokens/sec。对于 9B 模型来说,这一配置远超所需。
- RTX 4090 24 GB — GLM-5 32B Q4_K_M
- 约 22–26 token/秒。目标使用场景:以适合交互使用的生成速度获得 32B 模型的质量。
- RTX 4090 24 GB — GLM-5 32B Q5_K_M
- 约 18–22 tokens/sec。上下文 > 16k 时,显存余量较紧。
- Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
- 约 12–15 tokens/秒。用于非流式任务(摘要、分析)尚可。
#GLM-5、Qwen3-32B 与 DeepSeek V3.2 对比
在相同的提示和同一台机器上,实际观察到的情况如下。这是一次定性分析,而非标准化基准测试——将其视为指南,而非绝对真理。
- 通用法语
- Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2(快速模式)。Qwen3在流畅度上保持领先,GLM-5表现非常接近,DeepSeek V3.2在法语中更容易产生幻觉。
- 结构化推理
- GLM-5 32B(思维模式)≈ Qwen3-32B(思维模式)。DeepSeek V3.2 在启用长思维功能时表现更优,但会带来3至5倍的token消耗。
- Python代码
- Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B。对于代码任务,建议使用 Qwen3-Coder。GLM-5 32B 作为通用模型表现尚可。
- 相同显存容量(24 GB)下的速度
- GLM-5 32B Q4 ≈ Qwen3-32B Q4(约 25 个 token/秒)。DeepSeek V3.2 无法装入 24 GB 显存:它是一个 685B 的 MoE 模型,无法参与这一显存档位的比较。
- 磁盘占用
- GLM-5 32B Q4 ≈ 19 GB。Qwen3-32B Q4 ≈ 20 GB。DeepSeek V3.2 在 Q4 量化下约为 380 GB——没有集群就无法考虑运行。
#故障排除
- 输出内容不知所云或完全是中文
- 分词器转换错误,或模板不正确。请检查用于转换的 llama.cpp 版本,确保 Modelfile 中包含 <|user|>、<|assistant|>、[gMASK]<sop> 等标签。
- 停止标记被忽略(回答无限生成)
- 在 Modelfile 中添加 PARAMETER stop "<|endoftext|>" 和 PARAMETER stop "<|user|>"。否则,模型可能会接连生成虚构的对话轮次。
- RTX 4090 在长上下文下出现 OOM 错误
- 当上下文长度超过 32k 时,KV 缓存会急剧膨胀。可设置 OLLAMA_KV_CACHE_TYPE=q8_0(缓存 VRAM 减少约 40%),或降低 num_ctx。
- 9B 模型在 4070 上的处理速度低于 10 个 token/秒
- 模型已有一部分从显存卸载到系统内存。请用 ollama ps 检查:PROCESSOR 列应显示 100% GPU。如果出现 CPU,请降低 num_ctx 或改用 Q3_K_M。
- 思考模式过于冗长
- GLM-5能够生成长链推理内容。若需截断,可在系统提示中明确要求「直接回答,不包含中间推理过程」。
#GLM-5.2 已发布:需要迁移吗?
自 2026 年 6 月 13 日起,智谱提供 GLM-5.2:采用 MoE 架构,约有 7530 亿个参数,使用 MIT 许可证,上下文长度为 1M,专为长时间运行的编程智能体打造。截至目前,这是本地运行支持最完善的「前沿」模型——Ollama 和 LM Studio 都有对应的 GGUF 量化版本(unsloth)。硬件需考虑配备 256 GB 内存的 Mac,或在 2-bit 量化下使用配备 RTX 4090 的机器:如果您的硬件已经能运行 GLM-5,本指南的安装步骤保持不变,只需更换模型标识。
#深入了解
GLM-5 值得适当投入以发挥其最大潜力。三个实用方向如下:
- 选择合适的量化
- Q4_K_M 是默认推荐的均衡选择,但只要上下文长度适中,GLM-5 32B 的 Q5_K_M 版本也能在 24 GB 显存中运行,并能明显提升代码生成质量。
- 通过Modelfile进行定制
- 系统提示、回复模板、采样参数:一个配置良好的 Modelfile 可以避免每次会话都重复指令。
- 在实际使用条件下与 Qwen3 比较
- 即将发布的《Qwen3-32B 与 GLM-5 对比指南》将提供一套比较测试方案,使用 30 个具有代表性的提示词(法语、代码、推理、内容归纳)。
推荐硬件: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — 适用于本地量化 LLM 的 PC 替代方案;并非教程中的 Mac 所有 AI 硬件 →
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。