进阶 11 分钟Ollama

使用 Ollama 在本地运行 GLM-5:挑战者 open-weights

GLM-5 是智谱 AI(清华大学)推出的新一代开放权重模型系列。它提供 9B 和 32B 版本,采用宽松许可证,推理能力扎实,法语表现尚可,代码表现也不错。本指南介绍如何使用 Ollama 在本地安装 GLM-5,实测其在 RTX 4070 和 4090 上的性能,并在相同任务上将其与 Qwen3-32B 和 DeepSeek V3.2 进行比较。

作者: Mohamed Meguedmi·更新于 2026-08-11·已在 Windows、macOS 和 Linux 上测试

#为何选择 GLM-5?

GLM-5 的知名度不及 Qwen3 或 DeepSeek,但它是近几个月推出的最成熟的中国开放权重模型之一。9B 版本面向配置较低的设备(12 GB 显存就足够),32B 版本则面向 RTX 4090 和 Mac Studio。按其宣称,在与 Qwen3-32B 相同的模型规模下,它在 MMLU 和 HumanEval 上的得分接近 GPT-4o-mini。

在实际使用中,GLM-5 在三个方面表现突出:结构化推理(thinking 模式与 Qwen3 类似)、法语能力(面对复杂提示时明显优于 Qwen3-9B),以及 Python 编程。令人失望的地方是:尽管承诺上下文可达 1M,本地运行时上下文窗口的上限仍为 128k,而且没有集成视觉能力(与 GLM-4V 不同)。

i
GLM-5 vs GLM 5.1
本指南介绍 GLM-5(初始版本)。后来发布的 GLM 5.1 修复了代码能力方面的多项退步,并改善了指令遵循能力。如果您今天从零开始,请在作出选择前,也阅读本站的 GLM 5.1 指南。

#硬件要求

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
GLM-5 9B Q4_K_M
≈ 5.5 GB 显存。RTX 3060 12 GB,RTX 4060 8 GB(部分卸载),Mac M2 16 GB 统一内存,所有 RTX 4070 及以上型号。
GLM-5 32B Q4_K_M
约需 19 GB 显存。配备 24 GB 显存的 RTX 4090 可以较为轻松地运行,RTX 3090 24 GB 也一样。使用 16 GB 显存的显卡(4080)时,需要降至 Q3_K_M 量化。
GLM-5 32B Q5_K_M
约需 22–23 GB VRAM。RTX 4090 能装下,但剩余显存很少。若启用长上下文,请优先选择 Q4_K_M。
Ollama 0.6.0+
对 GLM-5 的支持是逐步加入的。要正确支持其分词器和聊天模板,需要使用较新的 Ollama 版本。
磁盘
预计需要 6 GB(9B Q4)至 23 GB(32B Q5)的磁盘空间。如果同时保留多个量化版本,则需要更多空间。

#1. 从 Hugging Face 下载模型

智谱 AI 在 Hugging Face 上的 THUDM 组织中发布了官方权重。您需要关注以下两个仓库:

9B 官方仓库
https://huggingface.co/THUDM/glm-5-9b-chat
32B 官方仓库
https://huggingface.co/THUDM/glm-5-32b-chat

这些仓库包含 safetensors 格式的权重(FP16/BF16)。使用 Ollama 时,您需要 GGUF 格式。有两种选择:下载社区已转换好的 GGUF 文件,或自行转换。

→
捷径:使用现成的 GGUF
在 Hugging Face 上搜索 glm-5 GGUF —— bartowski、mradermacher 和 lmstudio-community 已发布最新的 Q4_K_M、Q5_K_M 和 Q8_0 转换版本。这是 95% 情况下的实用选择。

#2. GGUF格式及必要时的转换

如果没有任何官方或社区提供的GGUF版本适用(如特殊变体或特定量化方式),则需通过llama.cpp进行转换。标准流程如下:

克隆 llama.cpp 并安装依赖
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
pip install -r requirements.txt
将 HF 转换为 GGUF FP16
python convert_hf_to_gguf.py /chemin/vers/glm-5-9b-chat \
  --outfile glm-5-9b-chat-f16.gguf \
  --outtype f16
量化为 Q4_K_M
./build/bin/llama-quantize \
  glm-5-9b-chat-f16.gguf \
  glm-5-9b-chat-Q4_K_M.gguf \
  Q4_K_M
!
GLM 分词器
GLM 使用由 SentencePiece 衍生的分词器。如果 convert_hf_to_gguf.py 报错提示缺少特殊 token,请更新 llama.cpp(GLM-5 支持已在最近的一次 PR 中加入)。版本过旧时,转换虽然会成功,但推理会输出不知所云的内容。

#3. 在 Ollama(本地)中安装GLM-5

拿到 GGUF 文件后,通过 Modelfile 导入 Ollama。在 GGUF 文件同目录下创建一个名为 Modelfile 的文件:

GLM-5 9B 的 Modelfile
FROM ./glm-5-9b-chat-Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER num_ctx 32768
PARAMETER stop "<|user|>"
PARAMETER stop "<|endoftext|>"

TEMPLATE """[gMASK]<sop>{{ if .System }}<|system|>
{{ .System }}{{ end }}<|user|>
{{ .Prompt }}<|assistant|>
{{ .Response }}"""

SYSTEM """Tu es un assistant utile, précis et concis. Tu réponds en français sauf demande contraire."""

然后在 Ollama 中创建模型,确认其已注册,并启动它:

创建与启动
ollama create glm5-9b -f Modelfile
ollama list
ollama run glm5-9b
→
待原生支持到来时
如果 Ollama 在其官方模型库中发布 GLM-5(无需 Modelfile 即可运行 ollama run glm5),请优先使用该版本:聊天模板将由上游维护,您也能避免停止 token 相关的错误。

#4. 法语质量测试

对于一个主要使用中文和英文数据训练的模型来说,GLM-5 的法语能力是它的一大优势。以下三个实用提示词可用于快速评估:

  1. 01
    结构化推理
    “一个瓶子和它的瓶盖共花费 1.10 欧元。瓶子比瓶盖贵 1 欧元。瓶盖多少钱?请详细说明你的推理过程。”GLM-5 9B 应给出 0.05 欧元的答案,并列出方程。
  2. 02
    长文本摘要
    粘贴一篇2000词的文章,要求用法语将其概括成5个要点。32B版本能保持清晰的思路,9B版本在长上下文下会将内容缩减得过多。
  3. 03
    结合上下文的 Python 代码
    ‘编写一个Python函数,解析以';'为分隔符的CSV文件,处理引号并返回字典生成器,不使用pandas。’ GLM-5生成的代码规范且符合Python习惯,而Qwen3-9B则倾向于直接导入csv,且未正确处理引号。
i
思考模式
GLM-5 支持通过系统前缀启用思维链模式(确切格式请参阅 HF 上的模型卡)。启用后,推理质量会提升一个档次,但 token 用量也会增加约 30–40%。

#5. RTX 4070 和 4090 上实测的 token/秒

使用 Ollama 0.6.x 测试,启用 OLLAMA_FLASH_ATTENTION=1,上下文8k,提示500个token,生成300个token。5次运行的平均值。

RTX 4070 12 GB — GLM-5 9B Q4_K_M
约 55-60 tokens/sec。对于聊天来说很舒适,模型 100% 驻留在 VRAM 中。
RTX 4070 12 GB — GLM-5 9B Q5_K_M
≈ 48–52 tokens/秒。质量略有提升,但经测量,速度有所下降。
RTX 4090 24 GB — GLM-5 9B Q4_K_M
≈ 110–120 tokens/sec。对于 9B 模型来说,这一配置远超所需。
RTX 4090 24 GB — GLM-5 32B Q4_K_M
约 22–26 token/秒。目标使用场景:以适合交互使用的生成速度获得 32B 模型的质量。
RTX 4090 24 GB — GLM-5 32B Q5_K_M
约 18–22 tokens/sec。上下文 > 16k 时,显存余量较紧。
Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
约 12–15 tokens/秒。用于非流式任务(摘要、分析)尚可。
→
启用Flash Attention
在环境变量中设置 OLLAMA_FLASH_ATTENTION=1,可让 GLM-5 32B 的性能提升 10–15%,并使长上下文下的显存占用保持稳定。配合 OLLAMA_KV_CACHE_TYPE=q8_0,可额外释放 2–3 GB 显存,且不会出现明显的效果下降。

#GLM-5、Qwen3-32B 与 DeepSeek V3.2 对比

在相同的提示和同一台机器上,实际观察到的情况如下。这是一次定性分析,而非标准化基准测试——将其视为指南,而非绝对真理。

通用法语
Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2(快速模式)。Qwen3在流畅度上保持领先,GLM-5表现非常接近,DeepSeek V3.2在法语中更容易产生幻觉。
结构化推理
GLM-5 32B(思维模式)≈ Qwen3-32B(思维模式)。DeepSeek V3.2 在启用长思维功能时表现更优,但会带来3至5倍的token消耗。
Python代码
Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B。对于代码任务,建议使用 Qwen3-Coder。GLM-5 32B 作为通用模型表现尚可。
相同显存容量(24 GB)下的速度
GLM-5 32B Q4 ≈ Qwen3-32B Q4(约 25 个 token/秒)。DeepSeek V3.2 无法装入 24 GB 显存:它是一个 685B 的 MoE 模型,无法参与这一显存档位的比较。
磁盘占用
GLM-5 32B Q4 ≈ 19 GB。Qwen3-32B Q4 ≈ 20 GB。DeepSeek V3.2 在 Q4 量化下约为 380 GB——没有集群就无法考虑运行。
i
实用结论
如果您有 24 GB 显存,想要一个 32B 通用模型,就需要在 GLM-5 和 Qwen3 之间做选择。对于结构化推理,或想尝试一些主流选择之外的模型,GLM-5 更值得考虑;Qwen3-32B 仍是稳妥之选。DeepSeek V3.2 仍然适合通过 API 使用或在大型服务器上运行——只有 24 GB 显存时,它不在考虑范围内。

#故障排除

输出内容不知所云或完全是中文
分词器转换错误,或模板不正确。请检查用于转换的 llama.cpp 版本,确保 Modelfile 中包含 <|user|>、<|assistant|>、[gMASK]<sop> 等标签。
停止标记被忽略(回答无限生成)
在 Modelfile 中添加 PARAMETER stop "<|endoftext|>" 和 PARAMETER stop "<|user|>"。否则,模型可能会接连生成虚构的对话轮次。
RTX 4090 在长上下文下出现 OOM 错误
当上下文长度超过 32k 时,KV 缓存会急剧膨胀。可设置 OLLAMA_KV_CACHE_TYPE=q8_0(缓存 VRAM 减少约 40%),或降低 num_ctx。
9B 模型在 4070 上的处理速度低于 10 个 token/秒
模型已有一部分从显存卸载到系统内存。请用 ollama ps 检查:PROCESSOR 列应显示 100% GPU。如果出现 CPU,请降低 num_ctx 或改用 Q3_K_M。
思考模式过于冗长
GLM-5能够生成长链推理内容。若需截断,可在系统提示中明确要求「直接回答,不包含中间推理过程」。

#GLM-5.2 已发布:需要迁移吗?

自 2026 年 6 月 13 日起,智谱提供 GLM-5.2:采用 MoE 架构,约有 7530 亿个参数,使用 MIT 许可证,上下文长度为 1M,专为长时间运行的编程智能体打造。截至目前,这是本地运行支持最完善的「前沿」模型——Ollama 和 LM Studio 都有对应的 GGUF 量化版本(unsloth)。硬件需考虑配备 256 GB 内存的 Mac,或在 2-bit 量化下使用配备 RTX 4090 的机器:如果您的硬件已经能运行 GLM-5,本指南的安装步骤保持不变,只需更换模型标识。

i
专题指南即将发布
一份完整的 GLM-5.2 指南(包含 Ollama 和 LM Studio 的安装配置、现实可行的设置以及对运行速度的合理预期)正在准备中,本周将在网站上发布。

#深入了解

GLM-5 值得适当投入以发挥其最大潜力。三个实用方向如下:

选择合适的量化
Q4_K_M 是默认推荐的均衡选择,但只要上下文长度适中,GLM-5 32B 的 Q5_K_M 版本也能在 24 GB 显存中运行,并能明显提升代码生成质量。
通过Modelfile进行定制
系统提示、回复模板、采样参数:一个配置良好的 Modelfile 可以避免每次会话都重复指令。
在实际使用条件下与 Qwen3 比较
即将发布的《Qwen3-32B 与 GLM-5 对比指南》将提供一套比较测试方案,使用 30 个具有代表性的提示词(法语、代码、推理、内容归纳)。

推荐硬件: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — 适用于本地量化 LLM 的 PC 替代方案;并非教程中的 Mac 所有 AI 硬件 →

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。