GLM Coding Plan:我们的实测评价
专为代码助手设计的 GLM 模型 API 接入服务——由以开放权重形式发布模型权重的实验室提供。
目前,将代码助手连接到大型模型时,这是性价比最高的方案——正是因为模型权重开放,而且您仍可转为本地运行。不过,确实有一点需要注意:部分订阅用户认为套餐配额不够透明。

究竟是什么?
GLM 是中国研究机构智谱 AI(国际品牌:Z.ai)的模型系列,智谱 AI 自 2026 年 1 月起在香港上市。其特别之处,也是本网站数月来持续介绍它的原因,是模型权重以开放权重形式发布。GLM-5、GLM-5.1、GLM-5.2 已收录在我们的目录中,并列出了各自的显存需求。
Coding Plan 是面向编程的 API 订阅服务:它通过与现有助手(Claude Code、Cline、Roo Code)兼容的协议提供 GLM 模型,价格显著低于同等的美国 API 服务。理念很简单:您的编程工具感觉不到区别,账单却会体现出来。
我们的测试:在消费级 GPU 上本地运行 GLM 的能力极限
在评估 API 之前,我们先在测试机器(RTX 5070 Ti 12 GB + Intel Core Ultra 9 275HX,CachyOS,Ollama)上将本地运行方案推到了极限。这正是开放权重模型系列的价值所在:问题不是「使用 API,否则就别无选择」,而是「从什么时候起,API 才成为必需」。以下是有实测数字支撑的答案:
| 测量 (26/08/2026) | 结果 |
|---|---|
| 已在本地测试的模型 | GLM-4.7-flash(量化 q4) |
| 内存占用 | 20 GB — 对于 12 GB 显存:模型卸载分配为 CPU 47% / GPU 53% |
| 代码生成(Python 任务) | 35 tokens/s —— 流畅得令人惊讶 |
| 提示词处理(prefill) | 5.8 tokens/s ——真正的瓶颈 |
| 模型加载 | 25 s |
测量结果揭示的情况比“显存装不下”更细致:即使有一半卸载到 CPU 上,模型 生成 每秒35个token——适合聊天场景。但 提示处理 最高只能达到 5.8 token/秒:发送一个包含 2 000 token 的文件进行分析,在输出第一个字之前,就已经要经历五分多钟没有任何输出的等待。而代码助手一直都在做这件事——每次迭代都重新读取您的文件。
结论明确:在配备 12 GB 显存的消费级 GPU 上,这一系列模型 无法用作本地编程智能体,原因不在生成阶段,而在预填充(prefill)阶段。这正是 Coding Plan 要弥补的缺口:提供同一系列的模型,预填充即时完成,同时让您的 GPU 保持空闲。如果您的显存达到或超过 24 GB,请重新计算—— 配置工具 会根据您的机器给出计算结果。
价格
Coding Plan 提供多个档位(从供个人使用的入门档,到供多智能体高强度使用的“Max”档)。2026 年 8 月观察到的价格从入门档每月几美元到高档每月几十美元不等,大致比 Anthropic 或 OpenAI 的同类订阅低一个数量级。Z.ai 经常推出首月优惠:订阅前请核实当前价格,因为价格变化很快。
优势与局限
- 开放权重 = 无锁定:您的提示、工作流甚至模型均可本地恢复
- 可与现有代码助手(Claude Code、Cline、Roo Code)兼容,无需更换工具
- 入门价格远低于同等的美国API服务
- 实力雄厚的企业:智谱AI,香港上市公司,开放模型领域的重要研究机构之一
- 部分订阅用户认为配额不透明(“3× Claude”的说法在高峰时段受到质疑)——截至 2026 年 8 月,Trustpilot 上基于 32 条评价的评分为 2.1/5,请在第一周留意您的使用量
- 根据相同反馈,客户支持响应缓慢
- 您的请求会经过 Z.ai 的服务器:处理受 NDA 约束的代码时,应排除这一方案——任何 API 都有这一问题,这也是本地部署始终是我们参考标准的原因
常见问题
可以免费使用GLM吗?
是的。GLM 模型以开放权重形式发布:量化版本可免费下载,并通过 Ollama 或 LM Studio 运行,但受您的显存容量限制。订阅仅涉及完整版本的 API 访问,这些版本运行在 Z.ai 的基础设施上。
GLM 编程计划能否与 Claude Code 兼容?
是的,这是其核心优势:API 提供了兼容的协议,只需将工具指向 Z.ai 的端点即可。Cline 和 Roo Code 也得到支持。配置过程仅需几分钟。
公布的配额可靠吗?
这是有记录的主要疑虑。部分订阅用户反映,高峰时段的配额消耗速度比宣传的更快,服务的 Trustpilot 评分也因此受到影响(评分为 2.1/5,样本较小,仅有 32 条评价)。我们的建议:先选择入门档套餐,衡量一周的实际使用情况,再做决定。
使用此方案,我的数据会去向何处?
您的请求会在 Z.ai 的服务器上处理。对于受保密协议(NDA)约束的专有代码或受监管的数据,规则不变:继续使用本地模型——这个系列的权重是开放的,因此确实可以在本地运行。
本地运行GLM需要什么样的设备?
较小的量化版本可以在配备 8 至 12 GB 显存的 GPU 上运行。较新的 MoE 版本需要更多显存(GLM-4.7-flash:以 q4 量化加载后约占 20 GB,这是在我们的机器上测得的)——这些需求可以通过我们的配置工具量化查看,它会准确告诉您,您的机器能够运行多大的模型。