首页 › 评测与测试 › GLM 编程计划

GLM Coding Plan:我们的实测评价

专为代码助手设计的 GLM 模型 API 接入服务——由以开放权重形式发布模型权重的实验室提供。

更新于 2026年8月26日 · 作者: Mohamed Meguedmi · 包含联盟营销链接

4
/ 5
我们的结论

目前,将代码助手连接到大型模型时,这是性价比最高的方案——正是因为模型权重开放,而且您仍可转为本地运行。不过,确实有一点需要注意:部分订阅用户认为套餐配额不够透明。

适用人群使用Claude Code、Cline或Roo Code的开发者,希望获得一个无需支付美国API费用的大型代码模型;以及使用本地GLM时因VRAM限制而遇到瓶颈的用户。
如果符合以下情况,建议另选代码受严格 NDA 约束(请求会经由 Z.ai 服务器中转——保持本地运行);需要合同保障配额的用户。
z.ai 上的 GLM 编程计划首页:「在终端或 IDE 中描述您的需求,让 GLM 处理其余部分」
GLM Coding Plan — 2026年8月26日截图

究竟是什么?

GLM 是中国研究机构智谱 AI(国际品牌:Z.ai)的模型系列,智谱 AI 自 2026 年 1 月起在香港上市。其特别之处,也是本网站数月来持续介绍它的原因,是模型权重以开放权重形式发布。GLM-5、GLM-5.1、GLM-5.2 已收录在我们的目录中,并列出了各自的显存需求。

Coding Plan 是面向编程的 API 订阅服务:它通过与现有助手(Claude Code、Cline、Roo Code)兼容的协议提供 GLM 模型,价格显著低于同等的美国 API 服务。理念很简单:您的编程工具感觉不到区别,账单却会体现出来。

我们的测试:在消费级 GPU 上本地运行 GLM 的能力极限

在评估 API 之前,我们先在测试机器(RTX 5070 Ti 12 GB + Intel Core Ultra 9 275HX,CachyOS,Ollama)上将本地运行方案推到了极限。这正是开放权重模型系列的价值所在:问题不是「使用 API,否则就别无选择」,而是「从什么时候起,API 才成为必需」。以下是有实测数字支撑的答案:

测量 (26/08/2026)结果
已在本地测试的模型GLM-4.7-flash(量化 q4)
内存占用20 GB — 对于 12 GB 显存:模型卸载分配为 CPU 47% / GPU 53%
代码生成(Python 任务)35 tokens/s —— 流畅得令人惊讶
提示词处理(prefill)5.8 tokens/s ——真正的瓶颈
模型加载25 s

测量结果揭示的情况比“显存装不下”更细致:即使有一半卸载到 CPU 上,模型 生成 每秒35个token——适合聊天场景。但 提示处理 最高只能达到 5.8 token/秒:发送一个包含 2 000 token 的文件进行分析,在输出第一个字之前,就已经要经历五分多钟没有任何输出的等待。而代码助手一直都在做这件事——每次迭代都重新读取您的文件。

结论明确:在配备 12 GB 显存的消费级 GPU 上,这一系列模型 无法用作本地编程智能体,原因不在生成阶段,而在预填充(prefill)阶段。这正是 Coding Plan 要弥补的缺口:提供同一系列的模型,预填充即时完成,同时让您的 GPU 保持空闲。如果您的显存达到或超过 24 GB,请重新计算—— 配置工具 会根据您的机器给出计算结果。

价格

Coding Plan 提供多个档位(从供个人使用的入门档,到供多智能体高强度使用的“Max”档)。2026 年 8 月观察到的价格从入门档每月几美元到高档每月几十美元不等,大致比 Anthropic 或 OpenAI 的同类订阅低一个数量级。Z.ai 经常推出首月优惠:订阅前请核实当前价格,因为价格变化很快。

优势与局限

优点
  • 开放权重 = 无锁定:您的提示、工作流甚至模型均可本地恢复
  • 可与现有代码助手(Claude Code、Cline、Roo Code)兼容,无需更换工具
  • 入门价格远低于同等的美国API服务
  • 实力雄厚的企业:智谱AI,香港上市公司,开放模型领域的重要研究机构之一
保留意见
  • 部分订阅用户认为配额不透明(“3× Claude”的说法在高峰时段受到质疑)——截至 2026 年 8 月,Trustpilot 上基于 32 条评价的评分为 2.1/5,请在第一周留意您的使用量
  • 根据相同反馈,客户支持响应缓慢
  • 您的请求会经过 Z.ai 的服务器:处理受 NDA 约束的代码时,应排除这一方案——任何 API 都有这一问题,这也是本地部署始终是我们参考标准的原因
查看GLM Coding Plan → 推广返佣链接——佣金由品牌支付,您无需承担额外费用

常见问题

可以免费使用GLM吗?

是的。GLM 模型以开放权重形式发布:量化版本可免费下载,并通过 Ollama 或 LM Studio 运行,但受您的显存容量限制。订阅仅涉及完整版本的 API 访问,这些版本运行在 Z.ai 的基础设施上。

GLM 编程计划能否与 Claude Code 兼容?

是的,这是其核心优势:API 提供了兼容的协议,只需将工具指向 Z.ai 的端点即可。Cline 和 Roo Code 也得到支持。配置过程仅需几分钟。

公布的配额可靠吗?

这是有记录的主要疑虑。部分订阅用户反映,高峰时段的配额消耗速度比宣传的更快,服务的 Trustpilot 评分也因此受到影响(评分为 2.1/5,样本较小,仅有 32 条评价)。我们的建议:先选择入门档套餐,衡量一周的实际使用情况,再做决定。

使用此方案,我的数据会去向何处?

您的请求会在 Z.ai 的服务器上处理。对于受保密协议(NDA)约束的专有代码或受监管的数据,规则不变:继续使用本地模型——这个系列的权重是开放的,因此确实可以在本地运行。

本地运行GLM需要什么样的设备?

较小的量化版本可以在配备 8 至 12 GB 显存的 GPU 上运行。较新的 MoE 版本需要更多显存(GLM-4.7-flash:以 q4 量化加载后约占 20 GB,这是在我们的机器上测得的)——这些需求可以通过我们的配置工具量化查看,它会准确告诉您,您的机器能够运行多大的模型。

本精选中的其他评测

HappyScribe4.5/5
转录与字幕

AI 转录、字幕制作和翻译服务,可选人工校对——我们所选企业中评分最高的欧洲企业。

阅读评测 →
Creao AI3.5/5
AI 智能体

将对话转换为可复用的智能体,连接至您的工具——无需编写代码。

阅读评测 →
Code Labs Academy3.5/5
培训

在线培训班——数据科学与AI、网络安全、UX和网页开发——具备德国质量认证。

阅读评测 →

透明度。 “查看 GLM 编码计划”链接是联盟链接(平台为 Impact.com)。如果您订阅,QuelLLM.fr 会获得由品牌支付的佣金,您无需承担额外费用。这笔佣金不会影响评分或内容:购买链接之前会先介绍免费的本地替代方案,客户评价中提出的保留意见也会原样公布。 完整方法论 · 法律声明.