🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
排名更新于 2026年9月22日
RTX 5090(Blackwell,32 GB GDDR7,1792 GB/s)是首个显存超过 24 GB 的消费级 GPU。Llama 70B Q4_K_M 能装入显存,并为上下文留出 12 GB 的余量。2026 年本地运行的绝对标杆。
RTX 5090 :可选购的本地 AI 替代方案 — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :
迷你PC是一台完整机器:请检查所需内存和软件兼容性。它不能替代macOS/MLX或CUDA。
为什么选择它?查看我们对 GMKtec EVO-X2 64 GB / 1 TB(Ryzen AI Max+ 395)的完整介绍 →
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。
GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。
ollama run laguna-xs.2
MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
Mamba-2 混合架构 + MoE,总参数量 32B,激活参数量 9B。长上下文下 RAM 用量减少约 70%。Apache 2.0。
ollama run granite4:small-h
MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。
ollama run qwen3:30b-a3b
NVIDIA 的 MoE 模型:总参数量 30B,激活参数量 3.5B,用于聊天、编程和推理。128k 上下文,具备 3.5B 模型的速度和 30B 模型的能力。2026 年 4 月发布。
ollama run nemotron-3-nano
MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。
ollama run qwen3-coder:30b
视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。
ollama run qwen3-vl:30b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 RTX 5090 上 |
|---|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 100 tok/s · Q5_K_M |
| #2 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · Q5_K_M |
| #3 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA 开放模型许可证 | 80 tok/s · Q8 |
| #4 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 75 tok/s · Q5_K_M |
| #5 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 100 tok/s · Q5_K_M |
| #6 | Nemotron 3 Nano 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA 开放模型许可证 | 80 tok/s · Q8 |
| #7 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · Q5_K_M |
| #8 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 100 tok/s · Q5_K_M |
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选:量化为Q4_K_M且模型大小低于30 GB的模型(保留2 GB上下文)。额外推荐30-70B(峰值5090)和MoE 100B(32 GB可解封DBRX、Mixtral 8x22B)。1792 GB/s = 消费端吞吐量纪录。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
RTX 5090 32 GB:Llama 70B 流畅吗?
是的——Llama 3.3 70B Q4_K_M(约 40 GB)无法完全装入单卡显存;Q3_K_M(约 30 GB)则可以,速度为每秒 35–45 个 token。Q5_K_M(约 48 GB)需要将部分模型卸载到 CPU。要毫不妥协地运行 70B Q4,应考虑 2 块 RTX 4090/5090,或配备至少 96 GB 内存的 Mac Studio。
RTX 5090 对比 2× RTX 4090 ?
5090 = 单卡 32 GB 显存 + 1792 GB/s。2×4090 = 48 GB 显存(分布在两张卡上)+ 每张卡 1008 GB/s。对于 70B Q4(约 40 GB)模型,2×4090 更有优势。对于 30–32B Q5 模型加长上下文,5090 更简单(没有跨卡拆分的额外开销)。参见 RTX 4090.
在5090上最优的量化级别是什么?
30B 模型可选 Q5_K_M(约 22 GB),70B 模型可选 Q4(约 40 GB,需部分卸载)。13–14B 模型可选 Q8,以获得最高质量(Qwen 3 14B 约 15 GB)。32B 模型采用 Q6_K 是很好的折中方案(约 25 GB)。
在RTX 5090上运行MoE模型?
优秀:Mixtral 8x22B Q4(约80 GB)无法容纳,但8x7B Q4(约28 GB)可达到80+ token/s。Qwen 3 30B-A3B Q8(约32 GB)运行也流畅。详见 智能体/混合专家模型排行榜.