🇺🇸 Gemma 4 26B-A4B MoE
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
排名更新于 2026年9月22日
Apple Silicon(M1 至 M4)架构在 CPU 和 GPU 之间共享内存 —— 非常适合 LLM。7-32B 模型在 Mac 上运行出色,尤其是配备 32-128 GB 统一内存的 Pro/Max 版本。
比较以下产品的价格: Mac mini M5 Pro(24 GB / 512 GB) 在我们的合作伙伴商家处(已验证产品页面):
为什么选择它?查看我们关于 Mac mini M5 Pro(24 GB / 512 GB)的完整介绍 →
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。
ollama run qwen3.8:27b
GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。
ollama run gemma4:31b
300 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。支持兼容 OpenAI 的工具调用。发布于 2026 年 4 月 29 日。
ollama run granite4.1:30b
DiffusionGemma 26B(Google):基于扩散的 Gemma 视觉语言模型,指令微调版,128k 上下文,Q4 量化下占用 15 GB 显存。Apache 2.0 许可证。2026 年 6 月发布。
# HuggingFace : google/diffusiongemma-26B-A4B-it
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 Apple M4 Pro(48 GB)上 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q8 |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q8 |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q8 |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q8 |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | 12 tok/s · Q8 |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | 12 tok/s · Q8 |
| #8 | DiffusionGemma 26B-A4B Instruct | 26B | 15 GB | 128 000 | Apache 2.0 | 14 tok/s · Q8 |
你已经找到了适用于 Apple Silicon 的最佳模型。Mac 套件提供按芯片和内存容量分类的完整表格(第 4 章),并解释 MLX 在什么情况下能真正带来显著差异(第 3 章)。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
我们排除小于 3B 的模型(无法充分利用硬件)和大于 72B 的模型(普通消费级 Mac 的内存容纳不下)。7–32B 的模型以及采用自由许可证的模型会获得加分:前者是 MacBook Pro / Mac Studio 的最佳规模区间,后者则有利于通常需要转换权重的 MLX。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
在 Mac 上选 Ollama 还是 MLX?
Ollama 是最简单的(仅需 1 条命令)。MLX 速度更快,快 20-30%,但需要权重转换和少量终端操作。LM Studio 结合了两者(界面中可选择 Ollama 或 MLX)。
什么样的Mac可以运行70B模型?
Mac Studio M2 Ultra(192 GB)、M3 Max 128 GB 或 M4 Max 128 GB。70B 模型采用 Q4 量化时需要 40 GB,另加上下文所需的内存,因此建议至少配备 64 GB。M4 Pro 48 GB 可以运行 Q3 量化版本,但需要作出一些取舍。
MacBook Air M2 16 GB能否运行一个LLM?
是的——Mistral 7B Q4(4-5 GB)或Gemma 2 9B Q4(6 GB)在M2 16 GB上运行。吞吐量约为10-15个token/秒。详见 专属指南.
MLX在Mac上比llama.cpp更快吗?
是的,MLX 通常比 llama.cpp 快 15–30%,因为 MLX 是为 Apple Silicon 原生设计的。但 llama.cpp 支持更多模型和量化方式。日常使用:Ollama(llama.cpp)。追求最高性能:MLX。