🇺🇸 Gemma 4 26B-A4B MoE
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
排名更新于 2026年9月22日
32 GB 统一内存是兼顾品质的主流档位。在这一档位,您可以轻松运行 Mistral Small 24B Q4、Qwen 3 30B Q4 或 Qwen 3 30B-A3B MoE Q8。
比较以下产品的价格: Mac mini M5 Pro(24 GB / 512 GB) 在我们的合作伙伴商家处(已验证产品页面):
为什么选择它?查看我们关于 Mac mini M5 Pro(24 GB / 512 GB)的完整介绍 →
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。
ollama run qwen3:30b-a3b
MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。
ollama run qwen3-coder:30b
视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。
ollama run qwen3-vl:30b
韩国智能体型 MoE 模型,总参数 300 亿,激活参数 30 亿。支持 KR/EN/JP/ZH/TH/VI。Apache 2.0。MLA 注意力机制。
ollama pull hf.co/kakaoai/Kanana-2-30B-GGUF
Omni MoE,总参数量 30B,激活参数量 3B。流式语音。ASR 支持 119 种语言。Apache 2.0。
ollama run qwen3-omni:30b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 Apple M4 Pro(48 GB)上 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q8 |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q8 |
| #3 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #4 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA 开放模型许可证 | 30 tok/s · Q8 |
| #5 | Qwen3-Coder 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #6 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 | 40 tok/s · Q8 |
| #7 | Kanana 2 30B-A3B Thinking | 30B | 18 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #8 | Qwen 3 Omni 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选条件:30 亿至 350 亿参数的模型,采用 Q4_K_M 量化时内存占用低于 22 GB(为 macOS 和长上下文留出 10 GB)。另有 130 亿至 300 亿参数的模型(峰值内存占用 32 GB)及 MoE 模型(此处的 Qwen 3 30B-A3B 采用 Q8 量化)。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
32 GB 内存的 Mac 能运行 Q5 量化的 Mistral Small 24B 吗?
是:Q5_K_M 约 17 GB。根据芯片不同,性能在 18-25 tokens/秒之间(M1 Max 最快,M4 基础版最高效)。法语及通用任务表现优异。
在 32 GB 内存上运行 Qwen 3 30B-A3B(MoE),选 Q4 还是 Q8?
Q8(约 32 GB)刚好能装下——会占满内存。Q4(约 17 GB)更宽裕,可留出 15 GB 给上下文和其他应用。MoE 模型的 Q4 与 Q8 质量差异很小(基准测试差异低于 2%)。优先选择 Q4。
32 GB 对比 48 GB:质的飞跃体现在哪里?
48 GB 可运行 Q5 量化的 32B 稠密模型和 Q3 量化的 70B 模型。32 GB 仍仅限于 Q4 量化的 30B 模型或 Q8 量化的 MoE 30B-A3B 模型。如果购买全新设备,48 GB 更好。参见 Mac 48 GB.
配备 32 GB 内存的 Mac 适合运行哪个法国模型?
Mistral Small 3.1 24B Q4(约 13 GB)或 Mistral Small 3.2 24B Q4——法语任务的最佳选择。Magistral Small 24B 适用于推理。参见 法语模型排行榜.
通过我们对入围选手的详细对决深入了解: