🇺🇸 Gemma 4 E4B
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
排名更新于 09/10/2026
16 GB统一内存是Mac本地AI的最低实用配置。macOS占用4 GB,剩余约10-11 GB可用于Q4_K_M量化下的LLM。7-9B(Mistral,Qwen 3,Gemma 4)是最佳选择。
比较以下产品的价格: Mac mini M5 Pro(24 GB / 512 GB) 在我们的合作伙伴商家处(已验证产品页面):
为什么选择它?查看我们关于 Mac mini M5 Pro(24 GB / 512 GB)的完整介绍 →
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 €价位的电脑 →
联盟链接 — 哪个LLM 可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
Dense 8B Apache 2.0,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。MMLU 73.84,HumanEval 85.37。发布于 2026 年 4 月 29 日。
# HuggingFace : ibm-granite/granite-4.1-8b
Granite 4.2 8B(IBM):Apache 2.0 稠密模型,128k 上下文,Q4 量化约需 4.6 GB 显存。面向企业级多语言聊天、代码和推理。
ollama pull granite4.2
OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。
ollama pull glm-5.3
7B 稠密模型,100% 开放(权重 + 数据 + 代码)。为研究提供完全透明的信息。
ollama run olmo-3:7b
思考/快速混合模式。支持 119 种语言,原生上下文为 32k(通过 YaRN 可扩展至 131k)。
ollama run qwen3:8b
新一代 9B 稠密模型。262k 上下文,改进的混合思考能力。
ollama run qwen3.5:9b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 Apple M2(16 GB)上 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | 14 tok/s · Q4_K_M |
| #2 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · Q8 |
| #3 | Granite 4.2 8B | 8B | 4.6 GB | 128 000 | Apache 2.0 | 32 tok/s · Q8 |
| #4 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | 32 tok/s · Q8 |
| #5 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | 32 tok/s · Q8 |
| #6 | OLMo 3 7B | 7B | 5 GB | 8 192 | Apache 2.0 | 12 tok/s · Q8 |
| #7 | Qwen 3 8B | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · Q8 |
| #8 | Qwen 3.5 9B | 9B | 6 GB | 262 000 | Apache 2.0 | 9 tok/s · Q8 |
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地编程副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选:Q4_K_M 量化后占用低于 10 GB 的 1–13B 模型(为 macOS 和较长上下文留出 6 GB)。加分项:3–9B 模型(峰值 16 GB)。活跃参数较少的 MoE 模型(Qwen 3 30B-A3B)在容量上限附近也可加分。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
16 GB 内存的 Mac:Mistral 7B 还是 Qwen 3 8B?
Qwen 3 8B 的能力略强一些(推理、编程),Q4 量化后可装入内存(约 5 GB)。Mistral 7B 更快(约 25–30 token/秒,而 Qwen 为 22–28 token/秒)。在法语方面,Mistral 仍有优势。两者在 16 GB 内存下都表现出色。
Mac mini M4 16 GB 作为持续 24/7 运行的 LLM 服务器?
是的,非常合适。Ollama + Open WebUI,端口 11434 位于反向代理后方。Mistral 7B Q4 或 Qwen 3 8B Q4,速度超过 30 token/s。空闲功耗 10 W,负载下功耗 35 W。查看 Mac mini M4.
能否在 16 GB 内存上运行 Qwen 3 30B-A3B?
勉强够用:Q4_K_M 下整个模型需要约 17 GB,但 MoE 只加载约 3 GB 的活跃权重。配合 mmap 和少量 swap,可以运行,但速度会变慢(15–20 tokens/秒)。24 GB 或 32 GB 会宽裕得多。参见 Mac 32 GB.
运行 LLM,选 16 GB Mac 还是配备 RTX 4060 16 GB 的 PC?
RTX 4060 16 GB 运行 7–9B 模型的速度约为 Mac 的 2 倍(专用 GDDR6 显存,对比带宽为 100–120 GB/s 的统一内存)。Mac 在静音、续航和安装便捷性方面占优。参见 GPU 对比.