🇺🇸 Gemma 4 E2B
Gemma 4 E2B:有效参数 20 亿(总参数 51 亿),Q4 约需 3 GB 显存(Ollama 权重:QAT 下为 4.3 GB,默认为 7.2 GB)。支持文本和图像多模态,128k 上下文,Apache 2.0。
ollama run gemma4:e2b
排名更新于 2026年9月22日
在配备 8 GB 内存的 Mac(M1/M2/M3 Air、MacBook Air M4 基础版、Mac mini M2 基础版)上,macOS 占用约 4 GB,剩余约 3–4 GB 可用于 LLM。为保持运行流畅,应将选择范围限制在采用 Q4_K_M 量化的 1–3B 模型。
比较以下产品的价格: Mac mini M5 Pro(24 GB / 512 GB) 在我们的合作伙伴商家处(已验证产品页面):
为什么选择它?查看我们关于 Mac mini M5 Pro(24 GB / 512 GB)的完整介绍 →
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。
Gemma 4 E2B:有效参数 20 亿(总参数 51 亿),Q4 约需 3 GB 显存(Ollama 权重:QAT 下为 4.3 GB,默认为 7.2 GB)。支持文本和图像多模态,128k 上下文,Apache 2.0。
ollama run gemma4:e2b
30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。
ollama run granite4.1:3b
Granite 4.1(3B,Apache 2.0 许可证):IBM Granite 4.1 系列的通用 Ollama 标签,128k 上下文,支持工具调用和编程。2026 年 5 月发布。
ollama run granite4.1
专用于企业文档信息提取的 3B VLM。OCR、表格、表单。
# HuggingFace : ibm-granite/granite-4.0-3b-vision
30 亿参数,双模式(思考/非思考)。支持 6 种语言。MMLU 59.7,GSM8K 70.9。完全开放(数据和训练方法)。
# HuggingFace : HuggingFaceTB/SmolLM3-3B
OCR 专用模型,3B 参数,MIT 许可证。“光学压缩”方法广受好评。基于 DeepEncoder。
ollama run deepseek-ocr:3b
1.1B,Apache 2.0,OpenBMB。经过英中双语 SFT,具备工具调用能力,针对端侧运行优化。Q4 量化下显存占用小于 1 GB,适用于智能手机和配置较低的笔记本电脑。
# HuggingFace : openbmb/MiniCPM5-1B-SFT
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 Apple M2(16 GB)上 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E2B | 2B | 3 GB | 128 000 | Apache 2.0 | 20 tok/s · FP16 |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | 25 tok/s · FP16 |
| #3 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | 50 tok/s · FP16 |
| #4 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | 25 tok/s · FP16 |
| #5 | SmolLM3 3B | 3B | 2 GB | 128 000 | Apache 2.0 | 25 tok/s · FP16 |
| #6 | DeepSeek-OCR | 3B | 2 GB | 8 192 | MIT | 25 tok/s · FP16 |
| #7 | MiniCPM5 1B SFT | 1.1B | 0.6 GB | 32 768 | Apache 2.0 | 45 tok/s · FP16 |
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选条件:1–4B 模型,其 Q4_K_M 版本占用低于 4 GB(为 macOS 和上下文合计留出 4 GB)。1–3B 模型(峰值 8 GB)和 ≤2B 模型(无需交换)额外加分。Phi-4 Mini、Llama 3.2 3B 和 Gemma 4 3B 表现领先。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
8 GB 的 Mac 真的能运行 LLM 吗?
是的,但较为有限。Phi-4 Mini 3.8B Q4(约2.3 GB)或 Llama 3.2 3B Q4(约2 GB)的运行速度为每秒25至35个token。macOS占用4 GB内存,剩余2至3 GB——虽然紧张,但足以支持短对话使用。
Mac mini M2 8 GB 与 MacBook Air M4 16 GB 哪个更好?
Air M4 16 GB 明显更优:2倍的内存可流畅运行7-8B(Mistral,Qwen 3)模型。mini M2 8 GB 最多仅支持3B模型。详见 Mac 16GB.
8 GB 内存适合哪种量化方式?
Q4_K_M 仍是最佳平衡点。Q3_K_M 可以让 Mistral 7B(约 3.5 GB)装入内存,但质量会明显下降。与其使用质量受损的 7B Q3,不如选择能充分发挥效果的 3B Q4。
本地运行 LLM 真的需要 16 GB 内存吗?
如果要认真使用,是的——Apple 在 2025 年也已取消所有 M4 Mac 的 8 GB 内存配置。对于在现有 Mac 上偶尔测试,8 GB 内存足以用 1–3B 模型进行初步体验。参见 MacBook Air M1.