首页 › 目录 › 2026 年配备 8 GB 统一内存的 Mac 上的最佳 LLM

2026 年配备 8 GB 统一内存的 Mac 上的最佳 LLM

◆ Mac — 在你的 Mac 上充分利用本地 AI — 统一内存、MLX、适合你芯片的模型 · 24 欧元 · 或所有套装 49 欧元 →

排名更新于 2026年9月22日

在配备 8 GB 内存的 Mac(M1/M2/M3 Air、MacBook Air M4 基础版、Mac mini M2 基础版)上,macOS 占用约 4 GB,剩余约 3–4 GB 可用于 LLM。为保持运行流畅,应将选择范围限制在采用 Q4_K_M 量化的 1–3B 模型。

本地 AI 的优惠和替代方案

比较以下产品的价格: Mac mini M5 Pro(24 GB / 512 GB) 在我们的合作伙伴商家处(已验证产品页面):

为什么选择它?查看我们关于 Mac mini M5 Pro(24 GB / 512 GB)的完整介绍 →

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。

排名

1

🇺🇸 Gemma 4 E2B

Google · 2B 参数 · Apache 2.0 · 128 000 tokens ctx

Gemma 4 E2B:有效参数 20 亿(总参数 51 亿),Q4 约需 3 GB 显存(Ollama 权重:QAT 下为 4.3 GB,默认为 7.2 GB)。支持文本和图像多模态,128k 上下文,Apache 2.0。

排名原因 Gemma 4 E2B:有效参数 20 亿(总参数 51 亿),Q4 约需 3 GB 显存(Ollama 权重:QAT 下为 4.3 GB,默认为 7.2 GB)。支持文本和图像多模态,128k 上下文,Apache 2.0。
ollama run gemma4:e2b
在 Apple M2(16 GB)上
FP16
10 GB · 20 tok/s
2

🇺🇸 Granite 4.1 3B Instruct

IBM · 30 亿参数 · Apache 2.0 · 131 072 tokens ctx

30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。

排名原因 30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。
ollama run granite4.1:3b
在 Apple M2(16 GB)上
FP16
6 GB · 25 tok/s
3

🇺🇸 Granite 4.1

IBM · 30 亿参数 · Apache 2.0 · 128 000 tokens ctx

Granite 4.1(3B,Apache 2.0 许可证):IBM Granite 4.1 系列的通用 Ollama 标签,128k 上下文,支持工具调用和编程。2026 年 5 月发布。

排名原因 Granite 4.1(3B,Apache 2.0 许可证):IBM Granite 4.1 系列的通用 Ollama 标签,128k 上下文,支持工具调用和编程。2026 年 5 月发布。
ollama run granite4.1
在 Apple M2(16 GB)上
FP16
6 GB · 50 tok/s
4

🇺🇸 Granite 4.0 3B Vision

IBM · 30 亿参数 · Apache 2.0 · 上下文:16 384 个 token

专用于企业文档信息提取的 3B VLM。OCR、表格、表单。

排名原因 专用于企业文档信息提取的 3B VLM。OCR、表格、表单。
# HuggingFace : ibm-granite/granite-4.0-3b-vision
在 Apple M2(16 GB)上
FP16
6.5 GB · 25 tok/s
5

🇫🇷 SmolLM3 3B

HuggingFace · 30 亿参数 · Apache 2.0 · 128 000 tokens ctx

30 亿参数,双模式(思考/非思考)。支持 6 种语言。MMLU 59.7,GSM8K 70.9。完全开放(数据和训练方法)。

排名原因 30 亿参数,双模式(思考/非思考)。支持 6 种语言。MMLU 59.7,GSM8K 70.9。完全开放(数据和训练方法)。
# HuggingFace : HuggingFaceTB/SmolLM3-3B
在 Apple M2(16 GB)上
FP16
6 GB · 25 tok/s
6

🇨🇳 DeepSeek-OCR

DeepSeek · 30 亿参数 · MIT · 8192 token 上下文

OCR 专用模型,3B 参数,MIT 许可证。“光学压缩”方法广受好评。基于 DeepEncoder。

排名原因 OCR 专用模型,3B 参数,MIT 许可证。“光学压缩”方法广受好评。基于 DeepEncoder。
ollama run deepseek-ocr:3b
在 Apple M2(16 GB)上
FP16
6 GB · 25 tok/s
7

🇨🇳 MiniCPM5 1B SFT

OpenBMB · 1.1B 参数 · Apache 2.0 · 上下文长度:32,768 tokens

1.1B,Apache 2.0,OpenBMB。经过英中双语 SFT,具备工具调用能力,针对端侧运行优化。Q4 量化下显存占用小于 1 GB,适用于智能手机和配置较低的笔记本电脑。

排名原因 1.1B,Apache 2.0,OpenBMB。经过英中双语 SFT,具备工具调用能力,针对端侧运行优化。Q4 量化下显存占用小于 1 GB,适用于智能手机和配置较低的笔记本电脑。
# HuggingFace : openbmb/MiniCPM5-1B-SFT
在 Apple M2(16 GB)上
FP16
2.2 GB · 45 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 Apple M2(16 GB)上
#1 Gemma 4 E2B 2B 3 GB 128 000 Apache 2.0 20 tok/s · FP16
#2 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 25 tok/s · FP16
#3 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0 50 tok/s · FP16
#4 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0 25 tok/s · FP16
#5 SmolLM3 3B 3B 2 GB 128 000 Apache 2.0 25 tok/s · FP16
#6 DeepSeek-OCR 3B 2 GB 8 192 MIT 25 tok/s · FP16
#7 MiniCPM5 1B SFT 1.1B 0.6 GB 32 768 Apache 2.0 45 tok/s · FP16
Mac 套装

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选条件:1–4B 模型,其 Q4_K_M 版本占用低于 4 GB(为 macOS 和上下文合计留出 4 GB)。1–3B 模型(峰值 8 GB)和 ≤2B 模型(无需交换)额外加分。Phi-4 Mini、Llama 3.2 3B 和 Gemma 4 3B 表现领先。

考虑的标准:

  • Q4_K_M ≤ 4 GB
  • macOS 不使用交换内存
  • Tokens/sec ≥ 20
  • 可用上下文长度为 2–4k

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

8 GB 的 Mac 真的能运行 LLM 吗?

是的,但较为有限。Phi-4 Mini 3.8B Q4(约2.3 GB)或 Llama 3.2 3B Q4(约2 GB)的运行速度为每秒25至35个token。macOS占用4 GB内存,剩余2至3 GB——虽然紧张,但足以支持短对话使用。

Mac mini M2 8 GB 与 MacBook Air M4 16 GB 哪个更好?

Air M4 16 GB 明显更优:2倍的内存可流畅运行7-8B(Mistral,Qwen 3)模型。mini M2 8 GB 最多仅支持3B模型。详见 Mac 16GB.

8 GB 内存适合哪种量化方式?

Q4_K_M 仍是最佳平衡点。Q3_K_M 可以让 Mistral 7B(约 3.5 GB)装入内存,但质量会明显下降。与其使用质量受损的 7B Q3,不如选择能充分发挥效果的 3B Q4。

本地运行 LLM 真的需要 16 GB 内存吗?

如果要认真使用,是的——Apple 在 2025 年也已取消所有 M4 Mac 的 8 GB 内存配置。对于在现有 Mac 上偶尔测试,8 GB 内存足以用 1–3B 模型进行初步体验。参见 MacBook Air M1.

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €