首页 › 目录 › 2026 年适用于 MacBook Air M1 的最佳 LLM

2026 年适用于 MacBook Air M1 的最佳 LLM

◆ Mac — 在你的 Mac 上充分利用本地 AI — 统一内存、MLX、适合你芯片的模型 · 24 欧元 · 或所有套装 49 欧元 →

排名更新于 09/10/2026

MacBook Air M1(8/16 GB,68 GB/s)发布于2020年,但仍能较好地运行30亿至70亿参数的LLM。带宽有限 → 宜选择高效模型。

本地 AI 的优惠和替代方案

MacBook Air M1 :可选购的本地 AI 替代方案 — MacBook Pro M5 Pro — 24 GB / 1 TB :

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟链接 — 哪个LLM 可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

排名

1

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B 参数 · Apache 2.0 · 16 000 tokens 上下文

OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。

排名原因 OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
在 Apple M1(16 GB)上
Q8
8 GB · 32 tok/s
2

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B 参数 · MIT · 128 000 tokens ctx

GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。

排名原因 GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。
ollama pull glm-5.3
在 Apple M1(16 GB)上
Q8
7 GB · 32 tok/s
3

🇺🇸 Granite 4.1 3B Instruct

IBM · 30 亿参数 · Apache 2.0 · 131 072 tokens ctx

30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。

排名原因 30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。
ollama run granite4.1:3b
在 Apple M1(16 GB)上
FP16
6 GB · 25 tok/s
4

🇺🇸 Granite 4.1

IBM · 30 亿参数 · Apache 2.0 · 128 000 tokens ctx

Granite 4.1(3B,Apache 2.0 许可证):IBM Granite 4.1 系列的通用 Ollama 标签,128k 上下文,支持工具调用和编程。2026 年 5 月发布。

排名原因 Granite 4.1(3B,Apache 2.0 许可证):IBM Granite 4.1 系列的通用 Ollama 标签,128k 上下文,支持工具调用和编程。2026 年 5 月发布。
ollama run granite4.1
在 Apple M1(16 GB)上
FP16
6 GB · 50 tok/s
5

🇺🇸 OLMo 3 7B

Allen AI · 7B 参数 · Apache 2.0 · 8192 token 上下文

7B 稠密模型,100% 开放(权重 + 数据 + 代码)。为研究提供完全透明的信息。

排名原因 7B 稠密模型,100% 开放(权重 + 数据 + 代码)。为研究提供完全透明的信息。
ollama run olmo-3:7b
在 Apple M1(16 GB)上
Q8
9 GB · 12 tok/s
6

🇺🇸 Granite 4.0 3B Vision

IBM · 30 亿参数 · Apache 2.0 · 上下文:16 384 个 token

专用于企业文档信息提取的 3B VLM。OCR、表格、表单。

排名原因 专用于企业文档信息提取的 3B VLM。OCR、表格、表单。
# HuggingFace : ibm-granite/granite-4.0-3b-vision
在 Apple M1(16 GB)上
FP16
6.5 GB · 25 tok/s
7

🇫🇷 SmolLM3 3B

HuggingFace · 30 亿参数 · Apache 2.0 · 128 000 tokens ctx

30 亿参数,双模式(思考/非思考)。支持 6 种语言。MMLU 59.7,GSM8K 70.9。完全开放(数据和训练方法)。

排名原因 30 亿参数,双模式(思考/非思考)。支持 6 种语言。MMLU 59.7,GSM8K 70.9。完全开放(数据和训练方法)。
# HuggingFace : HuggingFaceTB/SmolLM3-3B
在 Apple M1(16 GB)上
FP16
6 GB · 25 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 Apple M1(16 GB)上
#1 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 32 tok/s · Q8
#2 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 tok/s · Q8
#3 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 25 tok/s · FP16
#4 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0 50 tok/s · FP16
#5 OLMo 3 7B 7B 5 GB 8 192 Apache 2.0 12 tok/s · Q8
#6 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0 25 tok/s · FP16
#7 SmolLM3 3B 3B 2 GB 128 000 Apache 2.0 25 tok/s · FP16
Mac 套件

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地编程副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选:1-9B参数模型,其中Q4_K_M版本占用小于9 GB。额外支持3-7B(峰值M1)及强推荐≤3B(M1不配备Neural Engine M3/M4)。

考虑的标准:

  • Q4_K_M ≤ 9 GB
  • 68 GB/s 的带宽不会造成性能损耗
  • 每秒 token 数 ≥ 12
  • 支持Metal 3

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

2026年的MacBook Air M1是否仍适用于大语言模型?

是,但有限制。Mistral 7B Q4运行速度约为14个token/秒,Llama 3.2 3B Q4约为25个token/秒。对于流畅聊天可以接受,但对高强度编程任务需预留时间。详见 MacBook Air M1使用指南.

Air M1 8 GB:真的可以运行吗?

使用 Phi-4 Mini 3.8B Q4 或 Gemma 4 4B Q4(约 2.5 GB)也只能勉强运行。macOS 占用 4 GB,您给模型和短上下文留出 2 GB。建议选择 16 GB 内存。

M1 上该选哪种量化?

Q4_K_M 仍是最佳选择。Q5_K_M 质量更优,但会额外增加 25% 的显存带宽消耗,导致 tokens/sec 约降低 1.3 倍。在 M1 上表现尤为敏感。避免使用 Q3(质量明显下降)

运行 Mistral 7B 时,M1 与 M2 相比如何?

M1 ≈ 每秒 14 个 token,M2 ≈ 每秒 22 个 token。差异主要来自带宽(68 GB/s 对 100 GB/s)。如果 M1 16 GB 已经满足需求,则无需升级。

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €