进阶 12 分钟MacBook Pro
在MacBook Pro M3 Pro / Max(18–128 GB)上适合哪些LLM? ?
在 2026 年,MacBook Pro M3 Pro / Max(2023 年末款)是本地运行 LLM 的笔记本电脑中的理想选择。16 核 M3 Max 提供 400 GB/s 的带宽和最高 128 GB 的统一内存——足以以全精度运行 2026 年的全部开放权重模型:采用 Q8 的 Qwen 3.6 35B-A3B、采用稠密架构的 Qwen 3.8 27B,或同时加载多个模型,使用 128k 及以上的上下文。注意:M3 Pro 的内存带宽有所降低(150 GB/s,而 M2 Pro 为 200 GB/s)。本指南将厘清各个版本实际能做到什么。
您正在挑选电脑吗? 按预算推荐 →
推荐硬件
本指南的备选购买方案: MacBook Pro M5 Pro — 24 GB / 1 TB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#2026 年的 MBP M3 Pro / Max
- 发布日期
- 2023 年 10 月至 11 月。仍受 macOS Sequoia 及后续版本支持。
- M3 Pro
- 11 或 12 个 CPU 核心 + 14 或 18 个 GPU 核心,带宽为 150 GB/s(比 M2 Pro 更低),RAM 为 18 或 36 GB。
- M3 Max 14核
- 14个CPU核心 + 30个GPU核心,300 GB/s,内存36GB或96GB。
- M3 Max 16核
- 16个CPU核心 + 40个GPU核心,400 GB/s,内存48、64或128 GB。
!
M3 Pro的陷阱
Apple 降低了 M3 Pro 的内存带宽(从 M2 Pro 的 200 GB/s 降至 150 GB/s)。结果:M3 Pro 在大语言模型任务中的表现慢于 M2 Pro。如果您需要 M3 系列,建议直接选择 M3 Max —— 或者保留一台二手 M2 Pro。
#1. M3 Pro 与 M3 Max(注意陷阱)
- M3 Pro 150 GB/s
- 运行 9B–12B 模型表现尚可(约 30 token/秒),但运行 24B 及以上的稠密模型就显得吃力(约 12 token/秒)。如果您打算运行 24B 及以上的稠密模型,请避免选择它。
- M3 Max 14核 300 GB/s
- 不错的折中选择:Qwen 3.6 35B-A3B(MoE)为每秒 35–38 个 token,Qwen 3.8 27B 稠密模型为每秒 15–17 个 token。RAM 最大容量为 96 GB。
- M3 Max 16核 400 GB/s
- 高端版本。运行大模型时速度提升 30%,可配备 128 GB 内存,用于全精度 Q8 和同时运行多个模型。
#2. 18 到 128 GB:哪些 LLM
各 MBP M3 配置兼容的模型
| 模型 | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 30 | ✓ 32 | ✓ 46 | ✓ 48 | ✓ 50 |
| Gemma 4 12B | Q5_K_M | ✓ 14 | ✓ 16 | ✓ 26 | ✓ 28 | ✓ 30 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 3.8 27B | Q5_K_M | — | — | ✓ 15 | ✓ 16 | ✓ 17 |
| Qwen 3.6 35B-A3B | Q5_K_M | — | — | ✓ 38 | ✓ 40 | ✓ 42 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 32 | ✓ 34 | ✓ 36 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 33 | ✓ 35 | ✓ 37 |
| GLM 4.7 Flash | Q4_K_M | — | — | ✓ 44 | ✓ 46 | ✓ 48 |
#3. tokens/sec 基准测试
大致数值 — MBP M3 Max,16 核 GPU,128 GB,Ollama,接通电源
| 模型 | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Qwen 3.5 9B | 54 t/s | 50 t/s | 48 t/s |
| Gemma 4 12B | 34 t/s | 30 t/s | 29 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 3.8 27B | 19 t/s | 17 t/s | 16 t/s |
| Qwen 3.6 35B-A3B | 46 t/s | 42 t/s | 40 t/s |
#4. 安装与配置
#5. 配合 Flash Attention 使用全精度大模型
Flash Attention 长期仅适用于 CUDA,但自 2024 年底起,通过 llama.cpp 和 Ollama 也可在 Metal 上使用。它能显著提升长上下文下的性能,是将 Qwen 3.6 35B-A3B 的上下文长度扩展到 128k 所不可或缺的。
Mac 套装
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
→
在 M3 Max 上使用 Flash Attention 测量到的性能提升
上下文 4k:+8%。上下文 8k:+15%。上下文 16k:+25%。上下文越长,收益越显著。建议在 M3 Max 上始终启用。
#6. M3 Max 128 GB:迈入工作站级别
- Qwen 3.6 35B-A3B Q8
- 全精度,最高质量。约 36 tok/s(MoE,30 亿活跃参数)。128 GB 内存可支持 Q8,无需牺牲上下文长度。
- Qwen 3.8 27B Q8
- 最大的全精度稠密通用模型(约 29 GB)。约 15 token/秒。2026 年“接近 Copilot”的选择,包含视觉能力。
- 2个30B模型并行
- 同时加载一个 Qwen 3.6 35B-A3B 和一个 Qwen3-Coder 30B-A3B。总计约 42 GB。适用于包含多个专门角色的智能体。
- 上下文 128k+,35B 模型
- 使用 Q8 KV 缓存,Qwen 3.6 35B-A3B + 128k 上下文约需 50 GB 内存。适用于长文档的深度分析。
#M3 Max vs M4 Max
- 带宽
- M3 Max 16核 = 400 GB/s。M4 Max 16核 = 546 GB/s(+36%)
- Qwen 3.6 35B-A3B 的运行速度
- M3 Max ~40 个 token/秒,M4 Max ~54 个 token/秒。实际使用中提升 +35%。
- 最大RAM容量
- 相同:两款的最高配置均为 128 GB 内存。
- 结论
- 如果购买新机,选 M4 Max。价格低 25% 的二手 M3 Max 也很划算。
#常见问题
运行 LLM 时,M3 Pro 真的比 M2 Pro 更慢吗?+
是的,对于 24B 以上的密集模型,由于带宽限制(150 GB/s 对比 200 GB/s),性能会受到影响。在 Qwen 3.5 9B 上,差距较小(约 5%)。在 Mistral 小型 24B 模型上,M2 Pro 比较快 10-15%。建议:如果以二手设备购买并计划运行 24B 以上的密集模型,优先选择 M2 Pro,或直接升级到 M3 Max。
2026 年要运行大型模型,应选择哪款 M3 MBP?+
配备 64 GB 内存的 14 核 M3 Max 适合运行 Q8 量化的 Qwen 3.6 35B-A3B(约 35 token/s,MoE);配备 96–128 GB 内存的 16 核 M3 Max 适合加载多个模型,或将上下文长度扩展至 128k。配备 36 GB 内存的 M3 Pro 最多只能运行 24B 的稠密模型。
M3 Max 14核与16核在实际使用中的差异?+
带宽增加 30%(300 对比 400 GB/s),GPU 核心数增加 33%,可选配 128 GB RAM。运行大型 MoE 35B 模型时,速度提升 40%;运行 9B 模型时,仅提升 8%。如果您打算使用大型模型,16 核版本值得投资。
2026年,128GB RAM真的有用吗?+
有用,如果您想以 Q8 运行 Qwen 3.6 35B-A3B(全精度,质量优于 Q4),或同时运行两个 30B 模型,或使用 128k 上下文。对于常规用途,64 GB 内存已经绰绰有余。
Flash Attention在M3 Max上真的有影响吗?+
是的,在 8k–16k 上下文下,速度可提升 15% 至 25%,且无质量损失。应通过设置 OLLAMA_FLASH_ATTENTION=1 默认启用此功能。
在大型模型上进行一次对话,电池续航能力如何?+
在16英寸M3 Max上连续聊天,续航约为1小时40分钟(功耗约50 W),足以舒适地完成一次外出使用。用大型模型进行批量处理时,续航最多为1小时——建议接入市电。
这份指南对您有帮助吗?
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。
目录
分享