进阶 12 分钟MacBook Pro

在MacBook Pro M3 Pro / Max(18–128 GB)上适合哪些LLM? ?

在 2026 年,MacBook Pro M3 Pro / Max(2023 年末款)是本地运行 LLM 的笔记本电脑中的理想选择。16 核 M3 Max 提供 400 GB/s 的带宽和最高 128 GB 的统一内存——足以以全精度运行 2026 年的全部开放权重模型:采用 Q8 的 Qwen 3.6 35B-A3B、采用稠密架构的 Qwen 3.8 27B,或同时加载多个模型,使用 128k 及以上的上下文。注意:M3 Pro 的内存带宽有所降低(150 GB/s,而 M2 Pro 为 200 GB/s)。本指南将厘清各个版本实际能做到什么。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 macOS 14+ 上测试
推荐硬件

本指南的备选购买方案: MacBook Pro M5 Pro — 24 GB / 1 TB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#2026 年的 MBP M3 Pro / Max

发布日期
2023 年 10 月至 11 月。仍受 macOS Sequoia 及后续版本支持。
M3 Pro
11 或 12 个 CPU 核心 + 14 或 18 个 GPU 核心,带宽为 150 GB/s(比 M2 Pro 更低),RAM 为 18 或 36 GB。
M3 Max 14核
14个CPU核心 + 30个GPU核心,300 GB/s,内存36GB或96GB。
M3 Max 16核
16个CPU核心 + 40个GPU核心,400 GB/s,内存48、64或128 GB。
!
M3 Pro的陷阱
Apple 降低了 M3 Pro 的内存带宽(从 M2 Pro 的 200 GB/s 降至 150 GB/s)。结果:M3 Pro 在大语言模型任务中的表现慢于 M2 Pro。如果您需要 M3 系列,建议直接选择 M3 Max —— 或者保留一台二手 M2 Pro。

#1. M3 Pro 与 M3 Max(注意陷阱)

M3 Pro 150 GB/s
运行 9B–12B 模型表现尚可(约 30 token/秒),但运行 24B 及以上的稠密模型就显得吃力(约 12 token/秒)。如果您打算运行 24B 及以上的稠密模型,请避免选择它。
M3 Max 14核 300 GB/s
不错的折中选择:Qwen 3.6 35B-A3B(MoE)为每秒 35–38 个 token,Qwen 3.8 27B 稠密模型为每秒 15–17 个 token。RAM 最大容量为 96 GB。
M3 Max 16核 400 GB/s
高端版本。运行大模型时速度提升 30%,可配备 128 GB 内存,用于全精度 Q8 和同时运行多个模型。

#2. 18 到 128 GB:哪些 LLM

各 MBP M3 配置兼容的模型
模型QuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Qwen 3.5 9BQ5_K_M✓ 30✓ 32✓ 46✓ 48✓ 50
Gemma 4 12BQ5_K_M✓ 14✓ 16✓ 26✓ 28✓ 30
Mistral Small 24BQ5_K_M—✓ 10✓ 17✓ 19✓ 20
Qwen 3.8 27BQ5_K_M——✓ 15✓ 16✓ 17
Qwen 3.6 35B-A3BQ5_K_M——✓ 38✓ 40✓ 42
Qwen 3.6 35B-A3BQ8_0——✓ 32✓ 34✓ 36
Qwen3-Coder 30B-A3BQ8_0——✓ 33✓ 35✓ 37
GLM 4.7 FlashQ4_K_M——✓ 44✓ 46✓ 48

#3. tokens/sec 基准测试

大致数值 — MBP M3 Max,16 核 GPU,128 GB,Ollama,接通电源
模型Q4_K_MQ5_K_MFlash Attn 8k
Qwen 3.5 9B54 t/s50 t/s48 t/s
Gemma 4 12B34 t/s30 t/s29 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 3.8 27B19 t/s17 t/s16 t/s
Qwen 3.6 35B-A3B46 t/s42 t/s40 t/s

#4. 安装与配置

MBP M3 Max 128 GB 完整设置
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull qwen3.6:35b

#5. 配合 Flash Attention 使用全精度大模型

Flash Attention 长期仅适用于 CUDA,但自 2024 年底起,通过 llama.cpp 和 Ollama 也可在 Metal 上使用。它能显著提升长上下文下的性能,是将 Qwen 3.6 35B-A3B 的上下文长度扩展到 128k 所不可或缺的。

Mac 套装

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
本地编译的 llama.cpp — Qwen 3.6 35B 上下文 16k
./build/bin/llama-cli \
  -m ./models/qwen3.6-35b-a3b-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
→
在 M3 Max 上使用 Flash Attention 测量到的性能提升
上下文 4k:+8%。上下文 8k:+15%。上下文 16k:+25%。上下文越长,收益越显著。建议在 M3 Max 上始终启用。

#6. M3 Max 128 GB:迈入工作站级别

Qwen 3.6 35B-A3B Q8
全精度,最高质量。约 36 tok/s(MoE,30 亿活跃参数)。128 GB 内存可支持 Q8,无需牺牲上下文长度。
Qwen 3.8 27B Q8
最大的全精度稠密通用模型(约 29 GB)。约 15 token/秒。2026 年“接近 Copilot”的选择,包含视觉能力。
2个30B模型并行
同时加载一个 Qwen 3.6 35B-A3B 和一个 Qwen3-Coder 30B-A3B。总计约 42 GB。适用于包含多个专门角色的智能体。
上下文 128k+,35B 模型
使用 Q8 KV 缓存,Qwen 3.6 35B-A3B + 128k 上下文约需 50 GB 内存。适用于长文档的深度分析。

#M3 Max vs M4 Max

带宽
M3 Max 16核 = 400 GB/s。M4 Max 16核 = 546 GB/s(+36%)
Qwen 3.6 35B-A3B 的运行速度
M3 Max ~40 个 token/秒,M4 Max ~54 个 token/秒。实际使用中提升 +35%。
最大RAM容量
相同:两款的最高配置均为 128 GB 内存。
结论
如果购买新机,选 M4 Max。价格低 25% 的二手 M3 Max 也很划算。

#常见问题

运行 LLM 时,M3 Pro 真的比 M2 Pro 更慢吗?+
是的,对于 24B 以上的密集模型,由于带宽限制(150 GB/s 对比 200 GB/s),性能会受到影响。在 Qwen 3.5 9B 上,差距较小(约 5%)。在 Mistral 小型 24B 模型上,M2 Pro 比较快 10-15%。建议:如果以二手设备购买并计划运行 24B 以上的密集模型,优先选择 M2 Pro,或直接升级到 M3 Max。
2026 年要运行大型模型,应选择哪款 M3 MBP?+
配备 64 GB 内存的 14 核 M3 Max 适合运行 Q8 量化的 Qwen 3.6 35B-A3B(约 35 token/s,MoE);配备 96–128 GB 内存的 16 核 M3 Max 适合加载多个模型,或将上下文长度扩展至 128k。配备 36 GB 内存的 M3 Pro 最多只能运行 24B 的稠密模型。
M3 Max 14核与16核在实际使用中的差异?+
带宽增加 30%(300 对比 400 GB/s),GPU 核心数增加 33%,可选配 128 GB RAM。运行大型 MoE 35B 模型时,速度提升 40%;运行 9B 模型时,仅提升 8%。如果您打算使用大型模型,16 核版本值得投资。
2026年,128GB RAM真的有用吗?+
有用,如果您想以 Q8 运行 Qwen 3.6 35B-A3B(全精度,质量优于 Q4),或同时运行两个 30B 模型,或使用 128k 上下文。对于常规用途,64 GB 内存已经绰绰有余。
Flash Attention在M3 Max上真的有影响吗?+
是的,在 8k–16k 上下文下,速度可提升 15% 至 25%,且无质量损失。应通过设置 OLLAMA_FLASH_ATTENTION=1 默认启用此功能。
在大型模型上进行一次对话,电池续航能力如何?+
在16英寸M3 Max上连续聊天,续航约为1小时40分钟(功耗约50 W),足以舒适地完成一次外出使用。用大型模型进行批量处理时,续航最多为1小时——建议接入市电。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。