在 MacBook Pro M4 Pro / Max(24–128 GB)上推荐的 LLM ?
MacBook Pro M4 Pro 或 Max 可以轻松运行 14B 到 32B 的模型,配备 64 或 128 GB 内存的 M4 Max 甚至可以运行 Q4 格式的 70B 模型(约 40 GB)。带宽(根据芯片不同为 273、410 或 546 GB/s)将 70B 模型的速度限制在约每秒 13 到 14 个 token;内存(24 到 128 GB)则决定了模型的大小。
MacBook Pro M4是最适合运行大型本地模型的笔记本电脑,前提是选好芯片和内存。本页说明不同配置分别适合多大规模的模型,计算理论最高速度,并将这台机器与NVIDIA GPU、Mac Studio或Air进行比较。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: MacBook Pro M5 Pro — 24 GB / 1 TB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#MacBook Pro M4 Pro 和 M4 Max:配置与带宽有哪些选择
在 MacBook Pro M4 上,芯片决定了两项参数:带宽决定生成速度的上限,最大内存容量决定可运行模型的大小。根据 Apple 的技术规格,M4 Pro 的带宽为 273 GB/s,配备 14 个 CPU 核心和 32 个 GPU 核心的 M4 Max 为 410 GB/s,配备 16 个 CPU 核心和 40 个 GPU 核心的 M4 Max 为 546 GB/s。内存容量随芯片而异,从 24 GB 到 128 GB 不等。这些选项不能随意互换:每种芯片都有其能运行的模型档次。
| 芯片 | 带宽 | 可选内存配置 | 实际可运行的模型级别(Q4) |
|---|---|---|---|
| M4 Pro | 273 GB/s | 24或48 GB | 可轻松运行最高 14B 的模型,配备 48 GB 内存时可运行 24–27B 模型 |
| M4 Max 处理器 14 核,GPU 32 核 | 410 GB/s | 36 GB | 24–27B 可流畅运行,32B 需使用较短的上下文 |
| M4 Max 16核CPU,40核GPU | 546 GB/s | 48、64 或 128 GB | 轻松运行 32B 模型;内存达到 64 GB 即可运行 70B 模型;128 GB 内存可运行超过 100B 的 MoE 模型 |
Apple 指出,M4 Max 支持最高 128 GB 统一内存,这使开发者能够与接近 2000 亿参数的语言模型进行交互。Apple 并未说明这一数字对应的量化方式或上下文:请不要将其理解为对 Q4 稠密模型的承诺,因为按本站的参考数据,一个 70B 稠密模型就已经约占 40 GB。
本介绍涵盖 14 英寸 MacBook Pro;16 英寸型号采用相同的芯片。M4 芯片之后已推出 M5 一代:这里介绍的这一代产品,如今不一定还能买到全新机,其价格由二手市场决定。本页面不列出任何价格;/materiel-ia/macbook-pro-m4-max 页面提供最新的价格参考。
#Pro、Max 14核或Max 16核:如何选择
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
- 01首先确定目标模型的大小80 亿至 140 亿参数的模型可在配备 24 GB 内存的 M4 Pro 上运行。240 亿至 320 亿参数的模型需要 36 至 48 GB 内存。700 亿参数的模型在使用短上下文时至少需要 64 GB 内存。
- 02计入上下文所需的内存,并预留 25% 至 30% 的余量KV 缓存会随上下文长度增加而增大,macOS 也会保留一部分内存供自身使用。要进行保守估算,请将模型大小乘以约 1.3。
- 03检查带宽是否满足所需速度将带宽除以模型所占的存储大小,即可得到理论最高速度。如果这一速度不足以满足您的使用需求,应选择更高档的芯片,而不是增加内存。
- 04在 14 核和 16 核 Max 芯片之间作出选择16核版本的带宽为546 GB/s,而另一版本为410 GB/s,更重要的是可选48 GB、64 GB和128 GB内存:内存容量与速度同样是这一差异的理由。
此流程解释了为什么 48 GB 的 M4 Pro 和 14 核 36 GB 的 M4 Max 不可直接比较:前者提供更多内存,后者提供更多带宽。对于模型较小且需要快速响应的使用场景,14 核 Max 胜出。对于加载更大模型,48 GB Pro 更占优势,尽管生成速度较慢。
#带宽所能支持的性能:理论上限
每生成一个 token,都需要重新读取参与计算的权重。因此,理论最大速度等于带宽除以权重大小(以 GB 为单位)。本站给出的 Q4 大小参考值为:14B 约 9 GB,32B 约 19–20 GB,70B 约 40 GB。表格将这个公式应用于三款芯片。这些都是计算得出的上限,绝不是实测结果:实际速度取决于运行引擎、上下文和热负载。
| 稠密模型 | 模型大小 | M4 Pro (273 GB/s) | M4 Max 14 核(410 GB/s) | M4 Max 16核(546 GB/s) |
|---|---|---|---|---|
| 14B | ≈ 9 GB | ≈ 30 tok/s | ≈ 45 tok/s | ≈ 60 tok/s |
| 32B | ≈ 19 到 20 GB | ≈ 14 tok/s | ≈ 21 tok/s | ≈ 28 tok/s |
| 70B | ≈ 40 GB | 无法运行(内存不足) | 无法运行(内存不足) | 约 13 到 14 个 token/秒 |
专家模型(MoE)不在此表中:一个30B模型其中3B是激活的,内存占用约为19 GB,但每个token仅重新加载数吉字节的权重,因此其吞吐量远超权重大小相同的32B密集模型。这是48 GB及以上MacBook Pro的最佳选择。实际吞吐量请参考/benchmarks或第三方发布的基准测试,需核对芯片、量化方式和推理引擎。
#MLX,Ollama,LM Studio:这台机器上使用哪个引擎?
Ollama 覆盖了核心功能:一键安装、本地API、自动检测GPU。MLX,作为Apple的框架,利用Mac的共享内存,避免了CPU与GPU之间的数据拷贝;其mlx-lm包支持在Apple硅基芯片上生成文本和微调模型,兼容量化模型。LM Studio 提供了图形界面和MLX模型。MLX与llama.cpp的对比指南在性能方面有明确结论;此处无需重复其结论。
- 01安装 Ollama请从 ollama.com 或通过 Homebrew 下载。macOS 安装指南中介绍了自动启动设置。
- 02启动所选模型ollama run t下载并运行模型。随后使用ollama ps检查GPU状态。
- 03设置 KV 缓存和 Flash 注意力Ollama 在硬件支持时会自动启用 Flash Attention;变量 OLLAMA_KV_CACHE_TYPE 用于量化 KV 缓存,默认值为 f16。该设置可减少长上下文占用的内存。
- 04必要时提高GPU内存上限mlx-lm 仓库指出,对于能装入 RAM 的模型,提高系统的锁定内存(wired memory)上限往往可以加快运行速度。这是一项需要管理员权限的系统设置:请按照 macOS 优化指南中的步骤操作,不要照搬其他地方找到的数值。
#长上下文:Pro 的内存最能发挥价值的使用场景
长上下文是64 GB和128 GB配置的主要优势。Ollama默认在内存低于24 GiB时将上下文设为4 000个token,在24至48 GiB之间设为32 000个token,从48 GiB起则设为256 000个token;其文档建议,网页搜索、智能体和代码工具至少使用64 000个token的上下文。在32B模型上使用64 000个token的上下文,除了19至20 GB的模型权重外,还需要以GB计的KV缓存:在48 GB内存的配置上,剩余空间很快就会用尽。64 GB或128 GB内存的机器能为这样的上下文留出空间,无需量化缓存。
#MacBook Pro M4 与 NVIDIA GPU、Mac Studio 或 MacBook Air 的对比
有意义的比较应先看内存,再看速度。根据 NVIDIA 的资料,RTX 4090 配备 24 GB GDDR6X 显存:当模型规模超过 240 亿至 300 亿参数这一范围时,它就必须将部分模型卸载到系统内存中,速度随之下降。配备 64 GB 或 128 GB 内存的 MacBook Pro M4 Max 可以完整加载一个 70B 模型。当模型能完全装入显存,且速度是首要考虑因素时,显卡仍然更有优势。
| 情况 | 最佳选项 | 原因 |
|---|---|---|
| 80 亿至 140 亿参数模型、便携性、静音 | MacBook Air M4 16 或 24 GB | 足够,更轻量 |
| 24–32B 的模型,同时打开多个模型 | MacBook Pro M4 Pro 48 GB或Max版本 | 内存与主动散热 |
| 外出时使用 70B 模型或超长上下文 | MacBook Pro M4 Max 64或128 GB | 唯一支持完整加载70B模型的笔记本电脑 |
| 同样的负载,但在办公室运行 | Mac Studio 或 Mac mini | 同款芯片,更大的散热系统,无电池 |
| 模型能装入 24 GB 内存,追求最高速度 | 配备 24 GB 或更大显存的 NVIDIA GPU | 模型能装入内存时,带宽更高 |
#M4 还是 M5:下一代带来哪些变化
此后,Apple 已推出搭载 M5 Pro 和 M5 Max 的 MacBook Pro。规格表标明,M5 Pro 的带宽为 307 GB/s,配备 32 个 GPU 核心的 M5 Max 为 460 GB/s,配备 40 个 GPU 核心的 M5 Max 为 614 GB/s,而 M4 一代对应的数值分别为 273、410 和 546 GB/s。带宽提高了约 12% 至 13%,因此理论速度上限也相应提高。购买时,尤其应在内存容量相同的情况下进行比较:一台配备 128 GB 内存的二手 M4 Max 能运行的模型,比一台配备 48 GB 内存的全新 M5 Pro 更多。
| 芯片 | M4 | M5 |
|---|---|---|
| Pro | 273 GB/s | 307 GB/s |
| Max,32 个 GPU 核心 | 410 GB/s | 460 GB/s |
| Max,40个GPU核心 | 546 GB/s | 614 GB/s |
#需了解的局限性
- 内存上限
- 最多支持128 GB。超过此容量则需使用Mac Studio或其他平台。
- 不支持CUDA
- 需要 CUDA 的库无法运行。MLX 和 llama.cpp 能满足推理需求,但无法覆盖整个训练生态。
- Fine-tuning
- MLX 支持对量化模型进行低秩微调和全量微调。对于参数量超过几十亿的模型,这类操作仍然速度较慢,并会导致设备发热:大型任务应交给云服务处理。
- 电池
- 连续推理会迅速耗尽电池电量:长时间使用时请确保已连接电源。
- MacBook Air M4:32 GB 内存,120 GB/s 带宽
- Mac Studio:桌面电脑上的同款芯片
- Mac mini M4 和 M4 Pro
- 优化搭载 Apple 芯片的 Mac
- 硬件规格:MacBook Pro M4 Max
- 来源:Apple 的 MacBook Pro M4 Pro 和 M4 Max 技术规格表
- 来源:Apple 的 MacBook Pro M5 Pro 和 M5 Max 技术规格
- 来源:Apple,M4 Pro 和 M4 Max 芯片发布公告
- 来源:Ollama 文档,上下文
- 来源:mlx-lm 仓库
#常见问题
MacBook Pro M4 Max在LLM任务上是否优于RTX 4090?+
M4 Pro 48 GB 或 M4 Max 36 GB:选择哪一个?+
在 M4 Max 上需要 64 GB 还是 128 GB 内存?+
在 MacBook Pro M4 Max 上运行 70B 模型能预期达到多少吞吐量?+
能否在MacBook Pro M4上对模型进行微调?+
在 MacBook Pro M4 上使用 Ollama、LM Studio 还是 MLX?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。