进阶 11 分钟MacBook Pro

在 MacBook Pro M4 Pro / Max(24–128 GB)上推荐的 LLM ?

直接回答

MacBook Pro M4 Pro 或 Max 可以轻松运行 14B 到 32B 的模型,配备 64 或 128 GB 内存的 M4 Max 甚至可以运行 Q4 格式的 70B 模型(约 40 GB)。带宽(根据芯片不同为 273、410 或 546 GB/s)将 70B 模型的速度限制在约每秒 13 到 14 个 token;内存(24 到 128 GB)则决定了模型的大小。

MacBook Pro M4是最适合运行大型本地模型的笔记本电脑,前提是选好芯片和内存。本页说明不同配置分别适合多大规模的模型,计算理论最高速度,并将这台机器与NVIDIA GPU、Mac Studio或Air进行比较。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 macOS 14+ 上测试
推荐硬件

本指南的备选购买方案: MacBook Pro M5 Pro — 24 GB / 1 TB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#MacBook Pro M4 Pro 和 M4 Max:配置与带宽有哪些选择

在 MacBook Pro M4 上,芯片决定了两项参数:带宽决定生成速度的上限,最大内存容量决定可运行模型的大小。根据 Apple 的技术规格,M4 Pro 的带宽为 273 GB/s,配备 14 个 CPU 核心和 32 个 GPU 核心的 M4 Max 为 410 GB/s,配备 16 个 CPU 核心和 40 个 GPU 核心的 M4 Max 为 546 GB/s。内存容量随芯片而异,从 24 GB 到 128 GB 不等。这些选项不能随意互换:每种芯片都有其能运行的模型档次。

MacBook Pro M4 Pro 和 M4 Max 的配置(据 Apple)
芯片带宽可选内存配置实际可运行的模型级别(Q4)
M4 Pro273 GB/s24或48 GB可轻松运行最高 14B 的模型,配备 48 GB 内存时可运行 24–27B 模型
M4 Max 处理器 14 核,GPU 32 核410 GB/s36 GB24–27B 可流畅运行,32B 需使用较短的上下文
M4 Max 16核CPU,40核GPU546 GB/s48、64 或 128 GB轻松运行 32B 模型;内存达到 64 GB 即可运行 70B 模型;128 GB 内存可运行超过 100B 的 MoE 模型

Apple 指出,M4 Max 支持最高 128 GB 统一内存,这使开发者能够与接近 2000 亿参数的语言模型进行交互。Apple 并未说明这一数字对应的量化方式或上下文:请不要将其理解为对 Q4 稠密模型的承诺,因为按本站的参考数据,一个 70B 稠密模型就已经约占 40 GB。

本介绍涵盖 14 英寸 MacBook Pro;16 英寸型号采用相同的芯片。M4 芯片之后已推出 M5 一代:这里介绍的这一代产品,如今不一定还能买到全新机,其价格由二手市场决定。本页面不列出任何价格;/materiel-ia/macbook-pro-m4-max 页面提供最新的价格参考。

#Pro、Max 14核或Max 16核:如何选择

Mac 套装

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
  1. 01
    首先确定目标模型的大小
    80 亿至 140 亿参数的模型可在配备 24 GB 内存的 M4 Pro 上运行。240 亿至 320 亿参数的模型需要 36 至 48 GB 内存。700 亿参数的模型在使用短上下文时至少需要 64 GB 内存。
  2. 02
    计入上下文所需的内存,并预留 25% 至 30% 的余量
    KV 缓存会随上下文长度增加而增大,macOS 也会保留一部分内存供自身使用。要进行保守估算,请将模型大小乘以约 1.3。
  3. 03
    检查带宽是否满足所需速度
    将带宽除以模型所占的存储大小,即可得到理论最高速度。如果这一速度不足以满足您的使用需求,应选择更高档的芯片,而不是增加内存。
  4. 04
    在 14 核和 16 核 Max 芯片之间作出选择
    16核版本的带宽为546 GB/s,而另一版本为410 GB/s,更重要的是可选48 GB、64 GB和128 GB内存:内存容量与速度同样是这一差异的理由。

此流程解释了为什么 48 GB 的 M4 Pro 和 14 核 36 GB 的 M4 Max 不可直接比较:前者提供更多内存,后者提供更多带宽。对于模型较小且需要快速响应的使用场景,14 核 Max 胜出。对于加载更大模型,48 GB Pro 更占优势,尽管生成速度较慢。

#带宽所能支持的性能:理论上限

每生成一个 token,都需要重新读取参与计算的权重。因此,理论最大速度等于带宽除以权重大小(以 GB 为单位)。本站给出的 Q4 大小参考值为:14B 约 9 GB,32B 约 19–20 GB,70B 约 40 GB。表格将这个公式应用于三款芯片。这些都是计算得出的上限,绝不是实测结果:实际速度取决于运行引擎、上下文和热负载。

生成的理论上限(Q4 量化权重):基于计算,非实测值
稠密模型模型大小M4 Pro (273 GB/s)M4 Max 14 核(410 GB/s)M4 Max 16核(546 GB/s)
14B≈ 9 GB≈ 30 tok/s≈ 45 tok/s≈ 60 tok/s
32B≈ 19 到 20 GB≈ 14 tok/s≈ 21 tok/s≈ 28 tok/s
70B≈ 40 GB无法运行(内存不足)无法运行(内存不足)约 13 到 14 个 token/秒

专家模型(MoE)不在此表中:一个30B模型其中3B是激活的,内存占用约为19 GB,但每个token仅重新加载数吉字节的权重,因此其吞吐量远超权重大小相同的32B密集模型。这是48 GB及以上MacBook Pro的最佳选择。实际吞吐量请参考/benchmarks或第三方发布的基准测试,需核对芯片、量化方式和推理引擎。

!
警惕缺乏背景说明的吞吐量数据
如果有人宣称,在内存带宽为 546 GB/s 的 M4 Max 上,一个采用 Q4 量化的 32B 稠密模型能达到超过每秒 30 个 token 的吞吐量,那么这个数值就超过了每秒 28 个 token 的理论上限:它并非来自常规生成。请始终核实当前运行的是哪个模型、采用哪种量化,以及是否有草稿模型在加速生成。

#MLX,Ollama,LM Studio:这台机器上使用哪个引擎?

Ollama 覆盖了核心功能:一键安装、本地API、自动检测GPU。MLX,作为Apple的框架,利用Mac的共享内存,避免了CPU与GPU之间的数据拷贝;其mlx-lm包支持在Apple硅基芯片上生成文本和微调模型,兼容量化模型。LM Studio 提供了图形界面和MLX模型。MLX与llama.cpp的对比指南在性能方面有明确结论;此处无需重复其结论。

  1. 01
    安装 Ollama
    请从 ollama.com 或通过 Homebrew 下载。macOS 安装指南中介绍了自动启动设置。
  2. 02
    启动所选模型
    ollama run t下载并运行模型。随后使用ollama ps检查GPU状态。
  3. 03
    设置 KV 缓存和 Flash 注意力
    Ollama 在硬件支持时会自动启用 Flash Attention;变量 OLLAMA_KV_CACHE_TYPE 用于量化 KV 缓存,默认值为 f16。该设置可减少长上下文占用的内存。
  4. 04
    必要时提高GPU内存上限
    mlx-lm 仓库指出,对于能装入 RAM 的模型,提高系统的锁定内存(wired memory)上限往往可以加快运行速度。这是一项需要管理员权限的系统设置:请按照 macOS 优化指南中的步骤操作,不要照搬其他地方找到的数值。
终端
brew install --cask ollama
ollama run qwen3:32b
ollama ps

# Long contexte : cache KV quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

#长上下文:Pro 的内存最能发挥价值的使用场景

长上下文是64 GB和128 GB配置的主要优势。Ollama默认在内存低于24 GiB时将上下文设为4 000个token,在24至48 GiB之间设为32 000个token,从48 GiB起则设为256 000个token;其文档建议,网页搜索、智能体和代码工具至少使用64 000个token的上下文。在32B模型上使用64 000个token的上下文,除了19至20 GB的模型权重外,还需要以GB计的KV缓存:在48 GB内存的配置上,剩余空间很快就会用尽。64 GB或128 GB内存的机器能为这样的上下文留出空间,无需量化缓存。

#MacBook Pro M4 与 NVIDIA GPU、Mac Studio 或 MacBook Air 的对比

有意义的比较应先看内存,再看速度。根据 NVIDIA 的资料,RTX 4090 配备 24 GB GDDR6X 显存:当模型规模超过 240 亿至 300 亿参数这一范围时,它就必须将部分模型卸载到系统内存中,速度随之下降。配备 64 GB 或 128 GB 内存的 MacBook Pro M4 Max 可以完整加载一个 70B 模型。当模型能完全装入显存,且速度是首要考虑因素时,显卡仍然更有优势。

MacBook Pro M4 与其他选项相比处于什么位置
情况最佳选项原因
80 亿至 140 亿参数模型、便携性、静音MacBook Air M4 16 或 24 GB足够,更轻量
24–32B 的模型,同时打开多个模型MacBook Pro M4 Pro 48 GB或Max版本内存与主动散热
外出时使用 70B 模型或超长上下文MacBook Pro M4 Max 64或128 GB唯一支持完整加载70B模型的笔记本电脑
同样的负载,但在办公室运行Mac Studio 或 Mac mini同款芯片,更大的散热系统,无电池
模型能装入 24 GB 内存,追求最高速度配备 24 GB 或更大显存的 NVIDIA GPU模型能装入内存时,带宽更高

#M4 还是 M5:下一代带来哪些变化

此后,Apple 已推出搭载 M5 Pro 和 M5 Max 的 MacBook Pro。规格表标明,M5 Pro 的带宽为 307 GB/s,配备 32 个 GPU 核心的 M5 Max 为 460 GB/s,配备 40 个 GPU 核心的 M5 Max 为 614 GB/s,而 M4 一代对应的数值分别为 273、410 和 546 GB/s。带宽提高了约 12% 至 13%,因此理论速度上限也相应提高。购买时,尤其应在内存容量相同的情况下进行比较:一台配备 128 GB 内存的二手 M4 Max 能运行的模型,比一台配备 48 GB 内存的全新 M5 Pro 更多。

据Apple公布的数据,M4和M5的Pro及Max芯片的带宽
芯片M4M5
Pro273 GB/s307 GB/s
Max,32 个 GPU 核心410 GB/s460 GB/s
Max,40个GPU核心546 GB/s614 GB/s

#需了解的局限性

内存上限
最多支持128 GB。超过此容量则需使用Mac Studio或其他平台。
不支持CUDA
需要 CUDA 的库无法运行。MLX 和 llama.cpp 能满足推理需求,但无法覆盖整个训练生态。
Fine-tuning
MLX 支持对量化模型进行低秩微调和全量微调。对于参数量超过几十亿的模型,这类操作仍然速度较慢,并会导致设备发热:大型任务应交给云服务处理。
电池
连续推理会迅速耗尽电池电量:长时间使用时请确保已连接电源。

#常见问题

FAQ
MacBook Pro M4 Max在LLM任务上是否优于RTX 4090?+
这取决于模型大小。RTX 4090拥有24GB显存:超过该容量后,模型将转存至内存并导致性能下降。M4 Max 64GB或128GB的设备可完整加载70B模型,但当模型大小在24GB以内时,其推理速度仍慢于专用显卡。请根据目标模型的大小选择合适的配置。
M4 Pro 48 GB 或 M4 Max 36 GB:选择哪一个?+
M4 Pro 48GB 可加载更大模型,最高支持 32B 模型(Q4 量化,中等上下文)。M4 Max 14 核心的带宽为 410 GB/s,相比 273 GB/s 提升约 50%,但其仅 36GB 显存限制了模型规模。对于 24B 至 32B 模型,显存是关键:建议选择 48GB 显存版本。
在 M4 Max 上需要 64 GB 还是 128 GB 内存?+
对于Q4量化的70B模型(约40 GB),搭配适中的上下文长度,64 GB内存就足够。超长上下文、超过1000亿参数的专家模型,或同时加载多个模型,才有理由选择128 GB内存。如果您的使用需求在64 GB内就能满足,增加内存不会带来速度提升。
在 MacBook Pro M4 Max 上运行 70B 模型能预期达到多少吞吐量?+
理论上限为 546 GB/s 除以约 40 GB,即每秒 13 至 14 个 token。实际速度更低,取决于引擎和上下文。带宽为 410 GB/s、内存为 36 GB 的 M4 Max 无法加载 70B 模型;只有带宽为 546 GB/s、配备 64 GB 或 128 GB 内存的版本可以。
能否在MacBook Pro M4上对模型进行微调?+
可以,使用 MLX:mlx-lm 包支持对量化模型进行低秩微调和全量微调。实际使用中,这适合小模型和试验。对于拥有数百亿参数的模型,云服务仍然更快。
在 MacBook Pro M4 上使用 Ollama、LM Studio 还是 MLX?+
追求简单易用和本地 API,可选择 Ollama;需要图形界面,可选择 LM Studio;需要 Apple 格式和微调,可选择 MLX。三者可以共存,但不要同时加载两个大模型:内存是首要限制因素。《MLX 与 llama.cpp 对比》指南比较了两者的速度。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。