进阶 15 分钟Mac

Mac M4 Max 与本地 LLM:MLX,性能, 模型

MacBook Pro M4 Max(64 或 128 GB 统一内存)已成为运行本地 LLM 最强大的便携式电脑。统一内存与 Apple 的 MLX 框架相结合,让笔记本电脑能够加载当前规模最大的开放权重模型——以全精度运行的 300 亿至 350 亿参数 MoE 模型,以及 270 亿参数的多模态稠密模型——并以令人惊讶的速度运行。本指南通过测量检验哪些方案真正可行:MLX 与 Ollama 的对比、实际可运行的模型、实测的每秒 token 数,以及电池供电时的发热表现。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: Mac Studio M5 Max(36 GB / 512 GB).

为什么选择它?我们的完整资料: Mac Studio M5 Max(36 GB / 512 GB) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#为什么 M4 Max 会改变本地大语言模型的格局

在 Windows 或 Linux 电脑上,GPU 显存是主要限制。RTX 4090 的显存上限为 24 GB:在本地以 FP16 运行 30–35B 模型,必须将部分模型卸载到 CPU 端运行,这会使吞吐量降至原来的五分之一或十分之一。M4 Max 则换了一个思路。GPU 与 CPU 共享同一内存:RAM 中的所有数据都可由 GPU 直接访问,无需复制。

具体来说,一台配备 128 GB 内存的 MacBook Pro M4 Max 可以轻松以全精度 FP16 加载 2026 年最好的 MoE 模型——Qwen 3.6 35B-A3B 或 Qwen 3.8 27B——或者同时加载多个模型,并继续在电池供电下运行它们。目前没有任何 x86 便携式电脑能做到这一点——要接近同样的效果,需要配备一块 RTX 5090 或两块 RTX 3090 的台式机,而且即便如此,也无法在移动中使用。

i
‘M4 Max’是什么意思
M4 Max 是 2024 年末发布的 14 英寸和 16 英寸 MacBook Pro 的高端芯片。该芯片提供两种 GPU 配置(32 或 40 个核心)和三种 RAM 规格:36、48、64 或 128 GB。对于 LLM 推理,仅 64 GB 和 128 GB 版本具有实际意义。其宣称的内存带宽为 546 GB/s

#统一内存:为何128 GB ≠ 128 GB显存

Mac 套装

你已经看到了 M4 Max 搭配 MLX 的表现。Mac 套件详细说明了 MLX 在什么情况下真正优于 GGUF(第 3 章)、如何计算长上下文下的内存预算(第 5 章),以及可以预期怎样的性能表现,包括发热和电池消耗(第 6 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

macOS不会允许单个进程占用全部内存。默认情况下,GPU可使用约75%的总RAM。在128GB机器上,可为模型提供约96GB内存;在64GB机器上,可提供约48GB内存。这足以满足目标模型的需求,但在计算前需明确这一点。

Mac M4 Max 64 GB
约有 48 GB 内存可用于 LLM。2026 年最好的 MoE 模型采用 Q8 量化时,内存空间较为充裕——Qwen3-Coder 30B-A3B(约 32 GB)、Qwen 3.8 27B(约 30 GB),以及刚好能装下的 Qwen 3.6 35B-A3B(约 40 GB)——而 Mistral Small 24B 即使采用 FP16,也能装入内存(约 48 GB)。
Mac M4 Max 128 GB
约有 96 GB 内存可用于 LLM。有足够余量以完整 FP16 精度运行大型 MoE 模型(Qwen 3.6 35B-A3B、Qwen 3.8 27B、Granite 4.2 30B),同时保持多个模型处于已加载状态,或将上下文扩展至 256k tokens。
推荐量化方式
Q4_K_M 仍是合适的默认选择。配备 128 GB 内存时,可以轻松提高到 Q5_K_M 或 Q6,以提升质量。
增加分配给GPU的内存(可选)
# Par défaut macOS laisse ~75% de la RAM au GPU.
# Pour pousser à ~85% (à vos risques, peut faire swapper le système) :
sudo sysctl iogpu.wired_limit_mb=110000

# Pour revenir à la valeur par défaut :
sudo sysctl iogpu.wired_limit_mb=0
!
不要超过 90 %
把限额调得过高,会让 macOS 本身缺乏可用资源。从 90% 起,就有系统卡死和持续进行内存交换的风险。默认值适用于 95% 的使用场景。

#MLX vs Ollama:Mac M4 Max上哪个更适合?

Apple 于 2023 年 12 月发布了 MLX:这是一个面向 Apple Silicon 的数组计算框架,功能上相当于 PyTorch,但围绕统一内存设计。mlx-lm 模块提供命令行界面和 Python API,用于运行 MLX 格式的量化模型(该格式与 GGUF 相近,但并不相同)。

Ollama (Metal)
安装更简便,生态系统庞大,采用通用的 GGUF 格式,并在 :11434 端口提供兼容 OpenAI 的 API。存在少量额外开销,CPU↔GPU 之间的内存转换效率并非最优。
MLX (mlx-lm)
在 Apple Silicon 上实际运行更快:在 30B 及以上模型上,每秒生成的 token 数提升 20% 至 40%,具备原生内存管理和内置提示缓存。生态系统较小,默认不提供标准化的 REST API。
结论
想探索并试用 10 个模型:选 Ollama。想充分发挥 M4 Max 的性能,并在本地生产环境中以全精度运行大型 30–35B MoE 模型:选 MLX。
→
两者可以很好地共存
许多M4 Max用户会将Ollama作为第三方应用的永久服务器(Open WebUI、n8n、Continue.dev),并在需要最高tokens/秒的会话中临时启动MLX。

#安装MLX并运行第一个模型

  1. 01
    准备Python环境
    请使用 Python 3.10 或更高版本(推荐 3.12)。在 Mac 上,使用 uv 或 pyenv 是最简洁规范的做法。除 Apple Silicon 外,mlx-lm 没有其他原生环境要求。
  2. 02
    安装mlx-lm
    只需一条 pip 命令即可。所有组件都已针对 arm64 架构和 Metal 编译好。
  3. 03
    启动 MLX 模型
    命令行工具 mlx_lm.generate 从 Hugging Face 的 mlx-community 组织下载模型并运行。
  4. 04
    暴露HTTP API(可选)
    mlx-lm 从 0.18 版本开始集成 mlx_lm.server 命令,可在 8080 端口提供兼容 OpenAI 的 API。
终端 —— 安装与首次测试
# 1. Environnement
python3 -m venv ~/mlx-env
source ~/mlx-env/bin/activate

# 2. Installation
pip install --upgrade mlx-lm

# 3. Téléchargement + génération en une commande
mlx_lm.generate \
  --model mlx-community/Qwen3.6-35B-A3B-Instruct-4bit \
  --prompt "Explique en français le principe de la mémoire unifiée Apple Silicon." \
  --max-tokens 512
兼容 OpenAI API 的 MLX 服务器
# Démarre une API sur http://localhost:8080/v1
mlx_lm.server \
  --model mlx-community/Qwen3.8-27B-Instruct-4bit \
  --port 8080

#已在MacBook Pro M4 Max 128 GB上测试的模型

以下所有数值均在一台配备M4 Max芯片(40个GPU核心,128 GB)的16英寸MacBook Pro上测得,设备连接电源,初始为冷启动,之后经过5分钟预热。提示词较短(50个token),生成500个token,批处理大小为1。

Qwen 3.6 35B-A3B Q8 (MLX)
约占用 40 GB 内存。生成速度为 42–50 token/秒:混合专家(MoE)模型仅激活 30 亿个参数,因此虽然模型规模较大,吞吐量仍然很高。它是在这台 Mac 上兼顾多种用途的可靠之选。
Qwen 3.8 27B Q8(MLX)
约占用30 GB内存。速度为18–22 tokens/s(稠密模型)。支持262k上下文和视觉,是最接近本地Copilot的选择。记得将其推理设置调为low,否则它会过度思考。
Qwen3-Coder 30B-A3B Q8 (MLX)
约占用 32 GB 内存。速度为 44–52 tokens/s。专注于代码的 MoE 模型,上下文长度为 256k:非常适合作为本地开发助手。
GLM 4.7 Flash Q8 (MLX)
约32 GB RAM(MoE 30B-A3B,MIT许可证)。40–48 token/秒。擅长智能体任务和工具调用,响应非常迅速。
Granite 4.2 30B Q8 (MLX)
约33GB内存,30-38个token/秒,适用于专业/企业级使用,token消耗较少且长时间会话稳定。
Mistral Small 24B FP16 (MLX)
≈48 GB。18–22 tokens/s。稠密模型,法语表现优秀,尤其擅长文档总结。

#详细基准测试:MLX 对比 Ollama 对比 llama.cpp

使用同一个 Q8 量化的 Qwen 3.8 27B 模型,在同一台配备 128 GB 内存的 M4 Max 机器上,三个运行时的实测表现差异如下:

MLX 8位 (mlx-community)
平均速度为20.5 tokens/s,提示处理速度约为410 tokens/s
Ollama Q8_0 (Metal)
平均15.2个token/秒,提示词评估约300个token/秒
直接使用 llama.cpp,Q8_0
平均15.6 tokens/s。Ollama 相比 llama.cpp 增加的开销很小。
i
为什么 MLX 更胜一筹
MLX 避免了 CPU 与 GPU 表示格式之间的转换,能更高效地利用 Metal Performance Shaders 指令处理量化矩阵乘法。随着模型规模增大,差距也会扩大:在 7B 模型上差距很小,而在 30B 及以上的大型模型上则变得明显。

#M4 Max 与 RTX 4090:各自在哪些方面占优

直接对比:一台配备 128 GB 内存的 MacBook Pro M4 Max(Apple 已用 M5 Max 替代该型号——需要在二手市场寻找,价格不定),与一台配备二手 RTX 4090 24 GB 的台式机(价格不定,仅指显卡价格,不含主机其余部件)。

小模型 ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
RTX 4090 明显胜出(80–120 token/秒,而 M4 Max 为 35–60 token/秒)。对于这些规模的模型,如果有选择,就选 RTX 4090。
24–30B Q4 稠密模型(Mistral Small、Qwen 3.8 27B)
RTX 4090目前仍领先(30-40 tok/s 对比 M4 Max的18-22 tok/s),但差距正在缩小。
全精度Q8/FP16
M4 Max 在实际使用中更胜一筹:它能在 RAM 中以 Q8 或 FP16 运行 2026 年最出色的 MoE 模型(35B-A3B、27B),而 RTX 4090 则必须退回 Q4,或将部分计算卸载到 CPU(生成吞吐量降至五分之一)。
大规模混合专家模型 (Qwen 3.6 35B-A3B)
M4 Max 凭借大容量内存表现出色:所有内容都能装入内存,即使采用 FP16 也一样。RTX 4090 一旦使用高于 Q4 的精度,就必须将部分模型卸载到系统内存。
便携性
完全没法比:M4 Max 在电池供电下可持续推理约 3 小时,RTX 4090 则只能走 0 公里。
→
决策阈值
您想以全精度(Q8/FP16)运行 2026 年最优秀的 MoE 模型,并同时保持多个模型处于已加载状态吗?M4 Max 128 GB 是市场上性价比最高的便携式电脑。您追求的是让 13B 模型运行得非常快吗?台式机版 RTX 4090 的成本只有一半,速度却是两倍。

#散热、风扇与电池续航

与 NVIDIA GPU 相比,M4 Max 在推理时发热较少。在持续负载下(使用 Q8 量化的大型 MoE 35B 模型连续生成 5 分钟),风扇转速会升至约 2 800 RPM——能听到声音,但噪音远低于游戏电脑。接通电源时,CPU/GPU 温度最高约为 95 °C,没有明显降频。

接通电源时(140 W 充电器)
全功率运行,吞吐量最高。没有限制,风扇转速适中。
电池供电
macOS 会略微降低 GPU 频率:吞吐量约为接通电源时的 80%。Qwen 3.6 35B-A3B 的生成速度从约 45 tokens/s 降至 37 tokens/s。
运行推理时的电池续航
MacBook Pro 16" M4 Max 100 Wh:在大型 MoE 35B 模型上连续推理约 3 小时,在 7B-14B 模型上约 5 小时,在聊天与阅读混合使用场景下约 8 小时。
风扇噪音
持续生成 30 秒后就能听见风扇声,但比配备 RTX 的 PC 笔记本安静得多。

#如何充分发挥M4 Max的性能

请保持模型加载状态
模型加载后的首个提示响应较慢。请使用服务器模式(mlx_lm.server 或 ollama serve)以保持模型全程驻留于内存中。
优先使用MLX格式
mlx-community 在 Hugging Face 上发布的模型针对 Apple Silicon 进行了优化。选择模型时,优先查找以 "mlx-community/" 为前缀的模型。
使用asitop或Stats进行监控
asitop(Apple Silicon 上相当于 nvtop 的工具)会实时显示 GPU 消耗、内存情况和瞬时功率。
高性能模式
在系统设置 → 电池 → 选择「高性能」。对70B模型有实际但微小的性能提升。
在基准测试期间请关闭 Spotlight
Spotlight 索引可能使吞吐量降低 5% 至 10%。使用 mdutil -a -i off 可在一次会话期间关闭索引。
安装 asitop 以监控 GPU
# Installation
pip install asitop

# Lancement (nécessite sudo pour lire les compteurs hardware)
sudo asitop
!
没有 CUDA = 难以进行高强度微调
MLX支持基本的LoRA微调,但其生态系统仍远落后于PyTorch + CUDA。对于高强度微调而言,Mac M4 Max并非理想选择——建议使用RTX 3090/4090或H100云服务。

#深入了解

深入探讨该主题的三条路径:

在 macOS 上安装 Ollama
如果您更看重简便性而非极致性能,《在 macOS 上安装 Ollama(Apple 芯片)》指南涵盖了 Ollama 端的全部 Metal 工具链。
选择量化方案
在 128 GB 统一内存上,您可以升级至 Q5_K_M、Q6 甚至 FP16 —— 《选择量化方式》一文详细说明了各种权衡。
用 Mac Studio Ultra 更进一步
如果 30-35B 的 MoE 模型无法满足您的需求,而您希望在本地运行规模最大的开放权重模型(100B 至 671B),《Mac Studio 上可运行的 LLM 指南》涵盖了内存最高达 512 GB 的 Ultra 配置。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。