Mac M4 Max 与本地 LLM:MLX,性能, 模型
MacBook Pro M4 Max(64 或 128 GB 统一内存)已成为运行本地 LLM 最强大的便携式电脑。统一内存与 Apple 的 MLX 框架相结合,让笔记本电脑能够加载当前规模最大的开放权重模型——以全精度运行的 300 亿至 350 亿参数 MoE 模型,以及 270 亿参数的多模态稠密模型——并以令人惊讶的速度运行。本指南通过测量检验哪些方案真正可行:MLX 与 Ollama 的对比、实际可运行的模型、实测的每秒 token 数,以及电池供电时的发热表现。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: Mac Studio M5 Max(36 GB / 512 GB).
为什么选择它?我们的完整资料: Mac Studio M5 Max(36 GB / 512 GB) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#为什么 M4 Max 会改变本地大语言模型的格局
在 Windows 或 Linux 电脑上,GPU 显存是主要限制。RTX 4090 的显存上限为 24 GB:在本地以 FP16 运行 30–35B 模型,必须将部分模型卸载到 CPU 端运行,这会使吞吐量降至原来的五分之一或十分之一。M4 Max 则换了一个思路。GPU 与 CPU 共享同一内存:RAM 中的所有数据都可由 GPU 直接访问,无需复制。
具体来说,一台配备 128 GB 内存的 MacBook Pro M4 Max 可以轻松以全精度 FP16 加载 2026 年最好的 MoE 模型——Qwen 3.6 35B-A3B 或 Qwen 3.8 27B——或者同时加载多个模型,并继续在电池供电下运行它们。目前没有任何 x86 便携式电脑能做到这一点——要接近同样的效果,需要配备一块 RTX 5090 或两块 RTX 3090 的台式机,而且即便如此,也无法在移动中使用。
#统一内存:为何128 GB ≠ 128 GB显存
你已经看到了 M4 Max 搭配 MLX 的表现。Mac 套件详细说明了 MLX 在什么情况下真正优于 GGUF(第 3 章)、如何计算长上下文下的内存预算(第 5 章),以及可以预期怎样的性能表现,包括发热和电池消耗(第 6 章)。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
macOS不会允许单个进程占用全部内存。默认情况下,GPU可使用约75%的总RAM。在128GB机器上,可为模型提供约96GB内存;在64GB机器上,可提供约48GB内存。这足以满足目标模型的需求,但在计算前需明确这一点。
- Mac M4 Max 64 GB
- 约有 48 GB 内存可用于 LLM。2026 年最好的 MoE 模型采用 Q8 量化时,内存空间较为充裕——Qwen3-Coder 30B-A3B(约 32 GB)、Qwen 3.8 27B(约 30 GB),以及刚好能装下的 Qwen 3.6 35B-A3B(约 40 GB)——而 Mistral Small 24B 即使采用 FP16,也能装入内存(约 48 GB)。
- Mac M4 Max 128 GB
- 约有 96 GB 内存可用于 LLM。有足够余量以完整 FP16 精度运行大型 MoE 模型(Qwen 3.6 35B-A3B、Qwen 3.8 27B、Granite 4.2 30B),同时保持多个模型处于已加载状态,或将上下文扩展至 256k tokens。
- 推荐量化方式
- Q4_K_M 仍是合适的默认选择。配备 128 GB 内存时,可以轻松提高到 Q5_K_M 或 Q6,以提升质量。
#MLX vs Ollama:Mac M4 Max上哪个更适合?
Apple 于 2023 年 12 月发布了 MLX:这是一个面向 Apple Silicon 的数组计算框架,功能上相当于 PyTorch,但围绕统一内存设计。mlx-lm 模块提供命令行界面和 Python API,用于运行 MLX 格式的量化模型(该格式与 GGUF 相近,但并不相同)。
- Ollama (Metal)
- 安装更简便,生态系统庞大,采用通用的 GGUF 格式,并在 :11434 端口提供兼容 OpenAI 的 API。存在少量额外开销,CPU↔GPU 之间的内存转换效率并非最优。
- MLX (mlx-lm)
- 在 Apple Silicon 上实际运行更快:在 30B 及以上模型上,每秒生成的 token 数提升 20% 至 40%,具备原生内存管理和内置提示缓存。生态系统较小,默认不提供标准化的 REST API。
- 结论
- 想探索并试用 10 个模型:选 Ollama。想充分发挥 M4 Max 的性能,并在本地生产环境中以全精度运行大型 30–35B MoE 模型:选 MLX。
#安装MLX并运行第一个模型
- 01准备Python环境请使用 Python 3.10 或更高版本(推荐 3.12)。在 Mac 上,使用 uv 或 pyenv 是最简洁规范的做法。除 Apple Silicon 外,mlx-lm 没有其他原生环境要求。
- 02安装mlx-lm只需一条 pip 命令即可。所有组件都已针对 arm64 架构和 Metal 编译好。
- 03启动 MLX 模型命令行工具 mlx_lm.generate 从 Hugging Face 的 mlx-community 组织下载模型并运行。
- 04暴露HTTP API(可选)mlx-lm 从 0.18 版本开始集成 mlx_lm.server 命令,可在 8080 端口提供兼容 OpenAI 的 API。
#已在MacBook Pro M4 Max 128 GB上测试的模型
以下所有数值均在一台配备M4 Max芯片(40个GPU核心,128 GB)的16英寸MacBook Pro上测得,设备连接电源,初始为冷启动,之后经过5分钟预热。提示词较短(50个token),生成500个token,批处理大小为1。
- Qwen 3.6 35B-A3B Q8 (MLX)
- 约占用 40 GB 内存。生成速度为 42–50 token/秒:混合专家(MoE)模型仅激活 30 亿个参数,因此虽然模型规模较大,吞吐量仍然很高。它是在这台 Mac 上兼顾多种用途的可靠之选。
- Qwen 3.8 27B Q8(MLX)
- 约占用30 GB内存。速度为18–22 tokens/s(稠密模型)。支持262k上下文和视觉,是最接近本地Copilot的选择。记得将其推理设置调为low,否则它会过度思考。
- Qwen3-Coder 30B-A3B Q8 (MLX)
- 约占用 32 GB 内存。速度为 44–52 tokens/s。专注于代码的 MoE 模型,上下文长度为 256k:非常适合作为本地开发助手。
- GLM 4.7 Flash Q8 (MLX)
- 约32 GB RAM(MoE 30B-A3B,MIT许可证)。40–48 token/秒。擅长智能体任务和工具调用,响应非常迅速。
- Granite 4.2 30B Q8 (MLX)
- 约33GB内存,30-38个token/秒,适用于专业/企业级使用,token消耗较少且长时间会话稳定。
- Mistral Small 24B FP16 (MLX)
- ≈48 GB。18–22 tokens/s。稠密模型,法语表现优秀,尤其擅长文档总结。
#详细基准测试:MLX 对比 Ollama 对比 llama.cpp
使用同一个 Q8 量化的 Qwen 3.8 27B 模型,在同一台配备 128 GB 内存的 M4 Max 机器上,三个运行时的实测表现差异如下:
- MLX 8位 (mlx-community)
- 平均速度为20.5 tokens/s,提示处理速度约为410 tokens/s
- Ollama Q8_0 (Metal)
- 平均15.2个token/秒,提示词评估约300个token/秒
- 直接使用 llama.cpp,Q8_0
- 平均15.6 tokens/s。Ollama 相比 llama.cpp 增加的开销很小。
#M4 Max 与 RTX 4090:各自在哪些方面占优
直接对比:一台配备 128 GB 内存的 MacBook Pro M4 Max(Apple 已用 M5 Max 替代该型号——需要在二手市场寻找,价格不定),与一台配备二手 RTX 4090 24 GB 的台式机(价格不定,仅指显卡价格,不含主机其余部件)。
- 小模型 ≤14B Q4 (Qwen 3.5 9B, gpt-oss 20B)
- RTX 4090 明显胜出(80–120 token/秒,而 M4 Max 为 35–60 token/秒)。对于这些规模的模型,如果有选择,就选 RTX 4090。
- 24–30B Q4 稠密模型(Mistral Small、Qwen 3.8 27B)
- RTX 4090目前仍领先(30-40 tok/s 对比 M4 Max的18-22 tok/s),但差距正在缩小。
- 全精度Q8/FP16
- M4 Max 在实际使用中更胜一筹:它能在 RAM 中以 Q8 或 FP16 运行 2026 年最出色的 MoE 模型(35B-A3B、27B),而 RTX 4090 则必须退回 Q4,或将部分计算卸载到 CPU(生成吞吐量降至五分之一)。
- 大规模混合专家模型 (Qwen 3.6 35B-A3B)
- M4 Max 凭借大容量内存表现出色:所有内容都能装入内存,即使采用 FP16 也一样。RTX 4090 一旦使用高于 Q4 的精度,就必须将部分模型卸载到系统内存。
- 便携性
- 完全没法比:M4 Max 在电池供电下可持续推理约 3 小时,RTX 4090 则只能走 0 公里。
#散热、风扇与电池续航
与 NVIDIA GPU 相比,M4 Max 在推理时发热较少。在持续负载下(使用 Q8 量化的大型 MoE 35B 模型连续生成 5 分钟),风扇转速会升至约 2 800 RPM——能听到声音,但噪音远低于游戏电脑。接通电源时,CPU/GPU 温度最高约为 95 °C,没有明显降频。
- 接通电源时(140 W 充电器)
- 全功率运行,吞吐量最高。没有限制,风扇转速适中。
- 电池供电
- macOS 会略微降低 GPU 频率:吞吐量约为接通电源时的 80%。Qwen 3.6 35B-A3B 的生成速度从约 45 tokens/s 降至 37 tokens/s。
- 运行推理时的电池续航
- MacBook Pro 16" M4 Max 100 Wh:在大型 MoE 35B 模型上连续推理约 3 小时,在 7B-14B 模型上约 5 小时,在聊天与阅读混合使用场景下约 8 小时。
- 风扇噪音
- 持续生成 30 秒后就能听见风扇声,但比配备 RTX 的 PC 笔记本安静得多。
#如何充分发挥M4 Max的性能
- 请保持模型加载状态
- 模型加载后的首个提示响应较慢。请使用服务器模式(mlx_lm.server 或 ollama serve)以保持模型全程驻留于内存中。
- 优先使用MLX格式
- mlx-community 在 Hugging Face 上发布的模型针对 Apple Silicon 进行了优化。选择模型时,优先查找以 "mlx-community/" 为前缀的模型。
- 使用asitop或Stats进行监控
- asitop(Apple Silicon 上相当于 nvtop 的工具)会实时显示 GPU 消耗、内存情况和瞬时功率。
- 高性能模式
- 在系统设置 → 电池 → 选择「高性能」。对70B模型有实际但微小的性能提升。
- 在基准测试期间请关闭 Spotlight
- Spotlight 索引可能使吞吐量降低 5% 至 10%。使用 mdutil -a -i off 可在一次会话期间关闭索引。
#深入了解
深入探讨该主题的三条路径:
- 在 macOS 上安装 Ollama
- 如果您更看重简便性而非极致性能,《在 macOS 上安装 Ollama(Apple 芯片)》指南涵盖了 Ollama 端的全部 Metal 工具链。
- 选择量化方案
- 在 128 GB 统一内存上,您可以升级至 Q5_K_M、Q6 甚至 FP16 —— 《选择量化方式》一文详细说明了各种权衡。
- 用 Mac Studio Ultra 更进一步
- 如果 30-35B 的 MoE 模型无法满足您的需求,而您希望在本地运行规模最大的开放权重模型(100B 至 671B),《Mac Studio 上可运行的 LLM 指南》涵盖了内存最高达 512 GB 的 Ultra 配置。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。