在 Mac mini M4 / M4 Pro (16–64 GB) 上应选择哪个 LLM? ?
配备 16 GB 内存的 Mac mini M4 即可正确运行本地 LLM:可运行 70 亿至 120 亿参数的模型,在 Q4_0 格式下 7B 模型最高约二十个 tokens/s,因为其 120 GB/s 的带宽限制了速度。若要运行 140 亿至 350 亿参数的模型,需使用 M4 Pro(273 GB/s,24 至 64 GB)。Apple 已于 2026 年 8 月用 Mac mini M6 和 M5 Pro 取代了该系列。
本指南利用 Apple、llama.cpp 以及 Ollama 和 LM Studio 文档中的数据,帮助您做出选择:选哪种芯片、配多少内存、用哪个模型,以及可以期待怎样的运行速度。它区分了 Apple 公布的信息、社区实测结果和仅通过计算得出的数值,并介绍了 2026 年 9 月推出的 M6 和 M5 Pro 系列的现状。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。
#Mac mini M4 与本地 LLM:这台设备能做什么
Mac mini 很适合作为本地 LLM 服务器,因为其统一内存由处理器和 GPU 共享,没有独立的显存。两个数字决定了您能用它做什么。内存容量(随芯片而异,为 16 至 64 GB)决定了可加载的模型大小:16 GB 可加载 70 亿至 120 亿参数的模型,32 至 48 GB 可加载 240 亿至 350 亿参数的模型。内存带宽决定速度:据 Apple,M4 芯片为 120 GB/s,M4 Pro 为 273 GB/s。LLM 每生成一个 token 都会重新读取权重,因此最大吞吐量大致等于内存带宽除以权重大小。对于 Q4_0 量化的 7B 模型,llama.cpp 的公开表格给出的速度为:M4 每秒 24.1 个 token,M4 Pro 每秒约 50 个 token。Apple 于 2026 年 8 月推出了取代这一系列的 Mac mini M6 和 M5 Pro;截至 8 月底,部分经销商仍有 M4 机型在售。
- Mac mini M4
- CPU 10核,GPU 10核,120 GB/s,16 GB统一内存(24GB或32GB可选),Thunderbolt 4。
- Mac mini M4 Pro
- 12核CPU、16核GPU(可选14核CPU和20核GPU),273 GB/s带宽,24GB内存(可选48GB或64GB),Thunderbolt 5。
- 外形与噪声
- 12.7 × 12.7 × 5.0 厘米,0.67 千克(M4)或 0.73 千克(M4 Pro);根据 Apple,待机噪音为 5 dBA。
- 声明的功耗
- M4:空闲时 4 W,最高 65 W。M4 Pro:空闲时 5 W,最高 140 W。Apple 未公布推理时的功耗数值。
#Mac mini M4 还是 M4 Pro:带宽决定选择
你已经知道哪个模型能装进你的 Mac mini M4 的内存。Mac 套件教你如何充分发挥它的潜力:提高 GPU 可用内存的上限(第 2 章),在 MLX 和 GGUF 之间作出选择(第 3 章),以及将你的 Mac mini 变成供全家使用的 AI 服务器(第 12 章)。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
两款芯片之间真正的差别不在于最大内存容量(32 GB 对比 64 GB),而在于内存带宽,后者相差 2.3 倍(273 ÷ 120)。在 llama.cpp 的表格中,实测的生成速度比值为 2.1(Q4_0 下为 50.7 ÷ 24.1),提示词处理速度比值为 2.0(440 ÷ 221)。
| 标准 | Mac mini M4 | Mac mini M4 Pro |
|---|---|---|
| 内存带宽(Apple) | 120 GB/s | 273 GB/s |
| 统一内存 (Apple) | 16 GB,可选 24 或 32 GB | 24 GB,可选 48 GB 或 64 GB |
| 生成,Llama 2 7B,Q4_0 量化(llama.cpp) | 24.1 tokens/s | 50.7 tokens/s(GPU 20 核) |
| 生成,相同模型采用Q8_0 | 13.5 tokens/s | 30.7 tokens/s |
| 读取提示词,Q4_0 | 221 tokens/s | 440 tokens/s |
| Thunderbolt接口 (Apple) | Thunderbolt 4,40 Gb/s | Thunderbolt 5,120 Gb/s |
- 以下情况下,M4 就够用
- 您单独使用时,可选择最多120亿参数的模型(Qwen 3.5 9B,Gemma 4 12B),最佳情况下每秒处理约二十个token。若需保留加载的嵌入模型,建议分配24GB内存。
- 以下情况下应选择 M4 Pro
- 您打算使用拥有 140 亿至 270 亿个参数的模型、拥有 300 亿至 350 亿个参数的混合专家模型(MoE,至少需要 48 GB),或使用代码智能体,或供多名用户使用。超过 64 GB 就需要 Mac Studio。
#Mac mini 的 VRAM:统一内存及其 GPU 配额限制
一台 Mac mini 没有独立的显存,但 GPU 无法使用全部内存。根据 llama.cpp 用户的反馈,默认上限为内存的三分之二到四分之三;启动时,llama.cpp 会显示 recommendedMaxWorkingSetSize 这一行,给出实际值。默认情况下,iogpu.wired_limit_mb 的值为 0,表示「系统默认策略」,而非「无限制」。
| Mac mini 的内存 | 估算的 GPU 可用内存上限 | 留给 macOS 的剩余内存 |
|---|---|---|
| 16 GB | 10.7至12 GB | 4到5 GB |
| 24 GB | 16 到 18 GB | 6 到 8 GB |
| 32 GB | 21 至 24 GB | 8 到 11 GB |
| 48 GB | 32至36 GB | 12 到 16 GB |
| 64 GB | 43 到 48 GB | 16至21GB |
内存上限必须足以容纳模型权重、KV 缓存(上下文占用的内存,会随对话增长)和计算缓冲区。要加载接近上限的模型,就需要提高上限:MLX 建议设置的值高于以兆字节计的模型大小,但低于机器的内存容量。请为 macOS 留出数 GB 内存,否则速度会急剧下降。手动设置的 sysctl 参数可能在重启后失效。
#不同内存容量该选什么模型:哪些模型能装进 Mac mini 的内存
该表将 Ollama 发布的文件大小与 RAM 容量三分之二的上限进行比较(保守假设)。“是”:权重占用不到该上限的 70%,还留有 KV 缓存空间。“刚好”:权重能装下,但只能使用较短的上下文。“否”:权重超过该上限。这些是计算结果,不是实测数据。
| 模型 | 模型大小 (Ollama) | M4 16 GB | M4 24 GB | M4 32 GB | M4 Pro 48 GB | M4 Pro 64 GB |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | 6.6 GB | 是 | 是 | 是 | 是 | 是 |
| Gemma 4 12B | 7.6 GB | 勉强能容纳 | 是 | 是 | 是 | 是 |
| gpt-oss 20B | 14 GB | 否 | 勉强能容纳 | 是 | 是 | 是 |
| Mistral Small 24B | 14 GB | 否 | 勉强能容纳 | 是 | 是 | 是 |
| Qwen 3.8 27B | 18 GB | 否 | 否 | 勉强能容纳 | 是 | 是 |
| Qwen3-Coder 30B-A3B | 19 GB | 否 | 否 | 勉强能容纳 | 是 | 是 |
| Qwen 3.6 35B-A3B (MoE) | 23 GB | 否 | 否 | 否 | 勉强能容纳 | 是 |
| Qwen3-Coder 30B-A3B(Q8_0量化) | 32 GB | 否 | 否 | 否 | 勉强能容纳 | 勉强能容纳 |
#Mac mini M4 16 GB:优先推荐的模型
在配备 16 GB 内存的机器上,可用上限约为 11 GB。Qwen 3.5 9B(Ollama 上为 6.6 GB)能为 KV 缓存和缓冲区留下约 4 GB。Gemma 4 12B(7.6 GB)在短上下文下可以运行。像 Mistral Small 24B 这样大小为 14 GB 的模型则无法完全装入 GPU 可用内存:Ollama 会将它分配到 GPU 和 CPU 上,速度随之下降。ollama ps 命令会显示这一分配情况;目标是让模型 100% 在 GPU 上运行。
#Mac mini 的运行速度:理论上限与已发布测试数据
生成吞吐量受带宽限制:每秒 token 数 ≈ 带宽(GB/s)÷ 生成每个 token 时读取的权重大小(GB)。这个计算给出的是上限,绝不是实测值。对于一个大小为 14 GB 的稠密模型,120 ÷ 14 表示 M4 最多可达到 8.6 token/秒,而 273 ÷ 14 表示 M4 Pro 最多可达到 19.5 token/秒。
| 模型 | 模型大小 | M4(120 GB/s) | M4 Pro (273 GB/s) |
|---|---|---|---|
| Qwen 3.5 9B | 6.6 GB | 18 | 41 |
| Gemma 4 12B | 7.6 GB | 16 | 36 |
| Mistral Small 24B | 14 GB | 8,6 | 19,5 |
已公布的实测结果仍低于这一上限。以下数据来自 llama.cpp 社区持续更新的 Apple 芯片测量表,使用的模型是 Llama 2 7B。这些并非我们的测量结果,而且使用的是采用 Q4_0 和 Q8_0 量化的旧模型,但它们能反映不同芯片之间的相对表现。
| 芯片 | 带宽 | Q4_0生成 | 生成 Q8_0 | Q4_0 提示词处理 |
|---|---|---|---|---|
| M4(10核GPU) | 120 GB/s | 24,1 | 13,5 | 221 |
| M4 Pro(GPU 16核) | 273 GB/s | 49,6 | 30,5 | 364 |
| M4 Pro(20 核 GPU) | 273 GB/s | 50,7 | 30,7 | 440 |
| M5 Pro(GPU 20 核) | 307 GB/s | 66,3 | 38,9 | 1 621 |
从 Q8_0 切换到 Q4_0 后,M4 的生成速度变为原来的 1.8 倍,M4 Pro 则变为原来的 1.7 倍:文件大小比计算量更重要。GPU 核心主要影响提示词的读取速度(364 token/秒,对比 M4 Pro 的 440 token/秒)。截至查阅之日,表格中没有任何 M6 的测量数据。
#Mac mini M6 和 M5 Pro:新系列对大语言模型的影响
Apple 宣称,在 LM Studio 中,Mac mini M6 的提示词处理速度最高可达 M4 的 4.8 倍,M5 Pro 则最高可达 M4 Pro 的 4 倍。这些提升体现在提示词读取阶段,该阶段受益于每个 GPU 核心中新增的神经加速器。生成速度仍由带宽决定,提升幅度小得多:从 12%(307 对比 273 GB/s)到 42%(170 对比 120 GB/s)。
| 芯片 | 带宽 | 统一内存 | 空闲/最大值 |
|---|---|---|---|
| M4 | 120 GB/s | 16、24或32 GB | 4 W / 65 W |
| M6 | 153 GB/s(16 GB),170 GB/s(24 GB 及以上) | 16、24或32 GB | 4 W / 70 W |
| M4 Pro | 273 GB/s | 24、48或64GB | 5 W / 140 W |
| M5 Pro | 307 GB/s | 24、48或64GB | 6 W / 145 W |
基础款 M6 的带宽为 153 GB/s,仅比 M4 高出 28%:9B 模型的理论速度上限从每秒 18 个 token 提升至约 23 个。新系列主要让长上下文使用场景受益:例如注入长文档的 RAG,或重新阅读代码仓库的代码智能体。
- 新机:300至350亿参数模型
- 选择至少配备 48GB 内存的 M5 Pro;若想更从容地运行 350 亿参数的 MoE 模型,则需要 64GB:M6 的内存上限为 32GB。
- M4 仍有库存
- 如果与M6的价差明显,用来运行70至120亿参数的模型是合理选择。这批库存有限。
#使用 Ollama 在 Mac mini 上安装 LLM 服务器
Ollama 在 macOS 上以应用程序形式运行,其设置通过 launchctl 定义的环境变量实现。默认情况下,Ollama 仅监听 127.0.0.1:11434,未经更改,其他设备无法使用。
- 01安装 Ollama 应用从 ollama.com 下载 Ollama 并将其放入 Applications 文件夹。首次启动时,应用会提示创建 ollama 命令的链接。
- 02向局域网开放端口通过launchctl设置OLLAMA_HOST(如下命令),然后重新启动应用程序。地址0.0.0.0会将API开放给整个网络,且无需认证:请仅将其用于可信网络。
- 03防止进入睡眠状态在“系统设置”的“能源”部分,启用防止屏幕关闭时自动进入睡眠的选项;否则,服务可能会中断。
- 04下载适配的模型在表格中选择一个标记为「是」的模型以匹配您的内存,例如 qwen3.5:9b 在 16GB 内存下运行。
- 05从其他设备验证向 Mac mini 的地址(.local 主机名或 IP 地址)发送请求,然后运行 ollama ps:Processor 列应显示 100% GPU。
这里不需要两个经常被照搬的设置:Ollama文档明确指出,硬件支持时会自动启用Flash Attention,而OLLAMA_ORIGINS是针对浏览器扩展的。另一方面,对KV缓存进行量化(OLLAMA_KV_CACHE_TYPE=q8_0)可将其大小减少约一半,损失很小;对于16 GB内存的机器,上下文变长时这一点尤为重要。
#LM Studio : Ollama 的替代方案
LM Studio 需要 Apple Silicon 芯片和 macOS 14 或更新版本,建议配备 16 GB 内存。从 0.3.4 版本起,它既能加载 GGUF 模型,也能加载 MLX 模型。在无显示器的情况下,可用 lms daemon up 启动其 llmster 守护进程。“Serve on Local Network”选项会将 API 开放给网络;令牌认证默认未启用。Ollama 的 MLX 引擎于 2026 年 3 月以预览版形式推出,当时要求超过 32 GB 内存:配备 16 GB 内存的 M4 无法使用该引擎。
#Mac mini能提供的功能:聊天、RAG、智能体、集群
- 家庭聊天服务器
- Ollama 和 LM Studio 的 API 支持采用 OpenAI 格式的客户端(Open WebUI、Zed、脚本)。将 Mac mini 放在路由器附近,就能为全家提供服务。
- 文档 RAG
- 需要加载生成模型和嵌入模型。nomic-embed-text 的大小为 274 MB:16 GB 内存可以同时容纳它和 Qwen 3.5 9B。
- 编程智能体
- 智能体在每一步都会发送长提示:处理提示比生成内容更重要,而 M6 和 M5 Pro 在这方面的优势最大。
#能支持多少用户同时使用?
Ollama 默认对每个模型一次只处理一个请求(OLLAMA_NUM_PARALLEL 的值为 1)。每增加一个并行请求,分配的上下文容量也会增加:根据文档,4 个请求各使用 2 000 token 的上下文时,总共会分配 8 000 token。缓存内存占用 = 单次对话的缓存内存占用 × 并行请求数。每个人收到回答的速度都会变慢;这里没有针对某个具体人数的可靠测量数据。
#将多个Mac mini连接成集群
只有 M4 Pro 提供 Thunderbolt 5(120 Gb/s);M4 仅提供 Thunderbolt 4(40 Gb/s)。exo 项目支持通过 Thunderbolt 5 使用 RDMA,据称这能将机器间的延迟降低 99%;该项目还表示,在 macOS 26.2 或更高版本上,增加设备数量会让模型运行得更快。其基准测试使用的是 Mac Studio,而非 Mac mini。集群的首要用途是加载大到单台机器无法容纳的模型。
- 在本地网络共享 Ollama(家庭、团队)
- 保护 Ollama 服务器:认证与反向代理
- Exo:将多台机器组成自建 LLM 集群
- 优化搭载 Apple Silicon 的 Mac:GPU 上限、Flash Attention、KV 缓存
- 硬件介绍:Mac mini M6
- 硬件规格:Mac mini M5 Pro
#Mac mini M4 或 MacBook Air M4:同款芯片,不同用途
13英寸MacBook Air M4采用相同的芯片,具备相同的带宽(120 GB/s)以及16GB、24GB或32GB的相同内存选项:性能上限一致。不同之处在于机壳设计。该指南旧版曾声称Air在运行十分钟后性能下降20%;但无任何来源证实此说法,现已删除。对于持续运行的场景,Mac mini是自然之选;对于移动设备(1.24公斤,含屏幕和电池),MacBook更为合适。
- 来源:Apple,Mac mini(2024)技术规格
- 来源:Apple,关于 Mac mini M6 和 M5 Pro 的公告(2026年8月)
- 来源:llama.cpp,基于Apple M系列芯片的性能表现
- 来源:Ollama 文档,常见问题解答(环境变量、KV 缓存)
- 来源:LM Studio 文档,无界面服务器模式
#常见问题
配备16GB内存的M4 Mac mini足以运行本地LLM吗?+
在 Mac mini M4 16 GB 上,哪个 LLM 最佳?+
用于本地 AI,Mac mini 该选 M4 还是 M4 Pro?+
Mac mini M6比M4在LLM任务上快很多吗?+
能否将多个Mac mini连接成集群用于LLM?+
Mac mini M4 作为 LLM 服务器 全天候不间断运行的功耗是多少?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。