入门 14 分钟Mac mini

在 Mac mini M4 / M4 Pro (16–64 GB) 上应选择哪个 LLM? ?

直接回答

配备 16 GB 内存的 Mac mini M4 即可正确运行本地 LLM:可运行 70 亿至 120 亿参数的模型,在 Q4_0 格式下 7B 模型最高约二十个 tokens/s,因为其 120 GB/s 的带宽限制了速度。若要运行 140 亿至 350 亿参数的模型,需使用 M4 Pro(273 GB/s,24 至 64 GB)。Apple 已于 2026 年 8 月用 Mac mini M6 和 M5 Pro 取代了该系列。

本指南利用 Apple、llama.cpp 以及 Ollama 和 LM Studio 文档中的数据,帮助您做出选择:选哪种芯片、配多少内存、用哪个模型,以及可以期待怎样的运行速度。它区分了 Apple 公布的信息、社区实测结果和仅通过计算得出的数值,并介绍了 2026 年 9 月推出的 M6 和 M5 Pro 系列的现状。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 macOS 14+ 上测试
推荐硬件

本指南的备选购买方案: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。

#Mac mini M4 与本地 LLM:这台设备能做什么

Mac mini 很适合作为本地 LLM 服务器,因为其统一内存由处理器和 GPU 共享,没有独立的显存。两个数字决定了您能用它做什么。内存容量(随芯片而异,为 16 至 64 GB)决定了可加载的模型大小:16 GB 可加载 70 亿至 120 亿参数的模型,32 至 48 GB 可加载 240 亿至 350 亿参数的模型。内存带宽决定速度:据 Apple,M4 芯片为 120 GB/s,M4 Pro 为 273 GB/s。LLM 每生成一个 token 都会重新读取权重,因此最大吞吐量大致等于内存带宽除以权重大小。对于 Q4_0 量化的 7B 模型,llama.cpp 的公开表格给出的速度为:M4 每秒 24.1 个 token,M4 Pro 每秒约 50 个 token。Apple 于 2026 年 8 月推出了取代这一系列的 Mac mini M6 和 M5 Pro;截至 8 月底,部分经销商仍有 M4 机型在售。

Mac mini M4
CPU 10核,GPU 10核,120 GB/s,16 GB统一内存(24GB或32GB可选),Thunderbolt 4。
Mac mini M4 Pro
12核CPU、16核GPU(可选14核CPU和20核GPU),273 GB/s带宽,24GB内存(可选48GB或64GB),Thunderbolt 5。
外形与噪声
12.7 × 12.7 × 5.0 厘米,0.67 千克(M4)或 0.73 千克(M4 Pro);根据 Apple,待机噪音为 5 dBA。
声明的功耗
M4:空闲时 4 W,最高 65 W。M4 Pro:空闲时 5 W,最高 140 W。Apple 未公布推理时的功耗数值。
!
M4系列自2026年8月起已被取代
Apple 于 2026 年 8 月发布了 Mac mini M6 和 M5 Pro,自 9 月 22 日起可供购买。下表适用于已购买、库存或二手的 M4。

#Mac mini M4 还是 M4 Pro:带宽决定选择

Mac 套装

你已经知道哪个模型能装进你的 Mac mini M4 的内存。Mac 套件教你如何充分发挥它的潜力:提高 GPU 可用内存的上限(第 2 章),在 MLX 和 GGUF 之间作出选择(第 3 章),以及将你的 Mac mini 变成供全家使用的 AI 服务器(第 12 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

两款芯片之间真正的差别不在于最大内存容量(32 GB 对比 64 GB),而在于内存带宽,后者相差 2.3 倍(273 ÷ 120)。在 llama.cpp 的表格中,实测的生成速度比值为 2.1(Q4_0 下为 50.7 ÷ 24.1),提示词处理速度比值为 2.0(440 ÷ 221)。

Mac mini M4 和 M4 Pro 用于大语言模型(来源:Apple,llama.cpp)
标准Mac mini M4Mac mini M4 Pro
内存带宽(Apple)120 GB/s273 GB/s
统一内存 (Apple)16 GB,可选 24 或 32 GB24 GB,可选 48 GB 或 64 GB
生成,Llama 2 7B,Q4_0 量化(llama.cpp)24.1 tokens/s50.7 tokens/s(GPU 20 核)
生成,相同模型采用Q8_013.5 tokens/s30.7 tokens/s
读取提示词,Q4_0221 tokens/s440 tokens/s
Thunderbolt接口 (Apple)Thunderbolt 4,40 Gb/sThunderbolt 5,120 Gb/s
以下情况下,M4 就够用
您单独使用时,可选择最多120亿参数的模型(Qwen 3.5 9B,Gemma 4 12B),最佳情况下每秒处理约二十个token。若需保留加载的嵌入模型,建议分配24GB内存。
以下情况下应选择 M4 Pro
您打算使用拥有 140 亿至 270 亿个参数的模型、拥有 300 亿至 350 亿个参数的混合专家模型(MoE,至少需要 48 GB),或使用代码智能体,或供多名用户使用。超过 64 GB 就需要 Mac Studio。

#Mac mini 的 VRAM:统一内存及其 GPU 配额限制

一台 Mac mini 没有独立的显存,但 GPU 无法使用全部内存。根据 llama.cpp 用户的反馈,默认上限为内存的三分之二到四分之三;启动时,llama.cpp 会显示 recommendedMaxWorkingSetSize 这一行,给出实际值。默认情况下,iogpu.wired_limit_mb 的值为 0,表示「系统默认策略」,而非「无限制」。

GPU 默认可用内存上限,估计分别为 RAM 的三分之二和四分之三
Mac mini 的内存估算的 GPU 可用内存上限留给 macOS 的剩余内存
16 GB10.7至12 GB4到5 GB
24 GB16 到 18 GB6 到 8 GB
32 GB21 至 24 GB8 到 11 GB
48 GB32至36 GB12 到 16 GB
64 GB43 到 48 GB16至21GB

内存上限必须足以容纳模型权重、KV 缓存(上下文占用的内存,会随对话增长)和计算缓冲区。要加载接近上限的模型,就需要提高上限:MLX 建议设置的值高于以兆字节计的模型大小,但低于机器的内存容量。请为 macOS 留出数 GB 内存,否则速度会急剧下降。手动设置的 sysctl 参数可能在重启后失效。

读取后记录上限(示例:M4 Pro 48 GB)
# Valeur actuelle : 0 = plafond par défaut du système
sysctl iogpu.wired_limit_mb

# 40 Go pour le GPU sur 48 Go de RAM (40 x 1024 = 40960 Mo)
sudo sysctl iogpu.wired_limit_mb=40960

#不同内存容量该选什么模型:哪些模型能装进 Mac mini 的内存

该表将 Ollama 发布的文件大小与 RAM 容量三分之二的上限进行比较(保守假设)。“是”:权重占用不到该上限的 70%,还留有 KV 缓存空间。“刚好”:权重能装下,但只能使用较短的上下文。“否”:权重超过该上限。这些是计算结果,不是实测数据。

除非另有说明,均采用 Ollama 的默认量化:模型能否装入 GPU 默认可用内存上限?
模型模型大小 (Ollama)M4 16 GBM4 24 GBM4 32 GBM4 Pro 48 GBM4 Pro 64 GB
Qwen 3.5 9B6.6 GB是是是是是
Gemma 4 12B7.6 GB勉强能容纳是是是是
gpt-oss 20B14 GB否勉强能容纳是是是
Mistral Small 24B14 GB否勉强能容纳是是是
Qwen 3.8 27B18 GB否否勉强能容纳是是
Qwen3-Coder 30B-A3B19 GB否否勉强能容纳是是
Qwen 3.6 35B-A3B (MoE)23 GB否否否勉强能容纳是
Qwen3-Coder 30B-A3B(Q8_0量化)32 GB否否否勉强能容纳勉强能容纳

#Mac mini M4 16 GB:优先推荐的模型

在配备 16 GB 内存的机器上,可用上限约为 11 GB。Qwen 3.5 9B(Ollama 上为 6.6 GB)能为 KV 缓存和缓冲区留下约 4 GB。Gemma 4 12B(7.6 GB)在短上下文下可以运行。像 Mistral Small 24B 这样大小为 14 GB 的模型则无法完全装入 GPU 可用内存:Ollama 会将它分配到 GPU 和 CPU 上,速度随之下降。ollama ps 命令会显示这一分配情况;目标是让模型 100% 在 GPU 上运行。

→
MoE 模型可降低每 token 的处理时间,但不会减少内存占用
Qwen3-Coder 30B-A3B 总共有 305 亿个参数,但每个 token 仅激活 33 亿个参数:它读取的权重较少,运行速度快,但整个文件(19 GB)仍驻留在内存中。因此,尽管其激活参数只有 30 亿,它仍无法装入 16 GB 内存的 Mac mini。

#Mac mini 的运行速度:理论上限与已发布测试数据

生成吞吐量受带宽限制:每秒 token 数 ≈ 带宽(GB/s)÷ 生成每个 token 时读取的权重大小(GB)。这个计算给出的是上限,绝不是实测值。对于一个大小为 14 GB 的稠密模型,120 ÷ 14 表示 M4 最多可达到 8.6 token/秒,而 273 ÷ 14 表示 M4 Pro 最多可达到 19.5 token/秒。

每秒令牌数的理论上限(带宽 ÷ Ollama 模型大小,适用于稠密模型)
模型模型大小M4(120 GB/s)M4 Pro (273 GB/s)
Qwen 3.5 9B6.6 GB1841
Gemma 4 12B7.6 GB1636
Mistral Small 24B14 GB8,619,5

已公布的实测结果仍低于这一上限。以下数据来自 llama.cpp 社区持续更新的 Apple 芯片测量表,使用的模型是 Llama 2 7B。这些并非我们的测量结果,而且使用的是采用 Q4_0 和 Q8_0 量化的旧模型,但它们能反映不同芯片之间的相对表现。

llama.cpp, Llama 2 7B:tokens/s(GitHub讨论4167,提交8e672ef)
芯片带宽Q4_0生成生成 Q8_0Q4_0 提示词处理
M4(10核GPU)120 GB/s24,113,5221
M4 Pro(GPU 16核)273 GB/s49,630,5364
M4 Pro(20 核 GPU)273 GB/s50,730,7440
M5 Pro(GPU 20 核)307 GB/s66,338,91 621

从 Q8_0 切换到 Q4_0 后,M4 的生成速度变为原来的 1.8 倍,M4 Pro 则变为原来的 1.7 倍:文件大小比计算量更重要。GPU 核心主要影响提示词的读取速度(364 token/秒,对比 M4 Pro 的 440 token/秒)。截至查阅之日,表格中没有任何 M6 的测量数据。

i
推理模型响应较慢
会进行思考的模型往往在给出答案前就生成 2 000 个 token。以每秒 8 个 token 的速度(M4 上的 14B 稠密模型),这需要 250 秒,超过 4 分钟。在 M4 Pro 上,以每秒 19 个 token 的速度,则约需 105 秒。在 M4 和 M4 Pro 之间做选择时,这个计算结果是一个重要的考量。

#Mac mini M6 和 M5 Pro:新系列对大语言模型的影响

Apple 宣称,在 LM Studio 中,Mac mini M6 的提示词处理速度最高可达 M4 的 4.8 倍,M5 Pro 则最高可达 M4 Pro 的 4 倍。这些提升体现在提示词读取阶段,该阶段受益于每个 GPU 核心中新增的神经加速器。生成速度仍由带宽决定,提升幅度小得多:从 12%(307 对比 273 GB/s)到 42%(170 对比 120 GB/s)。

四款芯片(来源:Apple)
芯片带宽统一内存空闲/最大值
M4120 GB/s16、24或32 GB4 W / 65 W
M6153 GB/s(16 GB),170 GB/s(24 GB 及以上)16、24或32 GB4 W / 70 W
M4 Pro273 GB/s24、48或64GB5 W / 140 W
M5 Pro307 GB/s24、48或64GB6 W / 145 W

基础款 M6 的带宽为 153 GB/s,仅比 M4 高出 28%:9B 模型的理论速度上限从每秒 18 个 token 提升至约 23 个。新系列主要让长上下文使用场景受益:例如注入长文档的 RAG,或重新阅读代码仓库的代码智能体。

新机:300至350亿参数模型
选择至少配备 48GB 内存的 M5 Pro;若想更从容地运行 350 亿参数的 MoE 模型,则需要 64GB:M6 的内存上限为 32GB。
M4 仍有库存
如果与M6的价差明显,用来运行70至120亿参数的模型是合理选择。这批库存有限。

#使用 Ollama 在 Mac mini 上安装 LLM 服务器

Ollama 在 macOS 上以应用程序形式运行,其设置通过 launchctl 定义的环境变量实现。默认情况下,Ollama 仅监听 127.0.0.1:11434,未经更改,其他设备无法使用。

  1. 01
    安装 Ollama 应用
    从 ollama.com 下载 Ollama 并将其放入 Applications 文件夹。首次启动时,应用会提示创建 ollama 命令的链接。
  2. 02
    向局域网开放端口
    通过launchctl设置OLLAMA_HOST(如下命令),然后重新启动应用程序。地址0.0.0.0会将API开放给整个网络,且无需认证:请仅将其用于可信网络。
  3. 03
    防止进入睡眠状态
    在“系统设置”的“能源”部分,启用防止屏幕关闭时自动进入睡眠的选项;否则,服务可能会中断。
  4. 04
    下载适配的模型
    在表格中选择一个标记为「是」的模型以匹配您的内存,例如 qwen3.5:9b 在 16GB 内存下运行。
  5. 05
    从其他设备验证
    向 Mac mini 的地址(.local 主机名或 IP 地址)发送请求,然后运行 ollama ps:Processor 列应显示 100% GPU。
Mac mini 上的 Ollama 服务器
# Écoute sur tout le réseau local, puis relancer l'application Ollama
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Modèle pour 16 Go de mémoire
ollama pull qwen3.5:9b

# Test depuis un autre appareil (remplacez l'adresse)
curl http://mac-mini.local:11434/api/chat -d '{"model": "qwen3.5:9b", "messages": [{"role": "user", "content": "Bonjour"}], "stream": false}'

这里不需要两个经常被照搬的设置:Ollama文档明确指出,硬件支持时会自动启用Flash Attention,而OLLAMA_ORIGINS是针对浏览器扩展的。另一方面,对KV缓存进行量化(OLLAMA_KV_CACHE_TYPE=q8_0)可将其大小减少约一半,损失很小;对于16 GB内存的机器,上下文变长时这一点尤为重要。

#LM Studio : Ollama 的替代方案

LM Studio 需要 Apple Silicon 芯片和 macOS 14 或更新版本,建议配备 16 GB 内存。从 0.3.4 版本起,它既能加载 GGUF 模型,也能加载 MLX 模型。在无显示器的情况下,可用 lms daemon up 启动其 llmster 守护进程。“Serve on Local Network”选项会将 API 开放给网络;令牌认证默认未启用。Ollama 的 MLX 引擎于 2026 年 3 月以预览版形式推出,当时要求超过 32 GB 内存:配备 16 GB 内存的 M4 无法使用该引擎。

#Mac mini能提供的功能:聊天、RAG、智能体、集群

家庭聊天服务器
Ollama 和 LM Studio 的 API 支持采用 OpenAI 格式的客户端(Open WebUI、Zed、脚本)。将 Mac mini 放在路由器附近,就能为全家提供服务。
文档 RAG
需要加载生成模型和嵌入模型。nomic-embed-text 的大小为 274 MB:16 GB 内存可以同时容纳它和 Qwen 3.5 9B。
编程智能体
智能体在每一步都会发送长提示:处理提示比生成内容更重要,而 M6 和 M5 Pro 在这方面的优势最大。

#能支持多少用户同时使用?

Ollama 默认对每个模型一次只处理一个请求(OLLAMA_NUM_PARALLEL 的值为 1)。每增加一个并行请求,分配的上下文容量也会增加:根据文档,4 个请求各使用 2 000 token 的上下文时,总共会分配 8 000 token。缓存内存占用 = 单次对话的缓存内存占用 × 并行请求数。每个人收到回答的速度都会变慢;这里没有针对某个具体人数的可靠测量数据。

#将多个Mac mini连接成集群

只有 M4 Pro 提供 Thunderbolt 5(120 Gb/s);M4 仅提供 Thunderbolt 4(40 Gb/s)。exo 项目支持通过 Thunderbolt 5 使用 RDMA,据称这能将机器间的延迟降低 99%;该项目还表示,在 macOS 26.2 或更高版本上,增加设备数量会让模型运行得更快。其基准测试使用的是 Mac Studio,而非 Mac mini。集群的首要用途是加载大到单台机器无法容纳的模型。

#Mac mini M4 或 MacBook Air M4:同款芯片,不同用途

13英寸MacBook Air M4采用相同的芯片,具备相同的带宽(120 GB/s)以及16GB、24GB或32GB的相同内存选项:性能上限一致。不同之处在于机壳设计。该指南旧版曾声称Air在运行十分钟后性能下降20%;但无任何来源证实此说法,现已删除。对于持续运行的场景,Mac mini是自然之选;对于移动设备(1.24公斤,含屏幕和电池),MacBook更为合适。

#常见问题

配备16GB内存的M4 Mac mini足以运行本地LLM吗?+
是的,适用于 70 到 120 亿参数的模型。Qwen 3.5 9B(6.6 GB)可在约 11 GB 的 GPU 可用内存上限内运行,且能维持合理的上下文长度。最佳性能约为二十个 token/秒:M4 的峰值吞吐量为 120 GB/s。当参数量超过 120 亿时,建议使用 24 GB 内存配置或 M4 Pro。
在 Mac mini M4 16 GB 上,哪个 LLM 最佳?+
Qwen 3.5 9B 是最稳妥的选择:Ollama 版本大小为 6.6 GB,能为 KV 缓存留出空间。Gemma 4 12B(7.6 GB)在上下文较短时也能运行。避免使用大小为 14 GB 及以上的模型:它们会部分转由 CPU 运行,速度也会下降。
用于本地 AI,Mac mini 该选 M4 还是 M4 Pro?+
如果您目标是超过 120 亿参数的模型,请选择 M4 Pro:其 273 GB/s 的带宽相比 120 GB/s 几乎翻倍,且 48 GB 和 64 GB 的选项支持 300 亿至 350 亿参数的 MoE 模型。对于单人使用 9B 模型,M4 已足够。
Mac mini M6比M4在LLM任务上快很多吗?+
提示词处理方面,是的:Apple 宣称,在 LM Studio 中速度最高可达原来的 4.8 倍。生成方面,则不是:基础款 M6 的带宽从 120 GB/s 提升至 153 GB/s,约增加 28%。短回答变化不大,长上下文的变化则很大。
能否将多个Mac mini连接成集群用于LLM?+
可以,使用类似 exo 的工具,尤其适用于单台设备无法加载的大型模型。M4 Pro 支持 Thunderbolt 5(120 Gb/s),M4 仅支持 Thunderbolt 4(40 Gb/s)。exo 发布的性能提升数据针对 Mac Studio 设备:请根据您的配置进行验证。
Mac mini M4 作为 LLM 服务器 全天候不间断运行的功耗是多少?+
Apple 宣布 M4 型在空闲时为 4 瓦,最大功耗为 65 瓦;M4 Pro 型为 5 瓦和 140 瓦。在持续空闲状态下,4 瓦 × 8760 小时约等于每年 35 千瓦时;乘以您每千瓦时的电价即可计算出年耗电量。在推理过程中,Apple 未公布具体数值:实际功耗需通过功率表测量获得。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。