在 Mac mini M2 / M2 Pro(8–32 GB)上使用哪种 LLM? ?
Mac mini M2 或 M2 Pro 可以用作安静的家用 LLM 服务器:配备 16 GB 统一内存时,可运行 Q4 量化的 8–9B 模型;配备 32 GB 统一内存时(仅限 M2 Pro),可运行 24–32B 模型或 30–35B 的 MoE 模型。决定使用体验的是内存带宽:M2 为 100 GB/s,M2 Pro 为 200 GB/s。在运行相同模型时,M2 Pro 的生成速度几乎是 M2 的两倍。请避免选择 8 GB 版本。
2023 年 1 月发布的 Mac mini M2 已于 2024 年底被 M4 取代,但在二手市场上仍很常见。本页面说明每种内存配置实际能支持哪些用途、已公布的测量结果对应多少 token/秒、如何将它配置为整个局域网都能访问的 Ollama 服务器,以及在什么情况下更新款的机型会成为更合适的选择。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: Mac mini M5 Pro(24 GB / 512 GB).
为什么选择它?我们的完整资料: Mac mini M5 Pro(24 GB / 512 GB) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#2026 年的 Mac mini M2 / M2 Pro:技术规格所承诺的表现
Apple 于 2023 年 1 月推出 Mac mini M2,称其配备“最高 24 GB 统一内存和 100 GB/s 带宽”;M2 Pro 则提供 200 GB/s 带宽,即前者的两倍,以及最高 32 GB 内存。Apple 的技术规格列出了标准配置和定制配置:M2 的基础配置为 8 GB,可在购买时选配 16 GB 或 24 GB;M2 Pro 的基础配置为 16 GB,可选配 32 GB。因此,没有 32 GB 的 M2,也没有 8 GB 的 M2 Pro。内存是焊接的:必须在购买时选定,之后无法更改。
- Mac mini M2
- 8 个 CPU 核心,10 个 GPU 核心,100 GB/s 带宽,支持 8、16 或 24 GB 统一内存。
- Mac mini M2 Pro
- 10 或 12 个 CPU 核心,16 或 19 个 GPU 核心,200 GB/s,16 或 32 GB。
- 散热
- 主动风扇散热:Apple 表示,其散热系统旨在维持持续的性能,这对一台全天响应请求的机器很重要。
- 功耗
- 根据 Apple 官方资料:空闲功耗为 7 W,M2 的最大功耗为 50 W,M2 Pro 的最大功耗为 100 W。有时看到的较低数值(10 至 30 W)是用户实测值,并不是功耗上限。
#M2 或 M2 Pro:选择取决于带宽
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
在文本生成过程中,每个token都需要将模型中所有激活权重从内存中重新读取,因此生成速度受限于带宽与模型大小的比值。一块100 GB/s的M2芯片搭配5 GB的模型,理论最大生成速度约为每秒20个token;而M2 Pro的带宽为200 GB/s,理论速度可翻倍。内存容量则决定了能容纳多少数据:一个24B模型在Q4量化下约需14 GB,若设备仅配备16 GB内存,则系统将无余量可用。
| 标准 | Mac mini M2 | Mac mini M2 Pro |
|---|---|---|
| 带宽 | 100 GB/s | 200 GB/s |
| 可选内存容量 | 8、16 或 24 GB | 16 或 32 GB |
| 更舒适的高负载使用场景 | 16 GB 内存:Q4 量化的 8–9B 模型;24 GB 内存:12–14B 模型 | 32 GB 内存下可运行 Q4 量化的 24B 至 32B 模型 |
| 多用户支持、RAG | 一到两名使用量较小的用户 | 多个短请求是可接受的 |
| 最大功耗(Apple) | 50 W | 100 W |
配备 24 GB 内存的 M2 是一种折中配置:内存容量足以容纳 14B 模型,但带宽仍是 M2 的水平。因此,它能加载比 16 GB M2 更大的模型,却不会让模型运行得更快。如果您需要较长的上下文窗口,或需要同时加载两个模型,可以选择它;否则,在运行相同模型时速度为其两倍的 16 GB M2 Pro,通常更适合交互式使用。
#不同内存容量适合什么模型:靠计算,不靠承诺
并非所有内容都能放入 GPU 内存。在 Apple Silicon 上,Metal 默认会限制 GPU 可使用的统一内存比例;根据 llama.cpp 仓库中的讨论,这一比例介于三分之二和四分之三之间。在一台内存为 16 GB 的机器上,模型及其上下文可用的内存约为 10 至 12 GB,其余留给 macOS。本站给出的 Q4 量化权重参考值为:8B ≈ 5 GB,14B ≈ 9 GB,32B ≈ 19–20 GB;上下文缓存还需要额外内存。
| 模型 (Q4) | 模型大小 | M2 8 GB | M2 16 GB | M2 24GB / M2 Pro 16GB | M2 Pro 32 GB |
|---|---|---|---|---|---|
| Qwen 3.5 4B | 2.3 GB | 是 | 是 | 是 | 是 |
| Granite 4.2 8B | 4.6 GB | 勉强够用 | 是 | 是 | 是 |
| Qwen 3.5 9B | 6 GB | 否 | 是 | 是 | 是 |
| Gemma 4 12B | 7 GB | 否 | 勉强够用 | 是 | 是 |
| Mistral Small 3.2 24B | 14 GB | 否 | 否 | 否(24 GB:非常吃紧) | 是 |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 否 | 否 | 否 | 可以,但剩余内存空间很小 |
表格解读:“勉强够用”表示模型权重能够装入内存,但长上下文与 macOS 会争夺剩余空间。任何认真使用的场景都应排除 8 GB 配置:macOS 和浏览器已经占用了一半内存。MoE 35B-A3B 是个特例:它占用 21 GB,但每个 token 只激活约 30 亿个参数,因此明显快于同等规模的稠密模型。这是选择 M2 Pro 32 GB 的最有力理由。
#实测吞吐量:已公开的来源能支持哪些结论
我们没有自行测得的数据,也不会提供此类数据。最有用的公开参考是 llama.cpp 仓库中的“Performance of llama.cpp on Apple Silicon M-series”讨论,其中用户发布了 Llama 7B 模型在各款 Apple 芯片上的文本生成(tg128)结果。这些数字来自当时版本的 llama.cpp,所用模型也比今天的模型更早,但仍能帮助判断大致的性能量级。
| 芯片 | 带宽 | Q4_0 | Q8_0 | F16 |
|---|---|---|---|---|
| M2,10 个 GPU 核心 | 100 GB/s | 21,91 t/s | 12,21 t/s | 6,72 t/s |
| M2 Pro,16个GPU核心 | 200 GB/s | 37,87 t/s | 22,70 t/s | 12,47 t/s |
| M2 Pro,19个GPU核心 | 200 GB/s | 38,86 t/s | 23,01 t/s | 13,06 t/s |
该表格证实了三点。首先,推理速度与模型权重大小相关:从Q4_0升级到Q8_0,吞吐量大约降低1.8倍。其次,M2 Pro的性能比M2快约1.7倍,略低于理论带宽的两倍。第三,M2 Pro拥有19个GPU核心,相较于M2的较少数目,对生成速度几乎无影响(38.86对比37.87 t/s):这些核心主要提升提示处理效率,而非生成效率。
#上下文与提示处理:真正的性能瓶颈
每秒生成的词元数并不能说明一切。两个指标会影响使用体验:提示词处理时间(同一组测量的 pp512 列:F16 下,M2 为 201 t/s,19 核 M2 Pro 为 384 t/s)以及上下文缓存的增长。在这一代的任何一款 Mac 上,输入一份包含 20 000 个词元的文档,都需要等待数十秒才会生成第一个词。进行 RAG 或文档分析时,请使用简短摘录,而不是粘贴整份 PDF。
上下文缓存也占用内存:窗口越长,留给模型权重的内存就越少。在 16 GB 内存的机器上,将窗口缩短至 8 000 或 16 000 个 token,可以为更大的模型腾出空间。上下文窗口指南详细说明了这一规则,KV 缓存指南则解释了如何对缓存进行量化。
#在 24/7 服务器上安装 Ollama:有效操作流程
Ollama 要求 macOS Sonoma(14)或更高版本,并默认监听 127.0.0.1:11434,即仅限本机访问。要使其在其他设备上可访问,必须修改监听地址。在 Mac 上,官方FAQ文档指出,当 Ollama 作为应用程序运行时,环境变量需通过 launchctl 设置,然后需要重新启动该应用程序。
- 01安装 Ollama 应用请从官方网站下载应用,或使用 Homebrew;macOS 安装指南详细说明了两种方式。请勿同时使用应用和 Homebrew 服务:它们会争夺同一端口。
- 02设置监听地址在终端中执行 launchctl setenv OLLAMA_HOST 0.0.0.0:11434,然后退出并重新启动 Ollama 应用程序。
- 03防止进入睡眠状态在“系统设置”的“节能”部分,启用屏幕关闭时防止自动休眠的选项;如果 Mac 需要自行重启,也请启用自动登录。
- 04预留固定 IP 地址在路由器中为Mac mini分配固定IP地址,或在局域网中使用其主机名mac-mini.local。
- 05预加载模型使用 ollama pull 下载模型,然后通过以下 curl 命令在另一台设备上进行测试。
#Mac mini 为全家提供的服务
Mac mini M2并非生产级服务器,但非常适合三种用途:家庭聊天、为您的工具提供兼容OpenAI的API接口,以及轻量级自动化。Ollama 支持在同一个端口上运行OpenAI API的部分功能,仅需更改地址即可连接大量现有客户端;请确认您所需的功能(工具调用、结构化输出)是否已覆盖。
- Chat
- Open WebUI 或兼容 Ollama 的移动应用:请在设置中填写地址 http://mac-mini.local:11434
- 代码
- 在 Continue、Aider 或 Zed 中,将 Ollama 服务器的 URL 填入模型服务提供方配置。
- 自动化
- n8n、Home Assistant 或 iOS 快捷指令:它们都能调用兼容 OpenAI 的 HTTP API。
- 文档索引
- 使用 nomic-embed-text 这样的轻量级嵌入模型,可以在 16 GB 内存中为一个拥有 80 亿至 90 亿参数的聊天模型留出空间。
有一个限制需要了解:Ollama 默认每个模型一次只处理一个请求(OLLAMA_NUM_PARALLEL 的值为 1)。因此,两个人同时提问时,会共享处理吞吐量,或等待轮到自己。对家庭而言,这已经足够;对于同时活跃人数超过三四人的团队,最好使用更强大的机器,或专为并行处理设计的推理服务器。
#Mac mini M2或更新机型:何时更换?
基础版 M4 的带宽提升至 120 GB/s(llama.cpp 表格中的数值),而据 Apple 公布的数据,M4 Pro 达到 273 GB/s;由于带宽是限制因素,基础版 M2 与 M4 的速度差距约为 20%,M2 Pro 与 M4 Pro 的差距则大得多。如果您计划运行 24 至 32B 的模型,二手 32 GB M2 Pro 仍是合适的选择;对于智能体任务或长上下文编程,配备更多内存的新一代芯片能让使用体验更舒适。
| 情况 | 建议 |
|---|---|
| 家庭聊天8-9B,预算有限 | 二手 16 GB 内存版 M2 就够用 |
| 24至32B模型或30-35B MoE模型 | M2 Pro 32GB,或更近期的配备32GB及以上内存的Mac |
| 长上下文、智能体、多用户 | 一台 Mac mini M4 Pro 或更高型号 |
| 需要64GB及以上内存 | 选择 Mac Studio,绝不要选 M2 Mac mini |
#常见问题
Mac mini M2 能否作为 LLM 服务器 24 小时不间断运行?+
如何选择二手Mac mini M2用于本地AI?+
Mac mini M2 每秒能处理多少 token?+
能否通过 iPhone 或另一台电脑使用 Mac mini M2?+
Mac mini M2 比 MacBook Air M2 更快吗?+
能否在 Mac mini M2 Pro 上对模型进行微调?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。