iMac M4(16 / 24 / 32 GB)适合运行哪种 LLM ?
iMac M4 可流畅运行采用 Q4 量化、参数量为 80 亿至 140 亿的模型:其 M4 芯片提供 120 GB/s 的内存带宽,一项公开测量显示,使用 10 核 GPU 运行 Q4_0 量化的 7B 模型时,速度为每秒 24 个 token。统一内存容量(16、24 或 32 GB)决定了可运行模型的最大规模:16 GB 可运行 14B 模型,24 GB 可运行速度较慢的 24B 模型,32 GB 可运行速度更慢的 30B 模型。
iMac 首先是一块显示屏;对于本地 AI 而言,关键在于 M4 芯片和之后无法更改的统一内存容量。本指南用具体数据说明每种配置能运行哪些模型、根据公开测量结果能达到怎样的速度,以及哪些情况下 Mac mini 更值得购买。
您正在挑选电脑吗? 按预算推荐 →
针对此配置: iMac M4 — 16 GB / 256 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#iMac M4 在本地 AI 方面能做什么
iMac M4能很好地运行80亿至140亿参数的模型,也能以较低速度运行更大的模型。三个数字概括了关键情况。根据Apple的规格说明,M4芯片提供120 GB/s的内存带宽,对Q4_0量化的7B模型而言,理论速度上限约为每秒31个token。llama.cpp仓库公布的测试结果显示,配备10核GPU的M4生成速度为每秒24.11个token,约为该上限的77%。最后,统一内存容量为16至32 GB,必须在购买时选定:它单独决定了能运行多大的模型。这台iMac缺少的是带宽,而不是容量。
- 芯片
- Apple M4;Apple 的规格表未列出配备 Pro 或 Max 芯片的 iMac 机型。
- 带宽
- 120 GB/s,无论配置如何。
- 统一内存
- 基础配置为 16 GB;所有版本均可选配 24 GB,配备 4 个端口的型号还可选配 32 GB。
- 屏幕
- 24 英寸 4.5K(4480 × 2520),因此配备更强大的 GPU 意义不大:瓶颈在于内存。
- 价格
- 此处未列出价格:Apple会调整价格;请参阅本网站的硬件页面。
#实际配置:两款机型,而不是三款
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
Apple 页面区分了两类模型。2端口模型配备8核CPU和8核GPU,内存为16GB,可扩展至24GB。4端口模型配备10核CPU和10核GPU,内存为16GB,可扩展至24GB或32GB。带宽均为120GB/s。一个常见错误,存在于该页面的旧版本中,是认为仍存在8GB配置:实际上基础内存为16GB。因此,若希望达到32GB,对于LLM而言,应选择4端口模型。
| 版本 | GPU | 统一内存 | 带宽 |
|---|---|---|---|
| 2个端口 | 8 个核心 | 16 GB,可选24 GB | 120 GB/s |
| 4个端口 | 10 核心 | 16 GB,可选 24 GB 和 32 GB | 120 GB/s |
对于文本生成,8 核与 10 核 GPU 的差异可能很小:速度取决于带宽,而两者的带宽相同。参考表中没有 8 核版本的公开测量数据,因此这一说法仍是假设。如果您拿不定主意,建议把钱花在增加内存上,而不是增加核心数上。
#16、24 或 32 GB:内存预算
在Mac上,系统和GPU共享内存,而macOS只允许GPU使用其中的一部分。iogpu.wired_limit_mb设置的默认值为0,这意味着内核会根据已安装的内存容量推算上限。在ModelPiper测量的一台32 GB Mac上,Metal允许GPU使用24.96 GiB,即总内存的78%。通常引用的比例是75%。因此,对于iMac,16 GB内存机型可供模型使用的内存约为11至12 GB,24 GB机型约为17至18 GB,32 GB机型约为24至25 GB:这些都是估算值,需要在您自己的机器上使用sysctl iogpu.wired_limit_mb命令和ModelPiper介绍的Metal工具进行验证。
| 配置 | GPU可用内存 | 合理范围内可运行的最大模型 |
|---|---|---|
| 16 GB | ≈ 11 至 12 GB | 14B模型,Q4(≈9 GB),中等上下文长度 |
| 24 GB | ≈17至18GB | Q4 量化的 24B 模型(约 14 GB),使用短上下文 |
| 32 GB | ≈ 24 至 25 GB | 一个30B模型在Q4下(约17至18 GB),中等上下文长度 |
要突破这些限制,可以提高分配给 GPU 的资源比例。关于 Mac Apple Silicon 优化的指南详细说明了该设置及其风险;此处不再重复。
#哪些模型适用于何种内存
以下 Q4 模型大小数据来自 QuelLLM 目录。这些数据以模型连同上下文都能装入上一张表中的可用内存为前提。“流畅度”一栏按 120 GB/s 的上限计算每个模型的表现:这些是计算得出的数量级估算,并非实测结果。
| 模型 | 模型大小 | 最小配置要求 | 在 M4 上的预期运行流畅度 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 16 GB | 流畅(约每秒15个token) |
| Gemma 4 12B | ≈ 7 GB | 16 GB | 尚可(约 13 tokens/秒) |
| Phi-4 14B | ≈ 9 GB | 16 GB | 尚可(约 10 token/秒) |
| gpt-oss 20B | ≈ 13 GB | 24 GB | 表现不一(MoE:速度比 20B 稠密模型更快) |
| Devstral Small 2 24B | ≈ 14 GB | 24 GB | 较慢(约每秒 6 到 7 个 token) |
| Gemma 4 31B | ≈ 18 GB | 32 GB | 非常慢(约每秒5个token) |
关键是不要混淆“装得下”和“用起来舒适”。在基础款 M4 上运行 24B 稠密模型,输出仍能跟得上阅读,但速度较慢,每秒只有几个词;而 gpt-oss 20B 或 Gemma 4 26B-A4B 这样的混合专家(MoE)模型,每生成一个 token 只读取数十亿个参数,因此速度超过规模相近的稠密模型。对于配备 24 GB 或 32 GB 内存的 iMac,MoE 模型往往是最佳选择。
在24 GB内存的配置上,经常需要权衡:选择Q8量化的12B模型(约13 GB),还是Q4量化的24B模型(约14 GB)。两者占用的内存几乎相同,因此生成速度也大致相同;根据带宽上限估算,约为每秒7个token。后者提供更强的推理能力,前者则更忠实于原始模型。在带宽相同的情况下,决定生成速率的是模型以GB计的大小,而不是参数数量。
#速度:带宽起决定作用
唯一公开的参考测量数据来自 llama.cpp 仓库中的 Apple Silicon 测试表,该表测试的是 Q4_0 量化的 LLaMA 7B。对于配备 10 核 GPU、内存带宽为 120 GB/s 的 M4,表中给出的提示词处理速度为 221.29 token/秒,生成速度为 24.11 token/秒。内存带宽为 273 GB/s、配备 16 核 GPU 的 M4 Pro,生成速度为 49.64 token/秒,是前者的两倍多一点。这个比值接近内存带宽之比(2.3 倍):这表明生成速度取决于内存,而非 GPU 核心数量。
| 芯片 | GPU | 带宽 | 生成速率 tg (t/s) |
|---|---|---|---|
| M4(iMac 4个端口) | 10 核心 | 120 GB/s | 24,11 |
| M4 Pro(Mac mini M4 Pro) | 16 核心 | 273 GB/s | 49,64 |
这些测量结果来自 llama.cpp 的早期版本;较新的版本和 MLX 可能表现更好。请将其视为数量级参考。本页旧版曾称,一个 Q5 量化的 9B 模型可达到每秒 28 至 31 个 token:对于这种大小的模型,这一数值会超过 120 GB/s 带宽所允许的速度上限,因此我们已将其删除。
#不同内存容量下的三种可行使用场景
结合具体使用场景,更容易理解内存预算。在每种情况下,将模型占用的内存、上下文缓存占用的内存以及其他已打开程序占用的内存相加,再将总量与上表中的可用内存进行比较。本站的计算器会为您完成这一步加法;您只需记住其中的逻辑。
| 用途 | 需要加载的内容 | 最小配置要求 |
|---|---|---|
| 办公助手:摘要、电子邮件、翻译 | 8B 或 12B 模型,Q4 量化,数千 token 上下文 | 16 GB |
| 在您的文档中检索(RAG) | 一个12B参数的生成模型、一个嵌入模型和一个重排序模型共同加载 | 24 GB,以留出余量 |
| 中等规模项目的编程辅助 | 24B(Devstral Small 2)或 20 至 26B 的 MoE 模型,支持长上下文 | 24 GB;如果上下文变长,则需 32 GB |
关于发热和噪音,我们没有找到 iMac M4 在持续 LLM 负载下的任何公开测量数据,因此不对其风扇作任何断言。唯一可靠的参考是实际使用情况:如果生成持续数小时,请在“活动监视器”中监测频率和温度,并将上下文大小控制在合理范围内。
#快速入门
- 01检查内存打开苹果菜单,选择「关于本机」,记下 iMac 的内存容量。内存容量决定了您可以运行哪些模型。
- 02安装 Ollama 或 LM StudioOllama通过Metal API加速Apple GPU的计算。LM Studio提供了适合大屏幕的图形化界面。
- 03加载合适的模型根据您的内存容量,从表中选择一个采用 Q4_K_M 量化的模型,并使用 ollama run 启动它。
- 04监控 GPU 使用情况使用 ollama ps 检查模型是否已加载到 GPU 上,然后使用“活动监视器”查看内存压力。
- 05限制上下文在配备 16GB 内存的机器上,将上下文长度控制在几千个 token,以避免系统使用交换空间(swap)。
#iMac M4 或 Mac mini M4:真正的关键因素
Mac mini M4 使用相同的芯片,带宽也相同;因此,在内存容量相同的情况下,iMac 并不会更慢。区别在于 iMac 的内置屏幕不可更换,而且没有 Pro 版本:iMac 的内存和带宽上限分别为 32 GB 和 120 GB/s,而根据同一篇参考讨论,Mac mini M4 Pro 的带宽可达 273 GB/s。如果您的目标是以较为理想的速度运行 24B 或更大的模型,Mac mini M4 Pro 的带宽可使吞吐量翻倍;如果是使用 8B 到 14B 模型的桌面助手,iMac 的表现则相当。
| 标准 | iMac M4 | Mac mini M4 / M4 Pro |
|---|---|---|
| 带宽 | 120 GB/s | 120 GB/s(M4);273 GB/s(M4 Pro) |
| 最大内存 | 32 GB | 查看 Mac mini 页面 |
| 屏幕 | 集成 24 英寸 4.5K 显示器 | 单独选择 |
| 7B Q4_0 模型的实测吞吐量 | 24,11 t/s | 24.11 t/s(M4);49.64 t/s(M4 Pro) |
| 可扩展性 | 无,内存不可更换 | 内存和可更换屏幕同样适用 |
- Mac mini M4 和 M4 Pro:根据内存选择何种LLM
- Mac mini M4 Pro 的硬件规格
- iMac 技术规格,Apple
- llama.cpp 在 Apple Silicon 上的性能,llama.cpp 仓库
- Ollama文档:GPU支持情况,包括Metal
- ModelPiper:Mac 上 GPU 内存的限制
#常见问题
iMac M4适合本地AI应用吗?+
在 iMac M4 上为 LLM 配置 16、24 或 32 GB 内存?+
在 iMac M4 上运行 LLM 的速度如何?+
为什么没有 iMac M4 Pro?+
iMac M4 8 核 GPU 足够运行一个 LLM 吗?+
Ollama 是否使用 iMac M4 的 GPU?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。