入门 11 分钟iMac

iMac M4(16 / 24 / 32 GB)适合运行哪种 LLM ?

直接回答

iMac M4 可流畅运行采用 Q4 量化、参数量为 80 亿至 140 亿的模型:其 M4 芯片提供 120 GB/s 的内存带宽,一项公开测量显示,使用 10 核 GPU 运行 Q4_0 量化的 7B 模型时,速度为每秒 24 个 token。统一内存容量(16、24 或 32 GB)决定了可运行模型的最大规模:16 GB 可运行 14B 模型,24 GB 可运行速度较慢的 24B 模型,32 GB 可运行速度更慢的 30B 模型。

iMac 首先是一块显示屏;对于本地 AI 而言,关键在于 M4 芯片和之后无法更改的统一内存容量。本指南用具体数据说明每种配置能运行哪些模型、根据公开测量结果能达到怎样的速度,以及哪些情况下 Mac mini 更值得购买。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 macOS 14+ 上测试
推荐硬件

针对此配置: iMac M4 — 16 GB / 256 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#iMac M4 在本地 AI 方面能做什么

iMac M4能很好地运行80亿至140亿参数的模型,也能以较低速度运行更大的模型。三个数字概括了关键情况。根据Apple的规格说明,M4芯片提供120 GB/s的内存带宽,对Q4_0量化的7B模型而言,理论速度上限约为每秒31个token。llama.cpp仓库公布的测试结果显示,配备10核GPU的M4生成速度为每秒24.11个token,约为该上限的77%。最后,统一内存容量为16至32 GB,必须在购买时选定:它单独决定了能运行多大的模型。这台iMac缺少的是带宽,而不是容量。

芯片
Apple M4;Apple 的规格表未列出配备 Pro 或 Max 芯片的 iMac 机型。
带宽
120 GB/s,无论配置如何。
统一内存
基础配置为 16 GB;所有版本均可选配 24 GB,配备 4 个端口的型号还可选配 32 GB。
屏幕
24 英寸 4.5K(4480 × 2520),因此配备更强大的 GPU 意义不大:瓶颈在于内存。
价格
此处未列出价格:Apple会调整价格;请参阅本网站的硬件页面。

#实际配置:两款机型,而不是三款

Mac 套装

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

Apple 页面区分了两类模型。2端口模型配备8核CPU和8核GPU,内存为16GB,可扩展至24GB。4端口模型配备10核CPU和10核GPU,内存为16GB,可扩展至24GB或32GB。带宽均为120GB/s。一个常见错误,存在于该页面的旧版本中,是认为仍存在8GB配置:实际上基础内存为16GB。因此,若希望达到32GB,对于LLM而言,应选择4端口模型。

适合运行大语言模型的 iMac M4 配置(Apple 规格表)
版本GPU统一内存带宽
2个端口8 个核心16 GB,可选24 GB120 GB/s
4个端口10 核心16 GB,可选 24 GB 和 32 GB120 GB/s

对于文本生成,8 核与 10 核 GPU 的差异可能很小:速度取决于带宽,而两者的带宽相同。参考表中没有 8 核版本的公开测量数据,因此这一说法仍是假设。如果您拿不定主意,建议把钱花在增加内存上,而不是增加核心数上。

#16、24 或 32 GB:内存预算

在Mac上,系统和GPU共享内存,而macOS只允许GPU使用其中的一部分。iogpu.wired_limit_mb设置的默认值为0,这意味着内核会根据已安装的内存容量推算上限。在ModelPiper测量的一台32 GB Mac上,Metal允许GPU使用24.96 GiB,即总内存的78%。通常引用的比例是75%。因此,对于iMac,16 GB内存机型可供模型使用的内存约为11至12 GB,24 GB机型约为17至18 GB,32 GB机型约为24至25 GB:这些都是估算值,需要在您自己的机器上使用sysctl iogpu.wired_limit_mb命令和ModelPiper介绍的Metal工具进行验证。

模型可用内存(估算为75%)
配置GPU可用内存合理范围内可运行的最大模型
16 GB≈ 11 至 12 GB14B模型,Q4(≈9 GB),中等上下文长度
24 GB≈17至18GBQ4 量化的 24B 模型(约 14 GB),使用短上下文
32 GB≈ 24 至 25 GB一个30B模型在Q4下(约17至18 GB),中等上下文长度

要突破这些限制,可以提高分配给 GPU 的资源比例。关于 Mac Apple Silicon 优化的指南详细说明了该设置及其风险;此处不再重复。

#哪些模型适用于何种内存

以下 Q4 模型大小数据来自 QuelLLM 目录。这些数据以模型连同上下文都能装入上一张表中的可用内存为前提。“流畅度”一栏按 120 GB/s 的上限计算每个模型的表现:这些是计算得出的数量级估算,并非实测结果。

不同内存配置对应的模型(Q4,仅计算权重)
模型模型大小最小配置要求在 M4 上的预期运行流畅度
Llama 3.1 8B≈ 6 GB16 GB流畅(约每秒15个token)
Gemma 4 12B≈ 7 GB16 GB尚可(约 13 tokens/秒)
Phi-4 14B≈ 9 GB16 GB尚可(约 10 token/秒)
gpt-oss 20B≈ 13 GB24 GB表现不一(MoE:速度比 20B 稠密模型更快)
Devstral Small 2 24B≈ 14 GB24 GB较慢(约每秒 6 到 7 个 token)
Gemma 4 31B≈ 18 GB32 GB非常慢(约每秒5个token)

关键是不要混淆“装得下”和“用起来舒适”。在基础款 M4 上运行 24B 稠密模型,输出仍能跟得上阅读,但速度较慢,每秒只有几个词;而 gpt-oss 20B 或 Gemma 4 26B-A4B 这样的混合专家(MoE)模型,每生成一个 token 只读取数十亿个参数,因此速度超过规模相近的稠密模型。对于配备 24 GB 或 32 GB 内存的 iMac,MoE 模型往往是最佳选择。

在24 GB内存的配置上,经常需要权衡:选择Q8量化的12B模型(约13 GB),还是Q4量化的24B模型(约14 GB)。两者占用的内存几乎相同,因此生成速度也大致相同;根据带宽上限估算,约为每秒7个token。后者提供更强的推理能力,前者则更忠实于原始模型。在带宽相同的情况下,决定生成速率的是模型以GB计的大小,而不是参数数量。

#速度:带宽起决定作用

唯一公开的参考测量数据来自 llama.cpp 仓库中的 Apple Silicon 测试表,该表测试的是 Q4_0 量化的 LLaMA 7B。对于配备 10 核 GPU、内存带宽为 120 GB/s 的 M4,表中给出的提示词处理速度为 221.29 token/秒,生成速度为 24.11 token/秒。内存带宽为 273 GB/s、配备 16 核 GPU 的 M4 Pro,生成速度为 49.64 token/秒,是前者的两倍多一点。这个比值接近内存带宽之比(2.3 倍):这表明生成速度取决于内存,而非 GPU 核心数量。

Apple Silicon 运行 LLaMA 7B Q4_0(llama.cpp 讨论)
芯片GPU带宽生成速率 tg (t/s)
M4(iMac 4个端口)10 核心120 GB/s24,11
M4 Pro(Mac mini M4 Pro)16 核心273 GB/s49,64

这些测量结果来自 llama.cpp 的早期版本;较新的版本和 MLX 可能表现更好。请将其视为数量级参考。本页旧版曾称,一个 Q5 量化的 9B 模型可达到每秒 28 至 31 个 token:对于这种大小的模型,这一数值会超过 120 GB/s 带宽所允许的速度上限,因此我们已将其删除。

#不同内存容量下的三种可行使用场景

结合具体使用场景,更容易理解内存预算。在每种情况下,将模型占用的内存、上下文缓存占用的内存以及其他已打开程序占用的内存相加,再将总量与上表中的可用内存进行比较。本站的计算器会为您完成这一步加法;您只需记住其中的逻辑。

典型应用场景及推荐配置
用途需要加载的内容最小配置要求
办公助手:摘要、电子邮件、翻译8B 或 12B 模型,Q4 量化,数千 token 上下文16 GB
在您的文档中检索(RAG)一个12B参数的生成模型、一个嵌入模型和一个重排序模型共同加载24 GB,以留出余量
中等规模项目的编程辅助24B(Devstral Small 2)或 20 至 26B 的 MoE 模型,支持长上下文24 GB;如果上下文变长,则需 32 GB

关于发热和噪音,我们没有找到 iMac M4 在持续 LLM 负载下的任何公开测量数据,因此不对其风扇作任何断言。唯一可靠的参考是实际使用情况:如果生成持续数小时,请在“活动监视器”中监测频率和温度,并将上下文大小控制在合理范围内。

#快速入门

  1. 01
    检查内存
    打开苹果菜单,选择「关于本机」,记下 iMac 的内存容量。内存容量决定了您可以运行哪些模型。
  2. 02
    安装 Ollama 或 LM Studio
    Ollama通过Metal API加速Apple GPU的计算。LM Studio提供了适合大屏幕的图形化界面。
  3. 03
    加载合适的模型
    根据您的内存容量,从表中选择一个采用 Q4_K_M 量化的模型,并使用 ollama run 启动它。
  4. 04
    监控 GPU 使用情况
    使用 ollama ps 检查模型是否已加载到 GPU 上,然后使用“活动监视器”查看内存压力。
  5. 05
    限制上下文
    在配备 16GB 内存的机器上,将上下文长度控制在几千个 token,以避免系统使用交换空间(swap)。
终端
ollama ps
sysctl iogpu.wired_limit_mb
sysctl hw.memsize

#iMac M4 或 Mac mini M4:真正的关键因素

Mac mini M4 使用相同的芯片,带宽也相同;因此,在内存容量相同的情况下,iMac 并不会更慢。区别在于 iMac 的内置屏幕不可更换,而且没有 Pro 版本:iMac 的内存和带宽上限分别为 32 GB 和 120 GB/s,而根据同一篇参考讨论,Mac mini M4 Pro 的带宽可达 273 GB/s。如果您的目标是以较为理想的速度运行 24B 或更大的模型,Mac mini M4 Pro 的带宽可使吞吐量翻倍;如果是使用 8B 到 14B 模型的桌面助手,iMac 的表现则相当。

iMac M4 或 Mac mini
标准iMac M4Mac mini M4 / M4 Pro
带宽120 GB/s120 GB/s(M4);273 GB/s(M4 Pro)
最大内存32 GB查看 Mac mini 页面
屏幕集成 24 英寸 4.5K 显示器单独选择
7B Q4_0 模型的实测吞吐量24,11 t/s24.11 t/s(M4);49.64 t/s(M4 Pro)
可扩展性无,内存不可更换内存和可更换屏幕同样适用
→
决定性的标准
如果您想要一台一体机,并运行一个 8B 至 14B 的助手模型,就选择 iMac。如果您打算运行 24B 或更大的模型,就选择 Mac mini M4 Pro;在这种情况下,其内存带宽能让吞吐量翻倍。价格会变化:请到本站的硬件页面核实。

#常见问题

FAQ
iMac M4适合本地AI应用吗?+
对于 80 亿至 140 亿参数的模型,答案是肯定的:M4 芯片提供 120 GB/s 的带宽,一项公开测量显示,7B 模型在 Q4_0 量化下可达到每秒 24 个 token。运行 24B 及以上模型时,速度会明显下降,原因是带宽不足,而非容量不足。
在 iMac M4 上为 LLM 配置 16、24 或 32 GB 内存?+
16 GB 足以运行 Q4 量化下的 8B 至 14B 模型,可用内存约为 11 至 12 GB。24 GB 可运行 20 至 24B 模型,32 GB 可运行 Q4 量化下的 30B 模型。由于内存购买后无法更换,请瞄准您计划使用的最大模型,而不是当前使用的模型。
在 iMac M4 上运行 LLM 的速度如何?+
在配备 10 核 GPU 的 M4 上,llama.cpp 的表格给出的 LLaMA 7B 在 Q4_0 量化下的生成速度为每秒 24.11 个 token。用内存带宽除以模型权重大小来计算,较新的 8B 模型在 Q4 量化下预计约为每秒 15 个 token,24B 稠密模型则约为每秒 6 至 7 个 token:这些估算仍需验证。
为什么没有 iMac M4 Pro?+
Apple 官网仅提供 iMac 配备 M4 芯片的版本,分别为 8 核和 10 核 GPU。若需更高带宽,需升级至 Mac mini M4 Pro(273 GB/s),其在参考表中性能快于前代两倍以上。
iMac M4 8 核 GPU 足够运行一个 LLM 吗?+
很可能够用:所有版本的内存带宽均为 120 GB/s,因此生成速度对 GPU 核心数量的依赖不大。llama.cpp 的测量表中没有 8 核版本的实测数据,所以这只是一个假设。选择时更应看内存容量:24 GB 是第一个真正实用的容量档位。
Ollama 是否使用 iMac M4 的 GPU?+
是的:Ollama 的文档说明,它通过 Metal API 利用 Apple GPU 加速计算。请使用 ollama ps 检查模型是否已加载到 GPU 上;如果接近您这套配置的容量上限,请在“活动监视器”中监控内存压力。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。