◆ Mac — 在你的 Mac 上充分利用本地 AI — 统一内存、MLX、适合你芯片的模型 · 24 欧元 · 或所有套装 49 欧元 →

工具 · Apple Silicon M1 至 M6

我的设备上能运行哪些LLM Mac ?

请选择您的芯片和内存:工具会列出模型目录中能在该配置下运行的模型,并给出应使用的量化方式和预期速度。

您的Mac

正在加载目录……

您的 Mac 在不同内存容量下能运行哪些模型

统一内存由macOS和模型共享。默认情况下,GPU最多可使用约三分之二的内存,上限为32 GB;超过该值则可使用四分之三。建议:选择一个在Q4量化下支持8K上下文的最新且最大的模型。

内存可用建议(Q4)
8 GB≈ 5.4 GBLFM2.5 7B · 8 GB 排行榜
16 GB≈ 11 GBNemotron 3 Super 12B · 16 GB 机型模型排行榜
24 GB≈ 16 GBDevstral Small 2 24B · 24 GB 排行榜
32 GB≈ 21 GBLaguna XS.2 · 32 GB 排名
36 GB≈ 27 GBQwen 3.6 35B-A3B
48 GB≈ 36 GBQwen 3.6 35B-A3B · 48 GB 排名
64 GB≈ 48 GBNemotron 3 Puzzle 75B-A9B · 64 GB排名
96 GB≈ 72 GBLaguna S 2.1 · 96 GB 排行榜
128 GB≈ 96 GBMistral Medium 3.5 128B · 128 GB 模型排行榜
192 GB≈ 144 GBMiniMax-M2.7
256 GB≈ 192 GBGLM 5.3 Flash 320B-A18B
512 GB≈ 384 GBNemotron 3 Ultra (BF16)

速度取决于芯片

每生成一个词,Mac 都会重新读取内存中的整个模型,因此带宽决定了速度上限。在内存容量相同的情况下,Max 或 Ultra 芯片的运行速度是基础款芯片的数倍。

芯片带宽可选内存配置
M168 GB/s8, 16 GB
M1 Pro200 GB/s16、32 GB
M1 Max400 GB/s32, 64 GB
M1 Ultra800 GB/s64, 128 GB
M2100 GB/s8, 16, 24 GB
M2 Pro200 GB/s16、32 GB
M2 Max400 GB/s32, 64, 96 GB
M2 Ultra800 GB/s64, 128, 192 GB
M3100 GB/s8, 16, 24 GB
M3 Pro150 GB/s18, 36 GB
M3 Max300至400 GB/s36, 48, 64, 96, 128 GB
M3 Ultra819 GB/s96, 256, 512 GB
M4120 GB/s16、24、32 GB
M4 Pro273 GB/s24, 48, 64 GB
M4 Max410 至 546 GB/s36, 48, 64, 128 GB
M5153 GB/s16、24、32 GB
M5 Pro307 GB/s24, 48, 64 GB
M5 Max460 至 614 GB/s36, 48, 64, 96, 128 GB
M5 Ultra1200 GB/s96, 256, 512 GB
M6170 GB/s16、24、32 GB

两个数值:GPU 核心较少(内存也较少)的版本带宽较低。来源:Apple 技术规格;M5 和 M6:我们的介绍页面 Mac Studio M5 et Mac mini M6.

常见问题

配备8GB内存的Mac能运行LLM吗?

是的,但仅适用于小型模型:模型可用内存约为 5 GB,这足以容纳 30 至 40 亿参数的 Q4 量化模型(Qwen 3 4B、Gemma 3 4B)。从 16 GB 开始,7-8B 模型会变得舒适。

GPU 可以使用统一内存的多大比例?

默认情况下,macOS 在 32 GB 及以下的 Mac 上为系统保留约三分之一的内存,在更大内存的 Mac 上保留四分之一。因此,24 GB 的 Mac 约为模型提供 16 GB,96 GB 的 Mac 约为模型提供 72 GB。sysctl iogpu.wired_limit_mb 命令可以提高此限制,同时为 macOS 保留足够的内存。

为什么两台内存容量相同的 Mac 运行速度不同?

因为生成速度主要取决于内存带宽:M4 为 120 GB/s,M4 Pro 为 273 GB/s,M4 Max 为 546 GB/s。每生成一个词,机器都要重新读取整个模型。因此,对于两款机器都能容纳的模型,M4 Max 的速度大约是 M4 的 4 倍。

在 Mac 上选择 MLX、Ollama 还是 LM Studio?

三者都能用。MLX 是 Apple 的框架,在 Apple Silicon 上通常速度最快;LM Studio 提供带图形界面的 MLX 支持;Ollama 则是命令行使用最简单的选择,并能与许多工具集成。

更多免费工具