工具 · Apple Silicon M1 至 M6
我的设备上能运行哪些LLM Mac ?
请选择您的芯片和内存:工具会列出模型目录中能在该配置下运行的模型,并给出应使用的量化方式和预期速度。
您的Mac
正在加载目录……
您的 Mac 在不同内存容量下能运行哪些模型
统一内存由macOS和模型共享。默认情况下,GPU最多可使用约三分之二的内存,上限为32 GB;超过该值则可使用四分之三。建议:选择一个在Q4量化下支持8K上下文的最新且最大的模型。
| 内存 | 可用 | 建议(Q4) |
|---|---|---|
| 8 GB | ≈ 5.4 GB | LFM2.5 7B · 8 GB 排行榜 |
| 16 GB | ≈ 11 GB | Nemotron 3 Super 12B · 16 GB 机型模型排行榜 |
| 24 GB | ≈ 16 GB | Devstral Small 2 24B · 24 GB 排行榜 |
| 32 GB | ≈ 21 GB | Laguna XS.2 · 32 GB 排名 |
| 36 GB | ≈ 27 GB | Qwen 3.6 35B-A3B |
| 48 GB | ≈ 36 GB | Qwen 3.6 35B-A3B · 48 GB 排名 |
| 64 GB | ≈ 48 GB | Nemotron 3 Puzzle 75B-A9B · 64 GB排名 |
| 96 GB | ≈ 72 GB | Laguna S 2.1 · 96 GB 排行榜 |
| 128 GB | ≈ 96 GB | Mistral Medium 3.5 128B · 128 GB 模型排行榜 |
| 192 GB | ≈ 144 GB | MiniMax-M2.7 |
| 256 GB | ≈ 192 GB | GLM 5.3 Flash 320B-A18B |
| 512 GB | ≈ 384 GB | Nemotron 3 Ultra (BF16) |
速度取决于芯片
每生成一个词,Mac 都会重新读取内存中的整个模型,因此带宽决定了速度上限。在内存容量相同的情况下,Max 或 Ultra 芯片的运行速度是基础款芯片的数倍。
| 芯片 | 带宽 | 可选内存配置 |
|---|---|---|
| M1 | 68 GB/s | 8, 16 GB |
| M1 Pro | 200 GB/s | 16、32 GB |
| M1 Max | 400 GB/s | 32, 64 GB |
| M1 Ultra | 800 GB/s | 64, 128 GB |
| M2 | 100 GB/s | 8, 16, 24 GB |
| M2 Pro | 200 GB/s | 16、32 GB |
| M2 Max | 400 GB/s | 32, 64, 96 GB |
| M2 Ultra | 800 GB/s | 64, 128, 192 GB |
| M3 | 100 GB/s | 8, 16, 24 GB |
| M3 Pro | 150 GB/s | 18, 36 GB |
| M3 Max | 300至400 GB/s | 36, 48, 64, 96, 128 GB |
| M3 Ultra | 819 GB/s | 96, 256, 512 GB |
| M4 | 120 GB/s | 16、24、32 GB |
| M4 Pro | 273 GB/s | 24, 48, 64 GB |
| M4 Max | 410 至 546 GB/s | 36, 48, 64, 128 GB |
| M5 | 153 GB/s | 16、24、32 GB |
| M5 Pro | 307 GB/s | 24, 48, 64 GB |
| M5 Max | 460 至 614 GB/s | 36, 48, 64, 96, 128 GB |
| M5 Ultra | 1200 GB/s | 96, 256, 512 GB |
| M6 | 170 GB/s | 16、24、32 GB |
两个数值:GPU 核心较少(内存也较少)的版本带宽较低。来源:Apple 技术规格;M5 和 M6:我们的介绍页面 Mac Studio M5 et Mac mini M6.
常见问题
配备8GB内存的Mac能运行LLM吗?
是的,但仅适用于小型模型:模型可用内存约为 5 GB,这足以容纳 30 至 40 亿参数的 Q4 量化模型(Qwen 3 4B、Gemma 3 4B)。从 16 GB 开始,7-8B 模型会变得舒适。
GPU 可以使用统一内存的多大比例?
默认情况下,macOS 在 32 GB 及以下的 Mac 上为系统保留约三分之一的内存,在更大内存的 Mac 上保留四分之一。因此,24 GB 的 Mac 约为模型提供 16 GB,96 GB 的 Mac 约为模型提供 72 GB。sysctl iogpu.wired_limit_mb 命令可以提高此限制,同时为 macOS 保留足够的内存。
为什么两台内存容量相同的 Mac 运行速度不同?
因为生成速度主要取决于内存带宽:M4 为 120 GB/s,M4 Pro 为 273 GB/s,M4 Max 为 546 GB/s。每生成一个词,机器都要重新读取整个模型。因此,对于两款机器都能容纳的模型,M4 Max 的速度大约是 M4 的 4 倍。
在 Mac 上选择 MLX、Ollama 还是 LM Studio?
三者都能用。MLX 是 Apple 的框架,在 Apple Silicon 上通常速度最快;LM Studio 提供带图形界面的 MLX 支持;Ollama 则是命令行使用最简单的选择,并能与许多工具集成。