在 Mac Studio(M2 / M3 / M4 Ultra,64–512 GB)上运行哪些 LLM? ?
2026年,Mac Studio(M2 Ultra、M3 Ultra、M4 Max)是全球唯一一款面向大众市场的设备,能够本地运行超过2000亿参数的模型。M3 Ultra 512GB(2025年初发布,2026年9月底被M5 Ultra取代)将统一内存提升至512GB,价格约为11000欧元——足以支持 Llama 4台Maverick 402B在Q4或 DeepSeek V3 671B 在Q4。本指南详细说明了每种配置及其适用场景。
您正在挑选电脑吗? 按预算推荐 → · 我们的页面 Mac Studio M5 Max →
本指南的备选购买方案: Mac Studio M5 Max(36 GB / 512 GB).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: Mac Studio M5 Max(36 GB / 512 GB) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#2026 年 Mac Studio
- Mac Studio M2 Ultra (2023)
- 24 核 CPU + 60 或 76 核 GPU,800 GB/s 带宽,64/128/192 GB 内存。目前仍可在二手市场买到,起价 2800 欧元。
- Mac Studio M4 Max (2025)
- 16 个 CPU 核心 + 40 个 GPU 核心,546 GB/s,内存 36–128 GB。取代 M2 Max。Apple 已不再销售这款机型的新机:它于 2026 年 9 月底被 M5 Max 取代(起价 2 999 欧元)。
- Mac Studio M3 Ultra (2025)
- 28 个 CPU 核心 + 60 或 80 个 GPU 核心,800 GB/s 带宽,96/256/512 GB 内存。性能巨兽。在 M5 Ultra 推出之前,售价从 4499 欧元(96 GB)到 11 299 欧元(512 GB);截至 2026 年 9 月底,已不再列于 Apple 产品目录中(可购买二手或剩余库存)。
- 功耗
- 空闲时功耗为 15 W,推理时为 70–130 W,具体取决于配置。配备 512 GB 内存的 M3 Ultra 在运行 405B 模型时,峰值功耗约为 150 W。
#1. M2 Ultra 对比 M3 Ultra 对比 M4 Max
- M4 Max
- Mac Studio 的入门款。带宽为 546 GB/s,内存最大为 128 GB。优于 MacBook Pro M4 Max:不会降频,价格更低(台式机形态)。
- M2 Ultra
- 第一代 Ultra。800 GB/s,最高支持 192 GB。二手价格在 2800 至 4500 欧元之间。在 70B 至 123B 模型规模上仍具竞争力。
- M3 Ultra
- 最新的 Ultra(2025 年)。带宽为 800 GB/s,与 M2 Ultra 相同,但采用 M3 架构(实际性能提升 20%)。内存为 96 至 512 GB。适合希望运行超过 200B 规模模型的用户。
#2. RAM 能支持到什么程度?
- 96 GB(M3 Ultra 基础版)
- M3 Ultra 的目录价为 4499 欧元,现已不再销售新机(M5 Ultra 96 GB:6599 欧元)。运行 gpt-oss 120B(MXFP4,63 GB)时速度约为 50 token/秒,运行约 30B 的 MoE 模型(Qwen 3.6 35B-A3B)时约为 70 token/秒,并留有支持长上下文的余量。对于最高约 120B 的大型 MoE 模型,这是一个理想的平衡点。
- 256 GB(M3 Ultra + 256)
- M3 Ultra 的目录标价为 7299 欧元,现已不再销售全新机。可运行 Llama 4 Maverick 402B Q4(230 GB),速度约为 34 tokens/s,也可运行 DeepSeek V3 671B Q2(约 240 GB)。适合想运行 400B 及以上模型的用户。
- 512 GB(M3 Ultra最大值)
- M3 Ultra 目录价为 11,299 欧元,已不再以新品销售(M5 Ultra 512 GB:2026 年 10 月底)。DeepSeek V3 671B Q4(380 GB)可以运行,Qwen3-235B-A22B 以 Q8 量化运行,大型 MoE 模型支持 128k+ 上下文。属于研究/研发领域。
- 192 GB(M2 Ultra 最大值)
- 能加载 Qwen3-235B-A22B Q4(133 GB)和 Q3 量化的 Maverick 402B。功能上相当于配备 256 GB 内存的 M3 Ultra,购买二手时价格稍低。是个不错的折中选择。
#3. Ultra 专属模型
| 模型 | Quant | 所需 RAM | M2 Ultra 192 | M3 Ultra 256 | M3 Ultra 512 |
|---|---|---|---|---|---|
| gpt-oss 120B | MXFP4 | 63 GB | ✓ 42 t/s | ✓ 50 t/s | ✓ 50 t/s |
| Qwen3-235B-A22B | Q4_K_M | 133 GB | ✓ 26 t/s | ✓ 30 t/s | ✓ 30 t/s |
| Llama 4 Maverick 402B | Q4_K_M | 230 GB | — | ✓ 34 t/s | ✓ 34 t/s |
| Llama 4 Maverick 402B | Q8_0 | 410 GB | — | — | ✓ 22 t/s |
| DeepSeek V3 671B | Q2_K | 240 GB | — | ✓ 20 t/s | ✓ 20 t/s |
| DeepSeek V3 671B | Q4_K_M | 380 GB | — | — | ✓ 16 t/s |
#4. 120B、235B、671B 模型基准测试
| 模型 | Q4_K_M | Q5_K_M | Q6_K | Flash Attn 16k |
|---|---|---|---|---|
| gpt-oss 120B | 50 t/s | — | — | 48 t/s |
| Qwen3-235B-A22B | 30 t/s | 28 t/s | 26 t/s | 27 t/s |
| Llama 4 Maverick 402B | 34 t/s | 30 t/s | 28 t/s | 31 t/s |
| DeepSeek V3 671B | 16 t/s | 14 t/s | — | 15 t/s |
#5. 配置LLM工作站
#6. 在 M3 Ultra 512 GB 上运行 DeepSeek V3 671B
这是 512 GB Mac Studio 的代表性使用场景。模型在 Q4_K_M 量化下大小为 380 GB,可完整放入 512 GB 配置的内存中,在 16k 上下文下速度约为 16 token/s(MoE,总参数量为 671B,其中约 37B 为活跃参数)。在大多数任务上,质量接近最优秀的专有模型。
你已经知道 Mac Studio 适合运行哪些模型。Mac 套件提供了按芯片和内存容量划分的参考表(第 4 章)、长上下文下的内存预算计算方法(第 5 章),以及将 Ollama 配置为后台运行的步骤(第 7 章)。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
- 下载
- 通过 Hugging Face 约 380 GB。根据网络连接情况,预计需要 4-8 小时。
- 加载时间
- 首次加载约需 60 秒(SSD → RAM)。之后只要模型仍驻留在内存中,加载就几乎是瞬时的。
- 推理功耗
- 约 150 W。温度升至 70–75°C。风扇声音听得见,但并不吵闹(噪声远低于同等配置的 PC)。
- 何时值得使用
- 研发、希望使用 100% 离线前沿模型的团队、内部基准测试、敏感数据集。用于生产环境时,云端 API 更经济。
#Mac Studio 与 2× RTX 5090 PC 的对比
- 2026 年价格
- Mac Studio M3 Ultra 512 GB:截至 2026 年 9 月,目录价约为 11 300 欧元,目前已不再销售新机(M5 Ultra 512 GB 于 10 月底公布)。配备 2 张 RTX 5090 的 PC,加上平台:约 15 000 欧元。
- LLM的可用内存
- Mac:512 GB统一内存。PC:2 × 32 GB VRAM = 64 GB。对于400B以上的模型(Maverick 402B,DeepSeek 671B),PC根本无法加载模型。
- 运行约 30B 模型(Qwen 3.6 35B-A3B)时的速度
- 双 RTX 5090 PC:约 120 tok/s(CUDA,模型可完全装入显存)。Mac M3 Ultra:约 70 tok/s。对于能完全装入显存的模型,PC 更有优势。
- 在DeepSeek 671B / Maverick 402B上的运行速度
- Mac:16–34 token/秒(MoE)。PC:必须将大量模型计算卸载到 CPU 才能运行(< 2 token/秒)。
- 功耗
- Mac Studio:峰值 150 W。PC 2× 5090:最大 900 W。PC 侧电费需按 3 倍计算。
- 噪声
- Mac:噪音轻微。PC 配置 2× 5090:非常嘈杂(GPU 风扇全速运行)。
- 结论
- Mac Studio 在容量(可容纳 200B 以上的模型)和能效方面更有优势。对于能装入 VRAM 的模型(≤ 约 30 GB),PC 在纯速度方面更胜一筹。请根据您计划使用的模型类型选择。
#常见问题
适合 gpt-oss 120B 的 Mac Studio 型号是?+
Mac Studio M3 Ultra 512GB 值11000欧元吗?+
Mac Studio M3 Ultra 256GB或512GB?+
能把 Mac Studio 装进服务器机架吗?+
Mac Studio M4 Max 是否优于MBP M4 Max?+
一台Mac Studio在持续推理24/7模式下预计使用寿命是多少?+
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。