高级 13 分钟Mac Studio

在 Mac Studio(M2 / M3 / M4 Ultra,64–512 GB)上运行哪些 LLM? ?

2026年,Mac Studio(M2 Ultra、M3 Ultra、M4 Max)是全球唯一一款面向大众市场的设备,能够本地运行超过2000亿参数的模型。M3 Ultra 512GB(2025年初发布,2026年9月底被M5 Ultra取代)将统一内存提升至512GB,价格约为11000欧元——足以支持 Llama 4台Maverick 402B在Q4或 DeepSeek V3 671B 在Q4。本指南详细说明了每种配置及其适用场景。

您正在挑选电脑吗? 按预算推荐 → · 我们的页面 Mac Studio M5 Max →

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 macOS 14+ 上测试
推荐硬件

本指南的备选购买方案: Mac Studio M5 Max(36 GB / 512 GB).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: Mac Studio M5 Max(36 GB / 512 GB) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#2026 年 Mac Studio

Mac Studio M2 Ultra (2023)
24 核 CPU + 60 或 76 核 GPU,800 GB/s 带宽,64/128/192 GB 内存。目前仍可在二手市场买到,起价 2800 欧元。
Mac Studio M4 Max (2025)
16 个 CPU 核心 + 40 个 GPU 核心,546 GB/s,内存 36–128 GB。取代 M2 Max。Apple 已不再销售这款机型的新机:它于 2026 年 9 月底被 M5 Max 取代(起价 2 999 欧元)。
Mac Studio M3 Ultra (2025)
28 个 CPU 核心 + 60 或 80 个 GPU 核心,800 GB/s 带宽,96/256/512 GB 内存。性能巨兽。在 M5 Ultra 推出之前,售价从 4499 欧元(96 GB)到 11 299 欧元(512 GB);截至 2026 年 9 月底,已不再列于 Apple 产品目录中(可购买二手或剩余库存)。
功耗
空闲时功耗为 15 W,推理时为 70–130 W,具体取决于配置。配备 512 GB 内存的 M3 Ultra 在运行 405B 模型时,峰值功耗约为 150 W。
→
内存容量才是真正的卖点
Mac Studio M3 Ultra 不仅是高性能电脑,更是唯一一款面向大众市场的设备,提供 512 GB 的 GPU 可访问 RAM。即使价格达到 20,000 欧元的 PC,也无一原生支持。对于希望本地运行 400B+ 模型的用户,目前没有其他替代方案。

#1. M2 Ultra 对比 M3 Ultra 对比 M4 Max

M4 Max
Mac Studio 的入门款。带宽为 546 GB/s,内存最大为 128 GB。优于 MacBook Pro M4 Max:不会降频,价格更低(台式机形态)。
M2 Ultra
第一代 Ultra。800 GB/s,最高支持 192 GB。二手价格在 2800 至 4500 欧元之间。在 70B 至 123B 模型规模上仍具竞争力。
M3 Ultra
最新的 Ultra(2025 年)。带宽为 800 GB/s,与 M2 Ultra 相同,但采用 M3 架构(实际性能提升 20%)。内存为 96 至 512 GB。适合希望运行超过 200B 规模模型的用户。
!
为什么 2026 年没有 M4 Ultra?
Apple 未推出 M4 Ultra。M4 系列最高为 Max。要获得 Ultra 版本,需选择 M3 Ultra(2025年3月),在 M5 Ultra 推出前,该型号于2026年9月底在 Apple 上发售,售价为6,599欧元。

#2. RAM 能支持到什么程度?

96 GB(M3 Ultra 基础版)
M3 Ultra 的目录价为 4499 欧元,现已不再销售新机(M5 Ultra 96 GB:6599 欧元)。运行 gpt-oss 120B(MXFP4,63 GB)时速度约为 50 token/秒,运行约 30B 的 MoE 模型(Qwen 3.6 35B-A3B)时约为 70 token/秒,并留有支持长上下文的余量。对于最高约 120B 的大型 MoE 模型,这是一个理想的平衡点。
256 GB(M3 Ultra + 256)
M3 Ultra 的目录标价为 7299 欧元,现已不再销售全新机。可运行 Llama 4 Maverick 402B Q4(230 GB),速度约为 34 tokens/s,也可运行 DeepSeek V3 671B Q2(约 240 GB)。适合想运行 400B 及以上模型的用户。
512 GB(M3 Ultra最大值)
M3 Ultra 目录价为 11,299 欧元,已不再以新品销售(M5 Ultra 512 GB:2026 年 10 月底)。DeepSeek V3 671B Q4(380 GB)可以运行,Qwen3-235B-A22B 以 Q8 量化运行,大型 MoE 模型支持 128k+ 上下文。属于研究/研发领域。
192 GB(M2 Ultra 最大值)
能加载 Qwen3-235B-A22B Q4(133 GB)和 Q3 量化的 Maverick 402B。功能上相当于配备 256 GB 内存的 M3 Ultra,购买二手时价格稍低。是个不错的折中选择。

#3. Ultra 专属模型

只有 Mac Studio Ultra 才能轻松加载的模型
模型Quant所需 RAMM2 Ultra 192M3 Ultra 256M3 Ultra 512
gpt-oss 120BMXFP463 GB✓ 42 t/s✓ 50 t/s✓ 50 t/s
Qwen3-235B-A22BQ4_K_M133 GB✓ 26 t/s✓ 30 t/s✓ 30 t/s
Llama 4 Maverick 402BQ4_K_M230 GB—✓ 34 t/s✓ 34 t/s
Llama 4 Maverick 402BQ8_0410 GB——✓ 22 t/s
DeepSeek V3 671BQ2_K240 GB—✓ 20 t/s✓ 20 t/s
DeepSeek V3 671BQ4_K_M380 GB——✓ 16 t/s

#4. 120B、235B、671B 模型基准测试

大致数值:Mac Studio M3 Ultra,80 核 GPU,512 GB 内存(llama.cpp Metal,上下文长度 16k)
模型Q4_K_MQ5_K_MQ6_KFlash Attn 16k
gpt-oss 120B50 t/s——48 t/s
Qwen3-235B-A22B30 t/s28 t/s26 t/s27 t/s
Llama 4 Maverick 402B34 t/s30 t/s28 t/s31 t/s
DeepSeek V3 671B16 t/s14 t/s—15 t/s

#5. 配置LLM工作站

Mac Studio M3 Ultra 512 GB 配置
# Ollama + optimisations max
brew install --cask ollama

launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
launchctl setenv OLLAMA_NUM_PARALLEL 4
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Relever mémoire GPU à 480 Go (sur 512 Go)
sudo sysctl iogpu.wired_limit_mb=491520
echo "iogpu.wired_limit_mb=491520" | sudo tee -a /etc/sysctl.conf

brew services start ollama

# Pour DeepSeek V3 671B : passer par llama.cpp maison
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# Lancement
./build/bin/llama-server \
  -m ./models/DeepSeek-V3-671B-Q4_K_M.gguf \
  -ngl 99 -fa -c 16384 \
  -ctk q8_0 -ctv q8_0 \
  --host 0.0.0.0 --port 8080

#6. 在 M3 Ultra 512 GB 上运行 DeepSeek V3 671B

这是 512 GB Mac Studio 的代表性使用场景。模型在 Q4_K_M 量化下大小为 380 GB,可完整放入 512 GB 配置的内存中,在 16k 上下文下速度约为 16 token/s(MoE,总参数量为 671B,其中约 37B 为活跃参数)。在大多数任务上,质量接近最优秀的专有模型。

Mac 套装

你已经知道 Mac Studio 适合运行哪些模型。Mac 套件提供了按芯片和内存容量划分的参考表(第 4 章)、长上下文下的内存预算计算方法(第 5 章),以及将 Ollama 配置为后台运行的步骤(第 7 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
下载
通过 Hugging Face 约 380 GB。根据网络连接情况,预计需要 4-8 小时。
加载时间
首次加载约需 60 秒(SSD → RAM)。之后只要模型仍驻留在内存中,加载就几乎是瞬时的。
推理功耗
约 150 W。温度升至 70–75°C。风扇声音听得见,但并不吵闹(噪声远低于同等配置的 PC)。
何时值得使用
研发、希望使用 100% 离线前沿模型的团队、内部基准测试、敏感数据集。用于生产环境时,云端 API 更经济。

#Mac Studio 与 2× RTX 5090 PC 的对比

2026 年价格
Mac Studio M3 Ultra 512 GB:截至 2026 年 9 月,目录价约为 11 300 欧元,目前已不再销售新机(M5 Ultra 512 GB 于 10 月底公布)。配备 2 张 RTX 5090 的 PC,加上平台:约 15 000 欧元。
LLM的可用内存
Mac:512 GB统一内存。PC:2 × 32 GB VRAM = 64 GB。对于400B以上的模型(Maverick 402B,DeepSeek 671B),PC根本无法加载模型。
运行约 30B 模型(Qwen 3.6 35B-A3B)时的速度
双 RTX 5090 PC:约 120 tok/s(CUDA,模型可完全装入显存)。Mac M3 Ultra:约 70 tok/s。对于能完全装入显存的模型,PC 更有优势。
在DeepSeek 671B / Maverick 402B上的运行速度
Mac:16–34 token/秒(MoE)。PC:必须将大量模型计算卸载到 CPU 才能运行(< 2 token/秒)。
功耗
Mac Studio:峰值 150 W。PC 2× 5090:最大 900 W。PC 侧电费需按 3 倍计算。
噪声
Mac:噪音轻微。PC 配置 2× 5090:非常嘈杂(GPU 风扇全速运行)。
结论
Mac Studio 在容量(可容纳 200B 以上的模型)和能效方面更有优势。对于能装入 VRAM 的模型(≤ 约 30 GB),PC 在纯速度方面更胜一筹。请根据您计划使用的模型类型选择。

#常见问题

适合 gpt-oss 120B 的 Mac Studio 型号是?+
该模型采用 MXFP4 格式时大小为 63 GB:至少需要配备 96 GB 内存的 Mac Studio,可选二手的 M3 Ultra 96 GB 机型,或全新的 M5 Max 96 GB、M5 Ultra 96 GB(6 599 欧元)机型——M2 Ultra 64 GB 无法为上下文留出足够的内存余量。M3 Ultra 的速度预计约为 50 tok/s,同时还有空间容纳 128k 的长上下文。
Mac Studio M3 Ultra 512GB 值11000欧元吗?+
对于研究人员、研发团队,或处理不应发送到云端的敏感数据的企业:绝对值得。没有任何竞争对手能以这个价格在本地运行 Llama 4 Maverick 402B 或 DeepSeek 671B。对于个人用户,这可能配置过高——一台配备 128 GB 内存的 Mac Studio(二手 M4 Max 或全新 M5 Max)就足以满足 95% 的使用需求。
Mac Studio M3 Ultra 256GB或512GB?+
按 M3 Ultra 的目录价格计算(该机型已不再销售新机):如果您的最高目标是 Llama 4 Maverick 402B Q4(230 GB)或 DeepSeek V3 Q2,选择 256 GB(7299 欧元)。如果您想运行 Maverick Q8 或 DeepSeek V3 Q4(380 GB),选择 512 GB(11299 欧元)。只有当您确实要运行参数规模超过 400B 的模型时,这 4000 欧元的差价才值得。
能把 Mac Studio 装进服务器机架吗?+
是的,有可容纳 2 至 4 台 Mac mini/Studio 的 19 英寸机架方案。品牌包括 Sonnet、MacStadium。如果您为团队托管 LLM 集群,这类方案很实用。
Mac Studio M4 Max 是否优于MBP M4 Max?+
相同芯片,相同性能。Mac Studio 在价格上占优(无需支付屏幕、键盘或电池费用),且完全无降频——支持 24/7 持续推理。MBP 在便携性上占优。对于固定使用场景,毫不犹豫选择 Studio。
一台Mac Studio在持续推理24/7模式下预计使用寿命是多少?+
Apple(苹果)未公布官方数据,但社区反馈显示,设备在持续推理下可运行 5-8 年而不出现硬件问题。最易出问题的部件是 SSD(写入耐久性),但 LLM 模型主要被读取,很少被写入,因此 SSD 的磨损极小。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。