首页 › 目录 › 2026 年 Mac Studio Ultra 最佳 LLM

2026 年 Mac Studio Ultra 最佳 LLM

◆ Mac — 在你的 Mac 上充分利用本地 AI — 统一内存、MLX、适合你芯片的模型 · 24 欧元 · 或所有套装 49 欧元 →

排名更新于 2026年9月22日

Mac Studio(M2 / M3 / M5 Ultra,统一内存最高为 512 GB,带宽为 800 GB/s 至 1.2 TB/s)是本地 AI 能力最强的消费级工作站。70B 模型采用 Q5 量化,200B 模型采用 Q4 量化,670B 前沿模型采用 Q3 量化。

本地 AI 的优惠和替代方案

Mac Studio :可选购的本地 AI 替代方案 — Mac Studio M5 Max(36 GB / 512 GB) (其他内存容量档位:Apple Store的BTO定制配置工具。):

迷你PC是一台完整机器:请检查所需内存和软件兼容性。它不能替代macOS/MLX或CUDA。

为什么这样选?查看我们对 Mac Studio M5 Max(36 GB / 512 GB)的完整介绍 →

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。

排名

1

🇺🇸 Laguna XS.2

Poolside · 33B 参数 · Apache 2.0 · 131 072 tokens ctx

MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。

排名原因 MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。
ollama run laguna-xs.2
在 Apple M2 Ultra 上(128 GB)
FP16
66 GB · 100 tok/s
2

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B 参数 · MIT · 128 000 tokens ctx

GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。

排名原因 GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
在 Apple M2 Ultra 上(128 GB)
FP16
62 GB · 100 tok/s
3

🇺🇸 Granite 4.0 H-Small 32B-A9B

IBM · 32B 参数 · Apache 2.0 · 128 000 tokens ctx

Mamba-2 混合架构 + MoE,总参数量 32B,激活参数量 9B。长上下文下 RAM 用量减少约 70%。Apache 2.0。

排名原因 Mamba-2 混合架构 + MoE,总参数量 32B,激活参数量 9B。长上下文下 RAM 用量减少约 70%。Apache 2.0。
ollama run granite4:small-h
在 Apple M2 Ultra 上(128 GB)
FP16
64 GB · 75 tok/s
4

🇨🇳 Qwen 3.6 35B-A3B

Alibaba · 35B 参数 · Apache 2.0 · 上下文长度:262 000 token

面向智能体编程的MoE模型,总参数35B,激活参数3B。SWE-Bench得分73.4%。2026年4月16日发布。

排名原因 面向智能体编程的MoE模型,总参数35B,激活参数3B。SWE-Bench得分73.4%。2026年4月16日发布。
ollama run qwen3.6:35b-a3b
在 Apple M2 Ultra 上(128 GB)
FP16
70 GB · 60 tok/s
5

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 131 072 tokens ctx

MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。

排名原因 MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。
ollama run qwen3:30b-a3b
在 Apple M2 Ultra 上(128 GB)
FP16
62 GB · 100 tok/s
6

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B 参数 · NVIDIA 开放模型许可证 · 128 000 tokens ctx

MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。

排名原因 MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
在 Apple M2 Ultra 上(128 GB)
FP16
60 GB · 80 tok/s
7

🇨🇳 Qwen3-Coder 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 262 144 tokens ctx

MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。

排名原因 MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。
ollama run qwen3-coder:30b
在 Apple M2 Ultra 上(128 GB)
FP16
61 GB · 100 tok/s
8

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 262 144 tokens ctx

视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。

排名原因 视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。
ollama run qwen3-vl:30b
在 Apple M2 Ultra 上(128 GB)
FP16
62 GB · 100 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 Apple M2 Ultra 上(128 GB)
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 tok/s · FP16
#2 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 tok/s · FP16
#3 Granite 4.0 H-Small 32B-A9B 32B 19 GB 128 000 Apache 2.0 75 tok/s · FP16
#4 Qwen 3.6 35B-A3B 35B 21 GB 262 000 Apache 2.0 60 tok/s · FP16
#5 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0 100 tok/s · FP16
#6 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA 开放模型许可证 80 tok/s · FP16
#7 Qwen3-Coder 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 tok/s · FP16
#8 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 tok/s · FP16
Mac 套装

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选条件:7–700B(允许前沿 MoE 模型)。30–200B 模型(Studio Ultra 峰值)及 MoE 模型总体上可获得较高加分:800 GB/s 以上的带宽能够充分发挥这些模型的性能。

考虑的标准:

  • 统一内存 64-512 GB
  • 带宽 800 GB/s 至 1.2 TB/s
  • 支持 MoE 和 frontier 模型
  • 稳定、强大的 LLM 服务器

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

Mac Studio M2 Ultra 192 GB:Llama 70B 流畅吗?

可以——Llama 3.3 70B 在 Q5_K_M 量化下(约 48 GB)运行速度约为 11 tok/s,在 Q4 量化下约为 14 tok/s(估算值:约为其 800 GB/s 内存带宽所决定的理论速度上限的 70%)。这是首款能够在本地流畅运行 70B 模型的 Apple 硬件。参见 Mac Studio使用指南.

Mac Studio Ultra 512 GB:DeepSeek 671B?

可以——DeepSeek R1 671B(370 亿活跃参数,MoE)采用 Q4_K_M 量化时约占 400 GB,可装入配备 512 GB 内存的 M3 Ultra 或 M5 Ultra,运行速度也足以实用,因为每生成一个 token 只需读取 370 亿个参数。其他任何台式机都无法做到。参见 DeepSeek R1 671B.

Mac Studio 与 4× H100 服务器相比?

4 张 H100(320 GB HBM3)的成本约为 120 000 欧元,另需 2 kW 的供电。一台配备 512 GB 内存的 Mac Studio Ultra 价格超过 10 000 欧元,功耗约为 200 W。H100 的吞吐速度约为 Studio 的 5–10 倍,但 Studio 在每 GB 内存的成本和静音方面更有优势。

在Studio Ultra上必须使用MLX吗?

推荐。MLX 更好地利用了统一内存,通常在大模型上比 llama.cpp 运行更快。Ollama(llama.cpp Metal)可以运行,但对硬件的利用稍显不足。

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €