MacBook Pro M5 Max 128 GB:本地 AI 的实测数据(基准测试 2026)
一台配备 40 个 GPU 核心和 128 GB 统一内存的 MacBook Pro M5 Max、一份预先撰写的协议、六个模型、一份包含 16 689 个 token 的文档:这是关于本地 AI 领域最大型便携设备 Apple 的首批公开测量结果。测量由网络安全与 GRC 顾问 Joël Ramat 根据我们的要求,使用他自己的设备并按照我们的协议完成。所有数字均为 Ollama 的原始输出,未经修改。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#设备与测试方法
这台机器是一台 16 英寸 MacBook Pro,搭载满配版 M5 Max 芯片:18 个 CPU 核心、40 个 GPU 核心,以及 128 GB 统一内存,标称内存带宽为 614 GB/s。它运行 macOS 27.0 和 Ollama 0.34.1。未修改任何系统参数:GPU 内存上限采用默认值,这一点在与您自己的 Mac 比较时很重要。
这套测试规程只有四条规则,而且每条都必须落实。Mac 要接通电源,因为 macOS 在电池供电时会限制芯片性能。关闭资源占用较大的应用。一次只加载一个模型。最重要的是,所有测试系列都使用相同的提示词,这样各模型之间的数据才能比较,将来也能比较不同机器的数据。
- A 系列:两个参照
- GGUF 格式的 Gemma 4 12B 和 Qwen 3.8 27B,这两个模型也能在配置低得多的 Mac 上运行。它们可以作为熟悉的参照,帮助判断这台机器的性能水平。
- B 组测试:MLX 与 GGUF 对比
- 同一个 Qwen 3.8 27B,使用相同的权重,由 Ollama 的 MLX 引擎提供服务,而非 llama.cpp。只有引擎发生变化。
- C 系列:128 GB 档位的真正重点
- gpt-oss 120B,65 GB,这是一个根本无法装进 PC 笔记本电脑内存的模型。
- D系列,实际负载下的预填充
- 将一份含有 16,689 个 token 的文档一次性发送给 gpt-oss 120B,并附上总结指令。这是本轮测试中唯一一项有意义的预填充测量记录。
- 测试方案之外的两项额外测试
- Joël 的机器上原本就有 MLX 格式的 Qwen 3.6 35B-A3B 和 gpt-oss 20B。他在相同条件下测试了这两个模型。
#所有数值汇总成一个表格
在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
以下是 ollama run --verbose 命令的原始输出,保留了 Joël 每次测量后复制的原样。每个模型都对 300 词的提示生成了完整回答;支持推理模式的模型使用了该模式,因此最终文本虽然只有 300 词,生成的 token 数却达到 1,400 至 3,200。
| 模型 | 引擎 | 模型大小 | 生成 | 生成的标记数 | 总时长 |
|---|---|---|---|---|---|
| Gemma 4 12B | GGUF Q4 | 7.6 GB | 58.1 tok/s | 1 390 | 24 s |
| Qwen 3.8 27B | GGUF Q4 | 17 GB | 36.6 个 token/秒 | 2 517 | 69 s |
| Qwen 3.8 27B | MLX | 18 GB | 68.0 个token/秒 | 2 103 | 31 s |
| Qwen 3.6 35B-A3B(额外测试) | MLX | 23 GB | 167.2 tok/s | 3 205 | 19 s |
| gpt-oss 20B(额外测试) | MXFP4 | 13 GB | 113.4 个 token/秒 | 2 199 | 19 s |
| gpt-oss 120B | MXFP4 | 65 GB | 79.1 tok/s | 669 | 8,5 s |
| gpt-oss 120B,第 1 次重新运行 | MXFP4 | 65 GB | 77.5 个 token/秒 | 732 | 12,5 s |
| gpt-oss 120B,第 2 次运行 | MXFP4 | 65 GB | 75.5 个标记/秒 | 1 707 | 22,7 s |
| gpt-oss 120B,D 系列 | MXFP4 | 65 GB | 67.6 tok/s | 2 584 | 50 s |
| 系列 | 提示词 token 数 | 预填充 | 输出第一个词之前的等待时间 |
|---|---|---|---|
| A、B、C(短提示) | 43 à 98 | 每秒 31 到 346 个 token | 0.1至0.9秒:启动延迟,而非吞吐量 |
| D,包含16,689个标记的文档 | 16 689 | 1 388 tok/s | 12,0 s |
#生成:六个模型,一次读取
如果只看表面,这个排名显得荒谬:一个拥有1200亿参数的模型,每秒生成79个token,速度竟是GGUF格式27B模型的两倍。答案就在三个字母中:MoE。gpt-oss 120B、gpt-oss 20B和Qwen 3.6 35B-A3B都是混合专家模型。生成每个token时,只会调用一部分参数:gpt-oss 120B约为50亿,gpt-oss 20B约为36亿,Qwen约为30亿。生成速度取决于每个token所需的内存数据传输,而不是那些只是驻留在内存中、未被调用的参数。
稠密模型 Gemma 4 12B 和 Qwen 3.8 27B 在生成每个 token 时都会使用全部参数。因此,它们的速度取决于内存带宽除以模型大小:这是 Mac 自 M1 以来一直遵循的规律,M5 Max 也不例外。在这台机器上,GGUF 格式的 27B 稠密模型运行速度为每秒 37 个 token,12B 模型则为每秒 58 个 token。
- 使用 MLX 运行 Qwen 3.6 35B-A3B,速度达到 167 tok/s
- 这是本轮测试中的最高数值,来自同时结合两种加速手段的模型:MoE 架构和 MLX 引擎。它拥有小型 8B 模型的速度,以及 35B 模型的知识储备。
- gpt-oss 20B:113 token/s
- 日常助理使用场景下,速度、质量与体积的最佳平衡:13 GB,2200个token响应时间仅19秒。
- 在 gpt-oss 120B 上的吞吐率为 79 tok/s
- 这是列表中能力最强的模型,速度是人类阅读速度的两倍。这一结果说明了选择 128 GB 配置的价值,下文会再次讨论。
- 稠密模型的速度为 58 和 37 tok/s
- 运行 GGUF 格式的 Gemma 4 12B 和 Qwen 3.8 27B 很轻松,但表现并不出人意料。其性能与 M4 Max 处于同一数量级,因为两代之间的内存带宽变化不大。
#同等条件下的 MLX 与 GGUF 对比
所有人都声称MLX,即Apple为Apple Silicon优化的库,比llama.cpp更快。很少有人会在严格相同的条件下,使用相同的模型,在同一天、同一台机器上进行测量。B系列测试做到了这一点:Qwen 3.8 27B使用GGUF Q4时,速度为每秒36.6个token;随后使用MLX运行Qwen 3.8 27B,速度为每秒68.0个token。提升了86%。
我们关于 MLX 和 Mac M5 的指南曾宣称生成效率可提升 30% 至 40%。在 M5 Max 上运行该模型时,实际提升超过一倍。部分差距可能源于 MLX 为 M5 生成环境定制的优化以及 GPU 内置的神经加速器;我们目前尚无法单独量化它们的贡献。可以确定的是,在一台较新的 Mac 上,当存在 MLX 版本时,仍使用 GGUF 密集模型,相当于将一半的硬件闲置在角落。
#128GB实际能带来什么?

128 GB 这一档真正值得关注的不是速度,而是能装下哪些模型。gpt-oss 120B 在 MXFP4 格式下占用 65 GB。没有任何 PC 笔记本能在 GPU 上运行它:移动显卡的显存上限为 16 或 24 GB。在配备 128 GB 内存的 M5 Max 上,它可以加载,三次运行中的生成速度为每秒 75 至 79 个 token,而且仍有剩余空间。
活动前的内存占用情况一目了然:macOS 和工作会话中的应用占用了 35 GB,剩余 93 GB 可供 AI 使用。120B 模型安装后仍留有约三十 GB 的余量,足以支持长上下文以及并行运行一个轻量级模型,例如用于代码自动补全的 8B 模型。在配备 64 GB 内存的 M5 Max 上,同一模型完全无法加载;在 96 GB 内存上可以加载,但几乎没有余量留给其他任务。
- 8.5 至 22.7 秒
- 在 300 字提示下,gpt-oss 120B 三次运行的总响应时长分别为 669、732 和 1707 个 token,速度保持不变(79.1、77.5 和 75.5 个 token/秒),变化的是推理长度,模型在不同运行中选择是否逐字计数。
- 50秒
- D系列的持续时间:阅读一个包含16,689个token的文档,然后撰写一份包含2,584个token的十点摘要。
- 热压力状态为“Nominal”
- 每组测试后记录一次。整个测试过程中,包括测试 120B 模型时,都听不到风扇声。
#预填充,没人公开的数值
一个只有二十个词的提示词说明不了预填充(prefill)的性能。为了测量这项性能,Joël 将一篇 11 280 个词的文本一次性发送给 gpt-oss 120B,合计 16 689 个 token,约 45 页,并要求模型进行总结。结果:读取速度为每秒 1 388 个 token,也就是等待十二秒后,回答的第一个词才出现;随后以每秒 67.6 个 token 的速度生成了包含 2 584 个 token 的总结。
这是关乎严肃用途的关键数字。分析合同、总结审计报告、通过 RAG 查询文档库:在所有这些情况下,模型大部分时间都在阅读,而非写作。在笔记本电脑上,45 页文档仅需十二秒,且没有任何字节离开机器,这使得本地 AI 对于受职业保密约束的顾问或受保密限制的企业而言变得可用。
#发热与风扇
Joël 在每组测试后都使用 macOS 的热压力查询命令记录了热状态。结果始终为“Nominal”,而且听不到风扇声,即使在 GPU 持续满载五十秒的 D 组测试期间也是如此。这与我们在 M4 Max 上观察到的情况一致,但有一点需要保留:我们的测量都基于不足一分钟的短时负载。测试方案中计划的降频测试——持续负载十分钟后,再重新测量 A 组——尚未进行。我们会在下一轮测试中要求进行这项测试。
#这些测量结果无法说明的内容
一份诚实的基准测试应列出其未证明的内容。以下是按重要性排序的注意事项。
- 短提示词的预填充
- 每个模型测试两次,保留第二次的结果。但长度为 43 至 98 个 token 的提示词只能测出启动延迟:只有使用 16,689 个 token 的 D 系列测试,才能测得真正的提示词读取吞吐量。
- 没有700亿参数的密集模型
- 选择 128 GB 内存配置,也可以是为了运行采用 Q4 量化、使用长上下文的 70B 模型。这里没有进行这方面的测量。
- 未进行降频测试
- 这些短时负载均持续不到一分钟。连续一小时高强度运行 RAG 时的表现仍有待记录。
- 未测量电池供电时的性能
- 测试方案要求接通电源。使用电池供电时,预计测得的数值会明显更低,因为 macOS 会限制芯片性能。
- 每位测试者使用各自的 D 系列测试文档
- 测试规程并未规定 D 系列测试中提交的长文本:两位测试者读取的不是同一份文档,因此限制了不同机器之间预填充性能的比较。根据 Joël 的建议,测试规程现在提供一份统一的参考文本,共 11 292 个词,可在下一节下载:今后的测量结果将可以相互比较。本页的测量是在此之前完成的,使用的是另一份长度相当的文档。
- 一台设备,一个操作员
- 未测量任何方差。如果您的配置相同,欢迎提供您的数据,详见下一部分。
- 处于推理模式的模型
- 能够先思考再作答的模型生成的token数量远超所要求的300词,且同一模型在不同运行中的token数量会有所变化(在gpt-oss 120B上为669至1707个token)。因此,总耗时无法直接比较,仅速度可以对比。
- 重复运行提示词时的提示词缓存
- 再次提交相同提示词时,Ollama 会复用已经处理过的 token(“prompt eval cached”)。因此,重复提交完全相同的提示词所得的预填充结果不能作为有效测量;要测量预填充,需要使用较长且全新的提示词,就像 D 系列测试中那样。
#在本地复现基准测试

这套测试流程可以原样用于任何 Apple Silicon Mac,从 MacBook Air 到 Mac Studio 都适用。如果您使用相同的提示词完成相同的测试系列,测得的数据就可以直接与本页的数据比较。
- 01准备机器接通电源,关闭浏览器、Docker 和虚拟机。记录您的芯片型号、GPU 核心数量以及 Ollama 的版本。
- 02记录系统状态记录芯片型号、GPU 核心数、macOS 和 Ollama 的版本、供电情况、可用内存以及已打开的应用程序。Joël 编写了一个 zsh 脚本,只需一条命令就能生成这份报告;核验后,将在获得他授权的情况下把该脚本加入 Mac 套件的基准测试章节。
- 03A 组测试下载 gemma4:12b 和 qwen3.8:27b 模型,分别使用 --verbose 参数启动,粘贴同一提示词,等待回答完整输出,然后输入 /bye 退出。运行两轮,保留第二轮的结果。
- 04B系列对 qwen3.8:27b-mlx 执行相同的操作。将 eval rate 这一行与 A 组测试中的对应行进行比较。
- 05C 系列如果您有 96 GB 或更多统一内存:选择 gpt-oss:120b。否则,选择能装入可用统一内存(总量减去 10 GB)的最大模型。
- 06D 系列下载 QuelLLM 的参考文本,共 11 292 个词,所有人使用同一份文本,然后将其传给 ollama run,并附上指令“将这段文本总结为 10 条要点”。记录显示的提示 token 数:它取决于模型,而不是文本。
#适合谁,价格是多少
选择 M5 Max 128 GB 的理由只有一个:在本地运行其他任何笔记本都容纳不下的模型,同时为上下文和第二个模型留出余量。gpt-oss 120B 每秒生成 79 个 token,十二秒读完一份 45 页的文档,无需风扇运转——这就是一台能装进包里的 AI 工作站。
| 您是 | 这项基准测试能告诉您什么 | 推荐档位 |
|---|---|---|
| 负有职业保密义务的顾问、律师、注册会计师 | 120B 模型能在本地读取并综合整理您的资料,速度足以满足实际使用,且不会向外部发送任何内容。 | M5 Max 128 GB |
| 希望拥有可靠本地编程助手的开发者 | gpt-oss 20B 或 Qwen 3.6 35B-A3B 都绰绰有余,且能装入 48 GB 内存。我们测得的 113 和 167 tok/s 适用于配备 40 核 GPU 的芯片:内存容量足够,但带宽较低的版本速度会更慢 | M5 Max 48 或 64 GB |
| 每天使用写作助手的用户 | 一个 12B 稠密模型或 20B MoE 模型就足以满足使用需求;128 GB 内存属于奢侈配置。内存容量足够,但 M5 Pro 的内存速度更慢:预计速度会低于我们测得的 58 和 113 tok/s | M5 Pro 48 GB |
| 希望共享服务器的团队 | Mac Studio M5 Max 或 Ultra 提供相同的引擎,配备更多内存和台式机级散热系统 | Mac Studio |
如果您的需求最多只涉及 300 亿参数的模型,一半的内存就足够,省下的差价可以买一台很好的显示器。如果您的需求从 1000 亿参数的模型起步,就没有其他便携式替代方案,而本指南提供的数据可以帮助您向负责签署采购订单的人说明购买理由。
#致谢与来源

本页面的测量由乔尔·拉马特(Joël Ramat)完成。他是网络安全与 GRC(治理、风险和合规)顾问、ISO 27001 专家,提供借助本地部署 AI 增强的咨询与审计服务,也是 Sywédgia SAS 的联合创始人兼总裁。他于 2026 年 9 月 16 日在自己的机器上执行了 QuelLLM 测试方案,并在本文发布前审阅了文章。测量记录仍归他所有,他可以自行发布这些记录。
- Joël Ramat 的 LinkedIn 主页
- Sywédgia,网络安全咨询与审计
- 我们的 Mac M5 上 MLX 与 llama.cpp 对比指南
- MacBook Pro M5 Max 硬件规格表
- 使用 Ollama 安装 gpt-oss
方法:每次测量后复制 ollama run --verbose 的原始输出,不作修改;整轮测试开始前通过脚本记录系统状态;每组测试结束后读取热压力状态。包含模型完整回答的完整报告已保存,可应要求提供。撰写与排版:Mohamed Meguedmi,哪个LLM。
#FAQ
M5 Max 128 GB 是否比 M4 Max 128 GB 在本地 AI 任务上更快?+
为什么gpt-oss 120B比Qwen 3.8 27B运行更快?+
运行 gpt-oss 120B 需要 128 GB 内存吗?+
这些数值在电池供电下有效吗?+
为什么不公布 A、B、C 系列的预填充测试结果?+
我可以提交自己测得的结果吗?+
在哪里可以找到本次基准测试使用的准备脚本?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。