进阶 14 分钟Apple

MacBook Pro M5 Max 128 GB:本地 AI 的实测数据(基准测试 2026)

一台配备 40 个 GPU 核心和 128 GB 统一内存的 MacBook Pro M5 Max、一份预先撰写的协议、六个模型、一份包含 16 689 个 token 的文档:这是关于本地 AI 领域最大型便携设备 Apple 的首批公开测量结果。测量由网络安全与 GRC 顾问 Joël Ramat 根据我们的要求,使用他自己的设备并按照我们的协议完成。所有数字均为 Ollama 的原始输出,未经修改。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-16·已在 macOS 14+ 上测试
推荐硬件

本指南的备选购买方案: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 € →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

一台打开的 MacBook Pro 放在深色书桌上,终端显示正在生成文本
示意图。测试机器是一台配备 M5 Max 和 128 GB 内存的标准出厂配置 MacBook Pro,未修改任何系统设置。
i
为什么需要这份指南
M5 Max 128 GB 是我们的配置器中唯一无法制作任何一手测量记录的高端配置。Mac 套件读者兼该机器所有者 Joël Ramat 提议进行测量。我们编写了测试方案,他于 2026 年 9 月 16 日执行了方案;现公布其结果,并将测量作者署名为他。

#设备与测试方法

设备规格表:M5 Max芯片,40个GPU核心,18个CPU核心,614 GB/s带宽,128 GB统一内存,macOS 27.0,Ollama 0.34.1
精确配置由脚本在首次测量前采集。GPU核心数量是关键:仅有40核版本可达到614 GB/s。

这台机器是一台 16 英寸 MacBook Pro,搭载满配版 M5 Max 芯片:18 个 CPU 核心、40 个 GPU 核心,以及 128 GB 统一内存,标称内存带宽为 614 GB/s。它运行 macOS 27.0 和 Ollama 0.34.1。未修改任何系统参数:GPU 内存上限采用默认值,这一点在与您自己的 Mac 比较时很重要。

这套测试规程只有四条规则,而且每条都必须落实。Mac 要接通电源,因为 macOS 在电池供电时会限制芯片性能。关闭资源占用较大的应用。一次只加载一个模型。最重要的是,所有测试系列都使用相同的提示词,这样各模型之间的数据才能比较,将来也能比较不同机器的数据。

各组测试共用的提示词
Explique en 300 mots la différence entre la mémoire unifiée d'un Mac et la VRAM d'un GPU dédié, pour un lecteur non technique.
A 系列:两个参照
GGUF 格式的 Gemma 4 12B 和 Qwen 3.8 27B,这两个模型也能在配置低得多的 Mac 上运行。它们可以作为熟悉的参照,帮助判断这台机器的性能水平。
B 组测试:MLX 与 GGUF 对比
同一个 Qwen 3.8 27B,使用相同的权重,由 Ollama 的 MLX 引擎提供服务,而非 llama.cpp。只有引擎发生变化。
C 系列:128 GB 档位的真正重点
gpt-oss 120B,65 GB,这是一个根本无法装进 PC 笔记本电脑内存的模型。
D系列,实际负载下的预填充
将一份含有 16,689 个 token 的文档一次性发送给 gpt-oss 120B,并附上总结指令。这是本轮测试中唯一一项有意义的预填充测量记录。
测试方案之外的两项额外测试
Joël 的机器上原本就有 MLX 格式的 Qwen 3.6 35B-A3B 和 gpt-oss 20B。他在相同条件下测试了这两个模型。
→
我们测量的是什么,以及哪些概念不能混淆
Ollama 显示两项吞吐率。预填充(prompt eval rate)是模型在回答前读取您的提示词的速度:它决定了第一个词出现前的等待时间。生成(eval rate)是逐个 token 输出回答的过程:它决定了回答看起来是否流畅。一个模型可能在其中一项上很快,在另一项上却很慢。

#所有数值汇总成一个表格

Mac 套件

在你的 Mac 上充分利用本地 AI:统一内存、MLX 与 GGUF、适合你芯片的模型、为 Apple Silicon 调优的 Ollama 和 LM Studio。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

以下是 ollama run --verbose 命令的原始输出,保留了 Joël 每次测量后复制的原样。每个模型都对 300 词的提示生成了完整回答;支持推理模式的模型使用了该模式,因此最终文本虽然只有 300 词,生成的 token 数却达到 1,400 至 3,200。

M5 Max 40 GPU · 128 GB · Ollama 0.34.1 · 接通电源 · 每个模型运行两次,保留第二次结果 · 2026年9月16日
模型引擎模型大小生成生成的标记数总时长
Gemma 4 12BGGUF Q47.6 GB58.1 tok/s1 39024 s
Qwen 3.8 27BGGUF Q417 GB36.6 个 token/秒2 51769 s
Qwen 3.8 27BMLX18 GB68.0 个token/秒2 10331 s
Qwen 3.6 35B-A3B(额外测试)MLX23 GB167.2 tok/s3 20519 s
gpt-oss 20B(额外测试)MXFP413 GB113.4 个 token/秒2 19919 s
gpt-oss 120BMXFP465 GB79.1 tok/s6698,5 s
gpt-oss 120B,第 1 次重新运行MXFP465 GB77.5 个 token/秒73212,5 s
gpt-oss 120B,第 2 次运行MXFP465 GB75.5 个标记/秒1 70722,7 s
gpt-oss 120B,D 系列MXFP465 GB67.6 tok/s2 58450 s
预填充:只有 D 系列的测量结果有参考意义(参见“局限性”部分)
系列提示词 token 数预填充输出第一个词之前的等待时间
A、B、C(短提示)43 à 98每秒 31 到 346 个 token0.1至0.9秒:启动延迟,而非吞吐量
D,包含16,689个标记的文档16 6891 388 tok/s12,0 s
!
为什么不对短提示词的预填充表现作点评
每个模型都测量了两次,并按测试规程仅保留第二次的结果,因此模型加载和 Metal 着色器编译不计入测量范围。但对于长度为 43 到 98 个 token 的提示词,预填充耗时不到一秒:这个数值反映的是固定的启动延迟,而不是读取吞吐量。需要数千个 token,吞吐量才会成为主导因素,而这正是 D 系列测试的目的。

#生成:六个模型,一次读取

生成速度柱状图:Qwen 3.6 35B-A3B 167 个 token/秒,gpt-oss 20B 113,gpt-oss 120B 79,Qwen 3.8 27B MLX 68,Gemma 4 12B 58,Qwen 3.8 27B GGUF 37
生成速度,单位为 token/秒。橙色代表 MoE 模型,每个 token 仅激活 30 亿至 50 亿个参数;蓝色代表稠密模型。

如果只看表面,这个排名显得荒谬:一个拥有1200亿参数的模型,每秒生成79个token,速度竟是GGUF格式27B模型的两倍。答案就在三个字母中:MoE。gpt-oss 120B、gpt-oss 20B和Qwen 3.6 35B-A3B都是混合专家模型。生成每个token时,只会调用一部分参数:gpt-oss 120B约为50亿,gpt-oss 20B约为36亿,Qwen约为30亿。生成速度取决于每个token所需的内存数据传输,而不是那些只是驻留在内存中、未被调用的参数。

稠密模型 Gemma 4 12B 和 Qwen 3.8 27B 在生成每个 token 时都会使用全部参数。因此,它们的速度取决于内存带宽除以模型大小:这是 Mac 自 M1 以来一直遵循的规律,M5 Max 也不例外。在这台机器上,GGUF 格式的 27B 稠密模型运行速度为每秒 37 个 token,12B 模型则为每秒 58 个 token。

使用 MLX 运行 Qwen 3.6 35B-A3B,速度达到 167 tok/s
这是本轮测试中的最高数值,来自同时结合两种加速手段的模型:MoE 架构和 MLX 引擎。它拥有小型 8B 模型的速度,以及 35B 模型的知识储备。
gpt-oss 20B:113 token/s
日常助理使用场景下,速度、质量与体积的最佳平衡:13 GB,2200个token响应时间仅19秒。
在 gpt-oss 120B 上的吞吐率为 79 tok/s
这是列表中能力最强的模型,速度是人类阅读速度的两倍。这一结果说明了选择 128 GB 配置的价值,下文会再次讨论。
稠密模型的速度为 58 和 37 tok/s
运行 GGUF 格式的 Gemma 4 12B 和 Qwen 3.8 27B 很轻松,但表现并不出人意料。其性能与 M4 Max 处于同一数量级,因为两代之间的内存带宽变化不大。
i
为什么 27B 稠密模型比 120B MoE 模型更慢
Qwen 3.8 27B 每生成一个 token,就需要搬运 17 GB 的权重数据。gpt-oss 120B 则需要搬运约 3 GB,也就是被激活的专家的权重,尽管全部 65 GB 的权重仍须容纳在内存中。在 614 GB/s 的带宽下,前者受这一限制,速度上限约为每秒 36 个 token,这恰好就是 Joël 实测的结果。后者则仍有余量。

#同等条件下的 MLX 与 GGUF 对比

两根柱条的对比:Qwen 3.8 27B 使用 GGUF 时为每秒 36.6 个 token,使用 MLX 时为每秒 68 个 token,提升了 86%。
相同模型,权重仅差一吉字节,仅推理引擎不同。实测差异为86%。

所有人都声称MLX,即Apple为Apple Silicon优化的库,比llama.cpp更快。很少有人会在严格相同的条件下,使用相同的模型,在同一天、同一台机器上进行测量。B系列测试做到了这一点:Qwen 3.8 27B使用GGUF Q4时,速度为每秒36.6个token;随后使用MLX运行Qwen 3.8 27B,速度为每秒68.0个token。提升了86%。

我们关于 MLX 和 Mac M5 的指南曾宣称生成效率可提升 30% 至 40%。在 M5 Max 上运行该模型时,实际提升超过一倍。部分差距可能源于 MLX 为 M5 生成环境定制的优化以及 GPU 内置的神经加速器;我们目前尚无法单独量化它们的贡献。可以确定的是,在一台较新的 Mac 上,当存在 MLX 版本时,仍使用 GGUF 密集模型,相当于将一半的硬件闲置在角落。

将模型切换至MLX引擎
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose
→
应养成的习惯
在拉取模型之前,请检查 Ollama 库中是否存在 -mlx 标签。对于 20 GB 及以上的稠密模型,差异肉眼可见。关于 MLX 和 llama.cpp 的指南解释了引擎是如何选择的,以及当缺少 MLX 标签时应如何处理。

#128GB实际能带来什么?

架构图:左侧为统一内存,CPU 和 GPU 共享 128 GB 的空间,其中 65 GB 的 AI 模型得以容纳;右侧为专用内存,16 GB 的 VRAM 无法容纳 65 GB 的模型
原理示意图:统一内存将全部128 GB的内存池提供给GPU。在笔记本电脑上,即使系统内存充足,16 GB显存的显卡也无法加载65 GB的模型。

128 GB 这一档真正值得关注的不是速度,而是能装下哪些模型。gpt-oss 120B 在 MXFP4 格式下占用 65 GB。没有任何 PC 笔记本能在 GPU 上运行它:移动显卡的显存上限为 16 或 24 GB。在配备 128 GB 内存的 M5 Max 上,它可以加载,三次运行中的生成速度为每秒 75 至 79 个 token,而且仍有剩余空间。

128GB堆叠条:35GB用于macOS及打开的应用程序,65GB用于gpt-oss 120B,28GB空闲
C组测试期间的内存分配情况,数值仅表示大致量级。Joël没有关闭任何程序:Obsidian、Terminal以及会话中的其他应用都保持打开。

活动前的内存占用情况一目了然:macOS 和工作会话中的应用占用了 35 GB,剩余 93 GB 可供 AI 使用。120B 模型安装后仍留有约三十 GB 的余量,足以支持长上下文以及并行运行一个轻量级模型,例如用于代码自动补全的 8B 模型。在配备 64 GB 内存的 M5 Max 上,同一模型完全无法加载;在 96 GB 内存上可以加载,但几乎没有余量留给其他任务。

8.5 至 22.7 秒
在 300 字提示下,gpt-oss 120B 三次运行的总响应时长分别为 669、732 和 1707 个 token,速度保持不变(79.1、77.5 和 75.5 个 token/秒),变化的是推理长度,模型在不同运行中选择是否逐字计数。
50秒
D系列的持续时间:阅读一个包含16,689个token的文档,然后撰写一份包含2,584个token的十点摘要。
热压力状态为“Nominal”
每组测试后记录一次。整个测试过程中,包括测试 120B 模型时,都听不到风扇声。
i
在这一配置档位下,我们未能完成的测量
机器上没有安装采用 Q4 量化的 70B 稠密模型。对于这种配置,我们的 MacBook Pro M5 Max 介绍页面估计其在 MLX 下的生成速度为每秒 15 至 25 个 token。在下一轮测试之前,这个数字仍只是估计值。

#预填充,没人公开的数值

一次请求的50秒时序:前12秒读取一个包含16689个token的文档,速率为每秒1388个token,随后38秒用于生成响应
D系列。提交的文档是基准测试报告本身,以纯文本形式导出,后接一个摘要指令。

一个只有二十个词的提示词说明不了预填充(prefill)的性能。为了测量这项性能,Joël 将一篇 11 280 个词的文本一次性发送给 gpt-oss 120B,合计 16 689 个 token,约 45 页,并要求模型进行总结。结果:读取速度为每秒 1 388 个 token,也就是等待十二秒后,回答的第一个词才出现;随后以每秒 67.6 个 token 的速度生成了包含 2 584 个 token 的总结。

这是关乎严肃用途的关键数字。分析合同、总结审计报告、通过 RAG 查询文档库:在所有这些情况下,模型大部分时间都在阅读,而非写作。在笔记本电脑上,45 页文档仅需十二秒,且没有任何字节离开机器,这使得本地 AI 对于受职业保密约束的顾问或受保密限制的企业而言变得可用。

→
处理您的文档大致需要多久
以每秒 1 388 个 token 的速度,读取一份 30 页的合同需要 8 秒,读取一份 100 页的报告需要 27 秒。这些时间还需加上生成回答的时间;因此,在这台设备上为一份长文档生成完整摘要,应预留约一分钟。

#发热与风扇

Joël 在每组测试后都使用 macOS 的热压力查询命令记录了热状态。结果始终为“Nominal”,而且听不到风扇声,即使在 GPU 持续满载五十秒的 D 组测试期间也是如此。这与我们在 M4 Max 上观察到的情况一致,但有一点需要保留:我们的测量都基于不足一分钟的短时负载。测试方案中计划的降频测试——持续负载十分钟后,再重新测量 A 组——尚未进行。我们会在下一轮测试中要求进行这项测试。

检查生成过程中的热压力
sudo powermetrics --samplers thermal -i 1000 -n 1 | grep -i pressure

#这些测量结果无法说明的内容

一份诚实的基准测试应列出其未证明的内容。以下是按重要性排序的注意事项。

短提示词的预填充
每个模型测试两次,保留第二次的结果。但长度为 43 至 98 个 token 的提示词只能测出启动延迟:只有使用 16,689 个 token 的 D 系列测试,才能测得真正的提示词读取吞吐量。
没有700亿参数的密集模型
选择 128 GB 内存配置,也可以是为了运行采用 Q4 量化、使用长上下文的 70B 模型。这里没有进行这方面的测量。
未进行降频测试
这些短时负载均持续不到一分钟。连续一小时高强度运行 RAG 时的表现仍有待记录。
未测量电池供电时的性能
测试方案要求接通电源。使用电池供电时,预计测得的数值会明显更低,因为 macOS 会限制芯片性能。
每位测试者使用各自的 D 系列测试文档
测试规程并未规定 D 系列测试中提交的长文本:两位测试者读取的不是同一份文档,因此限制了不同机器之间预填充性能的比较。根据 Joël 的建议,测试规程现在提供一份统一的参考文本,共 11 292 个词,可在下一节下载:今后的测量结果将可以相互比较。本页的测量是在此之前完成的,使用的是另一份长度相当的文档。
一台设备,一个操作员
未测量任何方差。如果您的配置相同,欢迎提供您的数据,详见下一部分。
处于推理模式的模型
能够先思考再作答的模型生成的token数量远超所要求的300词,且同一模型在不同运行中的token数量会有所变化(在gpt-oss 120B上为669至1707个token)。因此,总耗时无法直接比较,仅速度可以对比。
重复运行提示词时的提示词缓存
再次提交相同提示词时,Ollama 会复用已经处理过的 token(“prompt eval cached”)。因此,重复提交完全相同的提示词所得的预填充结果不能作为有效测量;要测量预填充,需要使用较长且全新的提示词,就像 D 系列测试中那样。

#在本地复现基准测试

白色书桌上的笔记本电脑俯视图,旁边有机械秒表、已接通的充电器、笔记本和笔
示意图。接通电源、关闭应用程序、一次只运行一个模型:这三个条件缺一不可,否则测量记录就没有意义。

这套测试流程可以原样用于任何 Apple Silicon Mac,从 MacBook Air 到 Mac Studio 都适用。如果您使用相同的提示词完成相同的测试系列,测得的数据就可以直接与本页的数据比较。

  1. 01
    准备机器
    接通电源,关闭浏览器、Docker 和虚拟机。记录您的芯片型号、GPU 核心数量以及 Ollama 的版本。
  2. 02
    记录系统状态
    记录芯片型号、GPU 核心数、macOS 和 Ollama 的版本、供电情况、可用内存以及已打开的应用程序。Joël 编写了一个 zsh 脚本,只需一条命令就能生成这份报告;核验后,将在获得他授权的情况下把该脚本加入 Mac 套件的基准测试章节。
  3. 03
    A 组测试
    下载 gemma4:12b 和 qwen3.8:27b 模型,分别使用 --verbose 参数启动,粘贴同一提示词,等待回答完整输出,然后输入 /bye 退出。运行两轮,保留第二轮的结果。
  4. 04
    B系列
    对 qwen3.8:27b-mlx 执行相同的操作。将 eval rate 这一行与 A 组测试中的对应行进行比较。
  5. 05
    C 系列
    如果您有 96 GB 或更多统一内存:选择 gpt-oss:120b。否则,选择能装入可用统一内存(总量减去 10 GB)的最大模型。
  6. 06
    D 系列
    下载 QuelLLM 的参考文本,共 11 292 个词,所有人使用同一份文本,然后将其传给 ollama run,并附上指令“将这段文本总结为 10 条要点”。记录显示的提示 token 数:它取决于模型,而不是文本。
测试流程中的命令
# Série A — les deux repères
ollama pull gemma4:12b && ollama pull qwen3.8:27b
ollama run gemma4:12b --verbose
ollama run qwen3.8:27b --verbose

# Série B — même modèle, moteur MLX
ollama pull qwen3.8:27b-mlx
ollama run qwen3.8:27b-mlx --verbose

# Série C — le palier 128 Go (65 Go à télécharger)
ollama pull gpt-oss:120b
ollama run gpt-oss:120b --verbose

# Série D — préfill sur le texte de référence commun (11 292 mots)
curl -sO https://quelllm.fr/img/protocole/texte-reference-quelllm-v1.txt
ollama run gpt-oss:120b --verbose "$(cat texte-reference-quelllm-v1.txt) Résume ce texte en 10 puces."
→
请将您的测量记录发送给我们
请将每次测量的原始统计数据块粘贴到电子邮件中,发送至 contact@quelllm.fr,并附上您的芯片型号、GPU 核心数和 Ollama 版本。我们会发布经过核实的测量记录并注明您的姓名;如果您愿意,也可以匿名发布。我们最缺少以下配置的记录:M5 Max 64 GB、M5 Pro、Mac Studio M5 Ultra。

#适合谁,价格是多少

选择 M5 Max 128 GB 的理由只有一个:在本地运行其他任何笔记本都容纳不下的模型,同时为上下文和第二个模型留出余量。gpt-oss 120B 每秒生成 79 个 token,十二秒读完一份 45 页的文档,无需风扇运转——这就是一台能装进包里的 AI 工作站。

按使用场景解读结果
您是这项基准测试能告诉您什么推荐档位
负有职业保密义务的顾问、律师、注册会计师120B 模型能在本地读取并综合整理您的资料,速度足以满足实际使用,且不会向外部发送任何内容。M5 Max 128 GB
希望拥有可靠本地编程助手的开发者gpt-oss 20B 或 Qwen 3.6 35B-A3B 都绰绰有余,且能装入 48 GB 内存。我们测得的 113 和 167 tok/s 适用于配备 40 核 GPU 的芯片:内存容量足够,但带宽较低的版本速度会更慢M5 Max 48 或 64 GB
每天使用写作助手的用户一个 12B 稠密模型或 20B MoE 模型就足以满足使用需求;128 GB 内存属于奢侈配置。内存容量足够,但 M5 Pro 的内存速度更慢:预计速度会低于我们测得的 58 和 113 tok/sM5 Pro 48 GB
希望共享服务器的团队Mac Studio M5 Max 或 Ultra 提供相同的引擎,配备更多内存和台式机级散热系统Mac Studio
!
这些速度适用于该芯片
本页所有数据均在配备 40 个 GPU 核心、内存带宽为 614 GB/s 的 M5 Max 上测得。LLM 的生成速度受限于这一内存带宽:在配备 32 个 GPU 核心的 M5 Max 或 M5 Pro 上,由于内存速度较慢,相同模型仍能装入内存,但运行速度会更慢。上表说明的是哪些模型能装入内存,而不是您在其他配置档位上能获得的速度。

如果您的需求最多只涉及 300 亿参数的模型,一半的内存就足够,省下的差价可以买一台很好的显示器。如果您的需求从 1000 亿参数的模型起步,就没有其他便携式替代方案,而本指南提供的数据可以帮助您向负责签署采购订单的人说明购买理由。

#致谢与来源

一位顾问夜间使用笔记本电脑工作,屏幕上显示着终端界面,旁边有台灯和记事本
示意图。日常工作时,各种应用程序保持打开状态:这些测量就是在这样的条件下,在测量者自己的工作电脑上完成的。

本页面的测量由乔尔·拉马特(Joël Ramat)完成。他是网络安全与 GRC(治理、风险和合规)顾问、ISO 27001 专家,提供借助本地部署 AI 增强的咨询与审计服务,也是 Sywédgia SAS 的联合创始人兼总裁。他于 2026 年 9 月 16 日在自己的机器上执行了 QuelLLM 测试方案,并在本文发布前审阅了文章。测量记录仍归他所有,他可以自行发布这些记录。

方法:每次测量后复制 ollama run --verbose 的原始输出,不作修改;整轮测试开始前通过脚本记录系统状态;每组测试结束后读取热压力状态。包含模型完整回答的完整报告已保存,可应要求提供。撰写与排版:Mohamed Meguedmi,哪个LLM。


#FAQ

M5 Max 128 GB 是否比 M4 Max 128 GB 在本地 AI 任务上更快?+
对于GGUF格式的稠密模型,速度提升并不显著:内存带宽变化不大,Qwen 3.8 27B的运行速度为每秒37个token,与M4 Max处于相近量级。使用MLX时差距会扩大,M5 Max运行同一模型的实测速度为每秒68个token。我们没有在相同条件下测量M4 Max使用MLX时的速度,因此无法给出确切的差距。
为什么gpt-oss 120B比Qwen 3.8 27B运行更快?+
因为 gpt-oss 120B 是一种 MoE 模型,每个 token 仅激活约 50 亿参数,而 Qwen 3.8 27B 是稠密模型,每生成一个 token 都要搬运 270 亿参数。速度取决于激活的参数量,而非总参数量。不过,120B 模型占用的 65 GB 必须全部容纳在内存中,只有 96 GB 或 128 GB 内存配置才能做到。
运行 gpt-oss 120B 需要 128 GB 内存吗?+
在合理的上下文长度下加载该模型,至少需要 96 GB 统一内存。128 GB 则能为长上下文、另一个轻量模型以及同时进行的日常工作留出余量。Joël 曾在其他应用已占用 35 GB 内存的情况下运行 120B 模型。
这些数值在电池供电下有效吗?+
不适用。测试方案要求接通电源,因为 macOS 在电池供电时会限制芯片性能。移动使用时,速度会明显降低,尤其是测量结果将无法复现。
为什么不公布 A、B、C 系列的预填充测试结果?+
这些预填充数据是在43至98个token的提示词上测得的。在这种长度下,预填充耗时不到一秒,反映的是启动延迟,而不是读取吞吐量;这个数字无法说明模型读取实际文档的速度。唯一有参考价值的预填充测量来自D系列,使用了16,689个token:每秒1,388个token。
我可以提交自己测得的结果吗?+
可以。请使用共用提示词,按 A 至 D 系列进行测试,每项测量运行两次,并将原始统计数据块连同您的配置发送至 contact@quelllm.fr。我们会发布经核实的测量记录,并注明您的贡献。
在哪里可以找到本次基准测试使用的准备脚本?+
Joël Ramat 编写的 zsh 脚本会在测量前生成一份完整的 Mac 状态报告。待该脚本在其他机器上验证后,将在获得他授权并注明其贡献的情况下,加入 Mac 套件的基准测试章节。在此之前,“重现基准测试”部分列出了需要手动记录的信息。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。