在MacBook Air M2(8/16/24 GB)上运行哪个LLM ?
MacBook Air M2 在 8 GB 内存配置下可运行 30 亿至 40 亿参数的模型,在 16 GB 配置下可运行 80 亿至 90 亿参数的模型,在 24 GB 配置下最多可运行采用 Q4 量化的 240 亿参数模型。其内存带宽为 100 GB/s,据 Apple 称比 M1 高 50%,使采用 Q4 量化的 80 亿参数模型的生成速度上限约为每秒 20 个 token;内存容量则决定哪些模型能够加载。
M2 是 MacBook Air 首款支持 24 GB 内存和 100 GB/s 内存带宽的芯片。本页面说明在 8、16 或 24 GB 内存配置下应选择哪类模型,计算物理上可能达到的最高速度,并指出何时应升级到 M4。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: MacBook Pro M5 Pro — 24 GB / 1 TB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#MacBook Air M2:带宽达 100 GB/s,最高支持 24 GB
与 M1 相比,MacBook Air M2 有两项对 LLM 很重要的变化:内存带宽提升至 100 GB/s,内存容量最高可达 24 GB。Apple 公布的 M2 带宽为 100 GB/s,比 M1 高出 50%;这是官方数字,而不是有时能看到的 47% 增幅。因此,根据模型不同,最高生成速度约提升三分之一到一半,可运行的模型档次也提升一级。
- 芯片
- 根据Apple的技术规格,Apple M2配备8核CPU(4个性能核、4个能效核)、8核GPU(更高配置为10核GPU)以及16核神经网络引擎。
- 内存
- 根据 Apple 的规格说明,MacBook Air M2 提供 8 GB 版本(购买时可选配 16 GB 或 24 GB)和 16 GB 版本(购买时可选配 24 GB)。内存焊接在主板上,必须在购买时确定配置。
- 带宽
- 据 Apple 称,带宽为 100 GB/s,比 M1 高 50%。
- 散热
- 无风扇:Apple 将 MacBook Air M2 描述为采用静音无风扇设计。在持续负载下,这种安静需要付出代价,详见散热章节。
- 电池
- 52.6 Wh;Apple 宣称无线网页浏览续航最长可达 15 小时。让 GPU 承担计算负载的 LLM,其耗电量远高于浏览网页。
#8、16 或 24 GB:各档容量能做什么
在 MacBook Air M2 上,每一 GB 内存都很宝贵。Mac 工具包帮助您选择真正能装入内存的模型(第 4 章)、计算内存预算(第 5 章),并测量对发热和电池的影响(第 6 章)。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
模型不能占用全部内存:macOS、浏览器和您的应用程序也需要占用一部分。对于模型及其上下文,8 GB 配置可用的空间约为 4–5 GB,16 GB 配置约为 10–11 GB,24 GB 配置约为 16–18 GB。这些是保守估算,应结合“活动监视器”中的内存压力进行核对。模型权重大小可参考本站的数据:在 Q4 量化下,3B 约为 2 GB,7–8B 约为 5 GB,14B 约为 9 GB,32B 约为 19–20 GB。
| 内存 | 可供模型和上下文使用的内存空间 | 可轻松运行的模型级别 | 接近上限 |
|---|---|---|---|
| 8 GB | ≈ 4 至 5 GB | 3-4B | 8B,上下文非常短 |
| 16 GB | ≈ 10 到 11 GB | 8-9B,中等上下文长度 | 12B,短上下文 |
| 24 GB | ≈ 16 至 18 GB | 可轻松运行 12–14B 模型,或运行采用 Q8 量化或使用长上下文的 8–9B 模型 | 采用 Q4 量化的 24B 模型(约 14 GB),需缩短上下文 |
24 GB 这一档内存会改变机器的能力:它能运行 Q4 量化的 240 亿参数模型(权重约 14 GB),这是任何 MacBook Air M1 都做不到的。不过,这种配置很少见:内存无法扩展,目前在用的大多数 MacBook Air M2 都只有 8 GB 或 16 GB。选择模型前,请在苹果菜单的“关于本机”中确认机器的实际配置。
#M2芯片的最大运行速度
生成过程中,每生成一个 token 都要读取活跃权重:最大速度等于带宽除以权重大小(以 GB 为单位)。下表将该公式应用于 M2(100 GB/s)和 M1(约 68 GB/s)。这些都是计算得出的上限,绝非实测值:实际速度更低,并取决于引擎、量化方式和上下文长度。这些上限可用于检查其他地方公布的数值在物理上是否可能。
| 模型 | 模型大小 | Air M1(≈ 68 GB/s) | Air M2 (100 GB/s) |
|---|---|---|---|
| 3B | ≈ 2 GB | ≈ 34 tok/s | ≈ 50 tok/s |
| 4B | ≈ 2.5至3GB | ≈ 23 至 27 tok/s | ≈ 33 至 40 个 token/秒 |
| 8B | ≈ 5 GB | ≈ 13 tok/s | ≈ 20 tok/s |
| 12B | ≈ 7.5 GB | ≈ 9 tok/s | ≈ 13 tok/s |
| 24B | ≈ 14 GB | 不适用(内存) | ≈ 7个token/秒 |
需要进行两次分析。首先,理论上在M2上运行8B模型且量化为Q4的吞吐量应低于每秒20个token:该模型在该芯片上显示每秒25或28个token的吞吐量,不可能来自传统生成方式。其次,24B模型的上限约为每秒7个token:它适合从容作答,无法支持快速对话。如需真实性能数据,请参见/benchmarks以及第三方基准测试,注意核对芯片、量化方式和推理引擎。
#安装模型并检查 GPU
- 01安装 Ollama请从 ollama.com 下载,或通过 Homebrew 安装。本站的 macOS 安装指南详细介绍了启动选项。
- 02根据内存选择模型8 GB 可支持 4B 模型,16 GB 可支持 8-9B 模型,24 GB 可支持 12-14B 或 24B 模型(Q4 模式)。启动时请使用 ollama run 命令后接模型名称。
- 03检查 GPU在另一个终端中,ollama ps 会在 PROCESSOR 列显示 CPU/GPU 的分配情况。预期状态是模型完全加载在 GPU 上。
- 04调整上下文当内存容量低于 24 GiB 时,Ollama 默认将上下文设为 4,000 个 token。请逐步增加上下文长度,而不要一次大幅提高:每增加一个 token,KV 缓存都会占用更多内存。
模型安装在~/.ollama/models目录下。在配备256GB SSD的Air M2设备上,5至15GB大小的几个模型即可填满可用空间:请使用ollama rm命令删除不再使用的模型。
选择模型时,一个实用原则是:从能正确完成您任务的最小模型开始,只有回答仍不够好时,才换用大一档的模型。在内存带宽受限的设备上,每增加十亿个参数,都会付出速度下降的代价。在做决定前,用您自己的五条真实请求测试两个候选模型:这需要十分钟,可以避免下载过于庞大的模型。
#24 GB 内存与 RAG:这一档配置究竟能做什么
基于您的文档运行助手需要三个组件:负责索引的嵌入模型、负责回答的生成模型,以及可选的、用于对文本段落排序的重排序模型。8 GB 内存下,运行这一整套组件比较吃紧。16 GB 内存下,轻量级嵌入模型可以与一个 80 亿至 90 亿参数的模型同时运行,但上下文需保持较短。24 GB 内存下,您可以加入重排序模型,并保留数千个 token 的上下文,无需写入 SSD。这正是更高一档内存容量能充分体现价值的使用场景。
- 索引之前
- 检查内存是否足以同时容纳嵌入模型和生成模型:请求期间,两者都会保持加载状态。
- 请求过程中
- 注入精选段落而非整个文档:上下文在内存和计算时间上都会产生开销。
- 之后
- 若内存压力达到黄色级别,请减少迭代次数或切换至更小的模型。
#M2 上的量化与 KV 缓存
在带宽受限的机器上,Q4_K_M 仍是默认设置:模型更小,因此读取速度更快。当内存允许且质量优先时,选择 Q5_K_M 才有理由。Q8_0 几乎使模型体积翻倍,并使速度上限大致减半。对于 KV 缓存,Ollama 会在引擎和硬件支持的情况下自动使用 Flash Attention;变量 OLLAMA_KV_CACHE_TYPE 用于量化缓存,默认值为 f16。该设置让 16 GB 内存的机器更容易使用长上下文,代价是轻微的精度损失。
#续航能力、静音与发热表现
Air M2 没有风扇,因此运行时保持安静,适合安静的办公室,也适合让助手在夜间持续运行。机身采用被动散热,因此持续数十分钟的负载会使芯片降频。本页面不提供触发降频的时长或温度阈值:没有任何一手来源明确给出这些阈值,而且它们会随所在房间的环境而变化。使用电池供电时,续航时间会比浏览网页时缩短得多,因为 GPU 会持续工作;长时间使用时,请接通电源。
- 长时间运行的处理任务
- 请接通电源,将电脑垫高,并避免同时运行增加处理器负载的应用程序。
- 节能模式
- macOS 在电池设置中提供此功能。它会限制性能:仅在续航优先于速度的移动场景中使用。
- 持续负载
- 对于需要一整天响应请求的本地服务器,配备风扇的 Mac mini 比 Air 更合适。
#继续使用 M2 或升级至 M3、M4?
根据 Apple 的规格表,搭载 M3 的 MacBook Air 仍保持相同的 100 GB/s 带宽和 24 GB 内存上限:对 LLM 而言,从 M2 升级到 M3,在生成性能方面几乎没有可测量的提升。M4 将带宽提高到 120 GB/s,将内存提高到 32 GB,从而同时改变了最高速度和可运行的模型档次。
| 标准 | Air M2 | Air M3 | Air M4 |
|---|---|---|---|
| 带宽 | 100 GB/s | 100 GB/s | 120 GB/s |
| 最大内存 | 24 GB | 24 GB | 32 GB |
| 决策 | 内存为 16 GB 或 24 GB 时保留 | 如果已有 M2,换机的理由不多 | 如果想要超过 24 GB 的内存,就更换机器 |
- 继续使用您配备 16 GB 或 24 GB 内存的 M2
- 它可以轻松运行 8–9B 和 12–14B 模型;M4 对最高速度的提升仅约为 20%。
- 如果您有8GB,请更换
- 提升的是可运行的模型规模,而不是速度:配备至少 16 GB 内存的 MacBook Air,可以从 4B 模型升级到 8–9B 模型。
- 如果想要超过 24 GB 的内存,就换机
- 只有 M4 在 Air 上提供 32 GB;超过此配置,请查看 MacBook Pro M4 Pro 或 Max。
- MacBook Air M1:8 GB 和 16 GB 配置的局限
- MacBook Air M3:同样达到 100 GB/s
- MacBook Air M4:32 GB 内存,120 GB/s 带宽
- 在 macOS 上安装 Ollama
- MacBook Pro M4 Pro 和 Max,最高支持 128 GB
- 本站 VRAM 计算工具
#常见问题
8GB 的 MacBook Air M2 能运行 8B 模型吗?+
MacBook Air M2 与 M3 在运行 LLM 时,真正的区别是什么?+
MacBook Air M2 24GB 值得用于本地 AI 吗?+
在 MacBook Air M2 上,8B 模型的运行速度是多少?+
Air M2的风扇在运行大模型时会启动吗?+
在 Air M2 上,选 Ollama 还是 LM Studio?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。