入门 11 分钟MacBook Air

在MacBook Air M2(8/16/24 GB)上运行哪个LLM ?

直接回答

MacBook Air M2 在 8 GB 内存配置下可运行 30 亿至 40 亿参数的模型,在 16 GB 配置下可运行 80 亿至 90 亿参数的模型,在 24 GB 配置下最多可运行采用 Q4 量化的 240 亿参数模型。其内存带宽为 100 GB/s,据 Apple 称比 M1 高 50%,使采用 Q4 量化的 80 亿参数模型的生成速度上限约为每秒 20 个 token;内存容量则决定哪些模型能够加载。

M2 是 MacBook Air 首款支持 24 GB 内存和 100 GB/s 内存带宽的芯片。本页面说明在 8、16 或 24 GB 内存配置下应选择哪类模型,计算物理上可能达到的最高速度,并指出何时应升级到 M4。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 macOS 14+ 上测试
推荐硬件

本指南的备选购买方案: MacBook Pro M5 Pro — 24 GB / 1 TB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#MacBook Air M2:带宽达 100 GB/s,最高支持 24 GB

与 M1 相比,MacBook Air M2 有两项对 LLM 很重要的变化:内存带宽提升至 100 GB/s,内存容量最高可达 24 GB。Apple 公布的 M2 带宽为 100 GB/s,比 M1 高出 50%;这是官方数字,而不是有时能看到的 47% 增幅。因此,根据模型不同,最高生成速度约提升三分之一到一半,可运行的模型档次也提升一级。

芯片
根据Apple的技术规格,Apple M2配备8核CPU(4个性能核、4个能效核)、8核GPU(更高配置为10核GPU)以及16核神经网络引擎。
内存
根据 Apple 的规格说明,MacBook Air M2 提供 8 GB 版本(购买时可选配 16 GB 或 24 GB)和 16 GB 版本(购买时可选配 24 GB)。内存焊接在主板上,必须在购买时确定配置。
带宽
据 Apple 称,带宽为 100 GB/s,比 M1 高 50%。
散热
无风扇:Apple 将 MacBook Air M2 描述为采用静音无风扇设计。在持续负载下,这种安静需要付出代价,详见散热章节。
电池
52.6 Wh;Apple 宣称无线网页浏览续航最长可达 15 小时。让 GPU 承担计算负载的 LLM,其耗电量远高于浏览网页。

#8、16 或 24 GB:各档容量能做什么

Mac 套装

在 MacBook Air M2 上,每一 GB 内存都很宝贵。Mac 工具包帮助您选择真正能装入内存的模型(第 4 章)、计算内存预算(第 5 章),并测量对发热和电池的影响(第 6 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

模型不能占用全部内存:macOS、浏览器和您的应用程序也需要占用一部分。对于模型及其上下文,8 GB 配置可用的空间约为 4–5 GB,16 GB 配置约为 10–11 GB,24 GB 配置约为 16–18 GB。这些是保守估算,应结合“活动监视器”中的内存压力进行核对。模型权重大小可参考本站的数据:在 Q4 量化下,3B 约为 2 GB,7–8B 约为 5 GB,14B 约为 9 GB,32B 约为 19–20 GB。

Air M2:不同内存容量下实际可运行的模型规模(Q4_K_M)
内存可供模型和上下文使用的内存空间可轻松运行的模型级别接近上限
8 GB≈ 4 至 5 GB3-4B8B,上下文非常短
16 GB≈ 10 到 11 GB8-9B,中等上下文长度12B,短上下文
24 GB≈ 16 至 18 GB可轻松运行 12–14B 模型,或运行采用 Q8 量化或使用长上下文的 8–9B 模型采用 Q4 量化的 24B 模型(约 14 GB),需缩短上下文

24 GB 这一档内存会改变机器的能力:它能运行 Q4 量化的 240 亿参数模型(权重约 14 GB),这是任何 MacBook Air M1 都做不到的。不过,这种配置很少见:内存无法扩展,目前在用的大多数 MacBook Air M2 都只有 8 GB 或 16 GB。选择模型前,请在苹果菜单的“关于本机”中确认机器的实际配置。

→
16 GB:能满足主要需求的内存档位
对于摘要、写作、编程辅助和轻量级 RAG,8B 至 9B 参数的 Q4 量化模型足以满足大多数常见需求。24 GB 显存主要适合需要运行 24B 模型、使用很长的上下文,或在运行生成模型的同时运行嵌入模型和重排序模型的情况。

#M2芯片的最大运行速度

生成过程中,每生成一个 token 都要读取活跃权重:最大速度等于带宽除以权重大小(以 GB 为单位)。下表将该公式应用于 M2(100 GB/s)和 M1(约 68 GB/s)。这些都是计算得出的上限,绝非实测值:实际速度更低,并取决于引擎、量化方式和上下文长度。这些上限可用于检查其他地方公布的数值在物理上是否可能。

仅基于权重的理论生成上限(Q4量化):为计算值,非实际测量值
模型模型大小Air M1(≈ 68 GB/s)Air M2 (100 GB/s)
3B≈ 2 GB≈ 34 tok/s≈ 50 tok/s
4B≈ 2.5至3GB≈ 23 至 27 tok/s≈ 33 至 40 个 token/秒
8B≈ 5 GB≈ 13 tok/s≈ 20 tok/s
12B≈ 7.5 GB≈ 9 tok/s≈ 13 tok/s
24B≈ 14 GB不适用(内存)≈ 7个token/秒

需要进行两次分析。首先,理论上在M2上运行8B模型且量化为Q4的吞吐量应低于每秒20个token:该模型在该芯片上显示每秒25或28个token的吞吐量,不可能来自传统生成方式。其次,24B模型的上限约为每秒7个token:它适合从容作答,无法支持快速对话。如需真实性能数据,请参见/benchmarks以及第三方基准测试,注意核对芯片、量化方式和推理引擎。

#安装模型并检查 GPU

  1. 01
    安装 Ollama
    请从 ollama.com 下载,或通过 Homebrew 安装。本站的 macOS 安装指南详细介绍了启动选项。
  2. 02
    根据内存选择模型
    8 GB 可支持 4B 模型,16 GB 可支持 8-9B 模型,24 GB 可支持 12-14B 或 24B 模型(Q4 模式)。启动时请使用 ollama run 命令后接模型名称。
  3. 03
    检查 GPU
    在另一个终端中,ollama ps 会在 PROCESSOR 列显示 CPU/GPU 的分配情况。预期状态是模型完全加载在 GPU 上。
  4. 04
    调整上下文
    当内存容量低于 24 GiB 时,Ollama 默认将上下文设为 4,000 个 token。请逐步增加上下文长度,而不要一次大幅提高:每增加一个 token,KV 缓存都会占用更多内存。
终端
brew install --cask ollama
ollama run qwen3.5:9b
ollama ps

模型安装在~/.ollama/models目录下。在配备256GB SSD的Air M2设备上,5至15GB大小的几个模型即可填满可用空间:请使用ollama rm命令删除不再使用的模型。

选择模型时,一个实用原则是:从能正确完成您任务的最小模型开始,只有回答仍不够好时,才换用大一档的模型。在内存带宽受限的设备上,每增加十亿个参数,都会付出速度下降的代价。在做决定前,用您自己的五条真实请求测试两个候选模型:这需要十分钟,可以避免下载过于庞大的模型。

#24 GB 内存与 RAG:这一档配置究竟能做什么

基于您的文档运行助手需要三个组件:负责索引的嵌入模型、负责回答的生成模型,以及可选的、用于对文本段落排序的重排序模型。8 GB 内存下,运行这一整套组件比较吃紧。16 GB 内存下,轻量级嵌入模型可以与一个 80 亿至 90 亿参数的模型同时运行,但上下文需保持较短。24 GB 内存下,您可以加入重排序模型,并保留数千个 token 的上下文,无需写入 SSD。这正是更高一档内存容量能充分体现价值的使用场景。

索引之前
检查内存是否足以同时容纳嵌入模型和生成模型:请求期间,两者都会保持加载状态。
请求过程中
注入精选段落而非整个文档:上下文在内存和计算时间上都会产生开销。
之后
若内存压力达到黄色级别,请减少迭代次数或切换至更小的模型。

#M2 上的量化与 KV 缓存

在带宽受限的机器上,Q4_K_M 仍是默认设置:模型更小,因此读取速度更快。当内存允许且质量优先时,选择 Q5_K_M 才有理由。Q8_0 几乎使模型体积翻倍,并使速度上限大致减半。对于 KV 缓存,Ollama 会在引擎和硬件支持的情况下自动使用 Flash Attention;变量 OLLAMA_KV_CACHE_TYPE 用于量化缓存,默认值为 f16。该设置让 16 GB 内存的机器更容易使用长上下文,代价是轻微的精度损失。

#续航能力、静音与发热表现

Air M2 没有风扇,因此运行时保持安静,适合安静的办公室,也适合让助手在夜间持续运行。机身采用被动散热,因此持续数十分钟的负载会使芯片降频。本页面不提供触发降频的时长或温度阈值:没有任何一手来源明确给出这些阈值,而且它们会随所在房间的环境而变化。使用电池供电时,续航时间会比浏览网页时缩短得多,因为 GPU 会持续工作;长时间使用时,请接通电源。

长时间运行的处理任务
请接通电源,将电脑垫高,并避免同时运行增加处理器负载的应用程序。
节能模式
macOS 在电池设置中提供此功能。它会限制性能:仅在续航优先于速度的移动场景中使用。
持续负载
对于需要一整天响应请求的本地服务器,配备风扇的 Mac mini 比 Air 更合适。

#继续使用 M2 或升级至 M3、M4?

根据 Apple 的规格表,搭载 M3 的 MacBook Air 仍保持相同的 100 GB/s 带宽和 24 GB 内存上限:对 LLM 而言,从 M2 升级到 M3,在生成性能方面几乎没有可测量的提升。M4 将带宽提高到 120 GB/s,将内存提高到 32 GB,从而同时改变了最高速度和可运行的模型档次。

Air M2、M3和M4:根据Apple规格表整理的本地LLM关键要点
标准Air M2Air M3Air M4
带宽100 GB/s100 GB/s120 GB/s
最大内存24 GB24 GB32 GB
决策内存为 16 GB 或 24 GB 时保留如果已有 M2,换机的理由不多如果想要超过 24 GB 的内存,就更换机器
继续使用您配备 16 GB 或 24 GB 内存的 M2
它可以轻松运行 8–9B 和 12–14B 模型;M4 对最高速度的提升仅约为 20%。
如果您有8GB,请更换
提升的是可运行的模型规模,而不是速度:配备至少 16 GB 内存的 MacBook Air,可以从 4B 模型升级到 8–9B 模型。
如果想要超过 24 GB 的内存,就换机
只有 M4 在 Air 上提供 32 GB;超过此配置,请查看 MacBook Pro M4 Pro 或 Max。

#常见问题

FAQ
8GB 的 MacBook Air M2 能运行 8B 模型吗?+
技术上,使用 Q4 量化可以运行(模型权重约占 5 GB),但上下文一增长,就会超出 macOS 留下的 4 到 5 GB 可用内存:系统随即向 SSD 写入数据,导致整体变慢。在 8 GB 内存的机器上,请使用参数量为 30 亿到 40 亿的模型,并保持较短的上下文。
MacBook Air M2 与 M3 在运行 LLM 时,真正的区别是什么?+
在生成方面,差异很小:根据Apple的规格表,Air M3的带宽同样为100 GB/s,最大内存容量也同样为24 GB。M3主要带来其他方面的改进,对权重读取速度没有直接影响。如果您已经有M2,建议等到M4再升级。
MacBook Air M2 24GB 值得用于本地 AI 吗?+
值得,如果您需要运行一个采用 Q4 量化的 240 亿参数模型(约 14 GB),或使用带有嵌入模型和重排序模型的 RAG:16 GB 内存容纳不下这些用途。否则,16 GB 内存已足以支持 80 亿至 90 亿参数的模型。购买前请确认设备的实际内存容量。
在 MacBook Air M2 上,8B 模型的运行速度是多少?+
理论上限是带宽除以模型权重:100 GB/s 除以约 5 GB,最多可达到每秒 20 个 token,适用于 8B 模型的 Q4 量化。实际速度会因引擎和上下文而低于此值。请参阅 /benchmarks 或第三方测试数据,其中明确标注了芯片型号和量化方式。
Air M2的风扇在运行大模型时会启动吗?+
不会:它没有风扇。Apple 描述的是一种无风扇、静音的设计。代价在于散热:长时间处于负载下时,芯片会降低频率,生成速度也会下降,但仍然没有噪声。对于持续数小时的处理任务,建议优先选择 Mac mini 或 MacBook Pro。
在 Air M2 上,选 Ollama 还是 LM Studio?+
想快速上手、编写脚本并与其他工具集成,可选择 Ollama;想使用图形界面并探索 Hugging Face 上的模型,可选择 LM Studio。两者可以共存,但在只有 8 GB 或 16 GB 内存的机器上,不应同时加载两个模型:内存是首要限制因素。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。