入门 3 分钟Ollama

在 macOS(Apple Silicon)上安装 Ollama:指南 2026

搭载 Apple Silicon 芯片(M1、M2、M3、M4)的 Mac 是最适合本地 AI 的消费级电脑之一。统一内存让配备 64 GB 内存的 MacBook Pro 能够运行 70B 模型,而一台售价 2,000 欧元的游戏电脑则远远达不到这一水平。下面介绍如何在 3 分钟内开始使用。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 macOS 14+ 上测试

#为何选择Mac进行本地AI部署?

在普通 PC 上,GPU 的显存与 CPU 的内存在物理上是分开的。您有一块显存为 12 GB 的 RTX 4070?那么,模型可用的显存就只有 12 GB,即使您的系统内存有 64 GB 也一样。

在 Apple Silicon Mac 上,内存采用统一架构:GPU、CPU 和 Neural Engine 共享同一块 RAM。配备64 GB 内存的 MacBook Pro M3 Max 可以为模型分配48 GB——足以加载像 Qwen 3.6 35B-A3B 这样的大型全精度 MoE 模型,或轻松同时运行多个模型。

→
经验法则
macOS 会预留约25%的RAM用于系统。在16GB Mac上,可用约12GB;在32GB上,约24GB;在64GB上,约48GB。

#先决条件

Mac 套装

Ollama 在您的 Mac 上运行。Mac 套件通过自动启动、网络和日志配置(第 7 章),将它变成可靠的服务,并为它接入 Open WebUI(第 8 章),还会向您解释统一内存如何影响模型选择(第 2 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
macOS 12 Monterey或更新版本
推荐使用Sonoma (14) 或 Sequoia (15) 以获得最新的Metal优化
搭载 Apple Silicon 的 Mac
M1、M2、M3 或 M4——Pro、Max、Ultra,哪个版本都可以。Intel 机型不在官方支持范围内(运行较慢)。
至少需要16GB RAM
8GB足以运行3B模型,但内存紧张。16GB可支持8-9B模型,32GB可运行30B MoE模型(如Qwen 3.6 35B-A3B),64GB可支持全精度大模型
~20 GB 存储空间
适用于3到4个模型。模型文件将保存至~/.ollama/models。

#1. 安装

两种方法都很规范:使用官方 .dmg 安装包,或通过 Homebrew 安装。开发者更倾向于 Homebrew,其他用户则会选择最简单的方式。

#选项A — .dmg应用程序

官方下载
https://ollama.com/download/mac
  1. 01
    打开下载的 .dmg 文件
    将 Ollama.app 拖拽至您的「应用程序」文件夹,如同安装任何其他 Mac 应用程序一样。
  2. 02
    启动一次 Ollama.app
    首次启动时,macOS会要求确认("从互联网下载的应用")。点击"打开"。
  3. 03
    为命令行工具授权
    Ollama 会提示您安装 ollama 命令。请同意安装——随后会要求您输入管理员密码。
  4. 04
    菜单栏中会出现羊驼图标
    这是守护进程。您可以关闭欢迎窗口,它将继续运行。

#选项B——Homebrew

终端
brew install --cask ollama

更新更快。优势:当新版本发布时,使用 brew upgrade ollama 进行升级。

#验证

终端
ollama --version

#2. 您的第一个模型

在 16 GB Mac 上,从 Qwen 3.5 9B 或 Granite 4.2 8B 开始。在 32 GB 及以上机型上,可直接尝试 Qwen 3.8 27B 或像 Qwen 3.6 35B-A3B 这样的快速 MoE 模型。

Qwen 3.5 9B(所有配置 ≥16 GB)
ollama run qwen3.5:9b
Granite 4.2 8B(≥16 GB,内存较为宽裕)
ollama run granite4.2:8b
Qwen 3.8 27B(建议≥32 GB)
ollama run qwen3.8:27b
Qwen 3.6 35B-A3B MoE(≥32 GB,64 GB 下运行更从容)
ollama run qwen3.6:35b
i
首次下载
模型通过 Ollama CDN 下载(大小为数 GB)。根据您的网络连接情况,预计需要 2 至 10 分钟。后续再次启动时即可立即运行。

#3. 理解统一内存

macOS 会在各个应用之间动态分配 RAM。当 Ollama 加载模型时,系统会在需要时自动将其他内容移至 swap。因此,您可以加载比平时更大的模型,但代价是整体运行速度变慢。

要在模型运行时实时监控这一情况:

内存监控
top -o mem
!
过度使用交换空间 = 运行缓慢
如果在Ollama运行时,swap内存使用超过10 GB,说明您的模型对Mac来说过大。请降低模型尺寸或选择更激进的量化(如Q3而非Q4)。

#4. 检查 Metal 加速

Metal 是 Apple 平台上对应 CUDA 的技术:Ollama 通过这一 API 在 Mac 的集成 GPU 上执行计算。它默认启用,但还是值得检查一下。

已加载模型状态
ollama ps

在PROCESSOR列中,您应看到100% GPU。如果看到CPU,则说明存在问题——要么是不支持的模型,要么是Metal驱动程序过旧。

GPU 实时功耗
sudo powermetrics --samplers gpu_power -i 500

#5. 类 ChatGPT 的界面

日常使用时,一直用终端很快就会让人疲惫。Mac 上有三种不错的选择:

Enchanted(免费,App Store)
设计最为简洁利落。采用 SwiftUI 构建的原生应用,无需配置即可连接 Ollama。
Msty(免费,.dmg)
更完整:支持多模型、标签页、保存提示词、集成 RAG。
通过 Docker 运行 Open WebUI
如果您已经安装了 Docker,这个版本的功能最丰富(历史记录、Markdown、扩展)。
一句话介绍 Enchanted
open 'macappstore://apps.apple.com/app/enchanted-llm/id6474268307'

#6. 开机时启动 Ollama

默认情况下,如果您通过 .dmg 安装 Ollama,它会在您登录时自动启动。通过 Homebrew 安装时,则需要手动操作:

通过brew services实现自动启动
brew services start ollama

关闭:brew services stop ollama。查看状态:brew services list

#故障排除

安装后出现“ollama : command not found”
符号链接尚未创建。请启动一次 Ollama.app,并接受安装 CLI 的提示。
模型在中途崩溃
内存不足。请关闭 Chrome/Electron 后重新启动。如果仍不行,请选择占用更小的量化版本。
MacBook风扇全速运行
进行高强度推理时,这是正常现象。要缓解这种情况,可以使用更小的模型,或接通电源(MacBook 在电池供电时会降频)。
无法删除Ollama
停止守护进程:ollama stop。然后删除Ollama.app以及~/.ollama文件夹(包含所有下载的模型)
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。