入门 11 分钟Ollama

5 分钟内安装 Ollama(Windows、macOS, Linux)

直接回答

安装 Ollama 时,请从 ollama.com 下载安装程序(Windows、macOS 14 或更新版本),或在 Linux 下运行官方 curl 命令,然后输入 ollama run,后接模型名称。操作约需 5 分钟,不包括模型下载时间。无需 GPU:可用内存决定了能运行的模型大小。

本页面介绍如何在三个系统上安装 Ollama、开始前需要检查哪些事项、首先运行哪个模型,以及几项有助于避免意外问题的设置:模型存储在哪里、如何释放内存、哪些内容会留在本地。各系统的具体细节请参见相应的专门指南。

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows 11 上测试

#安装 Ollama:各操作系统的简明步骤

Ollama 是一个下载并本地运行开源语言模型的引擎,提供命令行接口和本地 API。它可在所有系统上通过单步安装完成。在 Windows 和 macOS 上,用户可从 ollama.com/download 下载应用程序;在 Linux 上,通过官方脚本安装程序和服务。之后,执行 ollama run suivie 命令并指定模型名称时,该命令首次调用会下载模型,随后开启对话。

各操作系统的 Ollama 安装方法(官方文档,2026 年 9 月)
系统方法Ollama 公布的前置要求
WindowsOllamaSetup.exe 安装程序,或 PowerShell 命令 irm https://ollama.com/install.ps1 | iexWindows 10 22H2 或更新版本;若使用 NVIDIA 显卡,需安装 NVIDIA 551.61 或更新版本的驱动程序
macOS将 ollama.dmg 文件拖入 Applications 文件夹,或运行 brew install ollamamacOS 14 Sonoma 或更新版本;Apple M 芯片(CPU 和 GPU)或 x86 芯片(仅 CPU)
Linuxcurl -fsSL https://ollama.com/install.sh | sh如需 GPU 加速,需使用 NVIDIA 550 或更新版本的驱动程序(AMD 则需使用 ROCm v7)

在这三种情况下,服务器都监听 http://localhost:11434,终端中也都可以使用 ollama 命令。以下各节将分别介绍各个系统,但不重复已有的专门分步指南,随后再介绍第一个模型。

#前提:什么样的设备,什么规模的模型

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

Ollama 几乎可在所有现代设备上启动;差异在于可接受的模型大小。限制因素是可用于模型权重的内存:专用显卡的显存、Mac Apple 芯片的统一内存,或在没有上述条件时使用系统内存,此时仅靠处理器运行,响应速度会更慢。

按模型大小列出的 Q4 量化内存需求参考(仅计权重)
模型大小模型权重所需内存合理的初始设备配置
3B约2 GB8 GB 内存的 PC,无 GPU
7-8B约5 GB16 GB 内存,或 8 GB 显存
14B约9 GBGPU 12 GB,或 Mac 16 GB
32B约 19-20 GBGPU 24 GB,或 Mac 32 GB
70B约40 GB配备 64 GB 或更多内存的 Mac,或配备多个 GPU 的机器

这些数值只计算模型权重。还需要加上上下文(KV 缓存)占用的内存,它会随对话长度增加而增长,同时还要为系统预留空间:5 GB 的模型可以在配备 8 GB RAM 的机器上运行,但没有余量再同时开着浏览器。关于如何选择量化方案,请参见 Q4、Q5 和 Q8 指南。

在磁盘空间方面,Ollama 文档指出,Windows 下的程序至少需要 4 GB,此外还要加上模型占用的空间;根据下载内容的不同,模型可能达到数十甚至数百 GB。最好使用内置 SSD:如果从速度较慢的外置磁盘加载模型,每次启动时都能明显感受到延迟。

→
没有 GPU:也能运行,但请选择小模型
仅使用 CPU 时,30 亿至 40 亿参数的模型仍可用于总结或撰写短文。没有加速器时,参数量一旦超过 70 亿至 80 亿,等待就会变得难以忍受。关于无 GPU 运行 LLM 的指南按 RAM 容量详细介绍了相应模型。

#在 Windows 上安装 Ollama

Ollama 作为一款原生 Windows 应用程序,支持 NVIDIA 和 AMD Radeon 显卡。安装完成后,它将在后台运行,用户可在 cmd、PowerShell 或其他终端中使用 ollama 命令。安装无需管理员权限,且默认安装至个人文件夹。

  1. 01
    下载
    在 ollama.com/download 页面选择 Windows 并下载 OllamaSetup.exe。该页面还提供了 PowerShell 命令 irm https://ollama.com/install.ps1 | iex,效果相同。
  2. 02
    启动安装程序
    双击文件。若要安装到用户主目录以外的位置,请运行该文件,并使用 /DIR 参数,后接路径,例如 OllamaSetup.exe /DIR="d:\dossier"。
  3. 03
    检查
    打开PowerShell并输入ollama --version。系统通知区域也会出现Ollama图标,位于时钟附近。
  4. 04
    检查 GPU 驱动
    使用 NVIDIA 显卡时,文档要求驱动版本为 551.61 或更高版本。对于 AMD 显卡,需使用 ROCm v7 或兼容 Vulkan 的 Radeon 驱动。
i
Windows 10 : 终端与字体
文档指出,进度条中的 Unicode 字符在某些 Windows 10 终端中可能显示为方块。修改终端字体可解决该问题,仅属外观调整,不影响下载过程。

有关 Windows 系统的完整逐步指南及故障排除,请参见专为 Windows 11 设计的指南。

#在 macOS 上安装 Ollama

Ollama 要求 macOS 14 Sonoma 或更新版本。Apple M 芯片可利用 GPU 进行计算;搭载 Intel(x86)处理器的 Mac 只能使用 CPU,因此仅适合非常小的模型。文档推荐的安装方法是挂载 ollama.dmg 文件,然后将应用拖入系统的 Applications 文件夹。

官方应用
首次启动时,应用程序会检查 ollama 命令是否在您的 PATH 中,若不在,则请求授权在 /usr/local/bin 创建符号链接。
Homebrew
Homebrew 提供 ollama 软件包(brew install ollama):已经安装 Homebrew 的用户可以通过终端安装,无需使用 .dmg 文件。
统一内存
在采用 Apple Silicon 的机器上,CPU 和 GPU 共享同一块内存:因此,一台配备 16 GB 内存的 Mac 可以加载 Q4 量化的 14B 模型,而配备 8 GB 显存显卡的 PC 则无法做到。

专为 macOS 设计的指南详细说明了根据 Mac 内存选择模型,以及在 Apple Silicon 上的实用设置。

#在 Linux 上安装 Ollama

在 Linux 系统上,只需一条命令即可完成。官方脚本会下载程序并将其配置为服务。

官方安装
curl -fsSL https://ollama.com/install.sh | sh

文档还提供了手动安装方式:将 ollama-linux-amd64.tar.zst 压缩包解压到 /usr(ARM 设备则使用 arm64 压缩包),AMD 显卡还需额外的 ROCm 压缩包;如果希望自动启动,再创建一个用户和 systemd 服务。更新时,只需重新运行安装脚本;OLLAMA_VERSION 变量可用于安装指定版本。

对于NVIDIA显卡,安装驱动并使用nvidia-smi检查,应能显示您的显卡。对于AMD显卡,文档要求安装ROCm v7驱动。专用Linux指南详细说明了systemd、权限和环境变量的设置。

#启动第一个模型

一旦 Ollama 安装完成,如果模型缺失,ollama run t 将下载所需模型,然后在终端中打开一个对话。首次调用取决于您的网络连接:3 到 5 GB 的模型需要几分钟时间,文件下载后会保留在磁盘上。后续调用无需重新下载,仅需在内存中加载。

首次启动
ollama run qwen3.5:4b

Qwen 3.5 系列已在 ollama.com 上发布,规模从 0.8b 到 122b 不等,不同版本支持视觉、工具调用和推理功能。带有 4b 标签的模型在 Q4 量化下只需几个 GB 的内存,因此几乎任何机器都能运行。如果您有 16 GB 内存,可以试试 8–9B 模型;上表提供了参考。本网站按显存容量选择模型的页面,可以帮助您进一步缩小选择范围。

→
退出对话
输入 /bye 退出。默认情况下,Ollama 会在最后一次请求后将模型保留在内存中 5 分钟,以加快再次运行的速度;执行 ollama stop 并在后面加上模型名称,即可立即将模型从内存中卸载。

#安装后的常用命令

ollama list
显示已下载的模型及其占用的磁盘空间。
ollama pull nom
下载模型而不运行它,方便在出行前预先准备多个模型。
ollama ps
显示当前加载到内存中的模型,以及每个模型是运行在 GPU 还是 CPU 上
ollama stop nom
立即释放模型内存,无需等待默认的5分钟。
ollama rm nom
删除一个模型以释放磁盘空间。
ollama serve
手动启动服务器,适用于Linux系统中服务未运行的情况。

后续操作(更新、彻底删除 Ollama 及其模型),请参见 Ollama 的维护指南。

#模型存储位置及如何迁移

模型文件很快会达到数十GB,系统盘通常不是最佳存储位置。官方常见问题解答中明确指出默认存储路径:macOS为~/.ollama/models,Linux为/usr/share/ollama/.ollama/models,Windows为C:\Users\%username%\.ollama\models。

要移动模型,请将环境变量 OLLAMA_MODELS 设置为所需文件夹。在 Windows 系统中,请从通知区域退出 Ollama,打开账户环境变量,创建该变量,然后重新启动应用程序。在标准 Linux 安装中,用户 ollama 需要对该文件夹具有读写权限:文档建议执行 sudo chown -R ollama:ollama 后跟文件夹路径。

#隐私:哪些内容会留在本地

在本地模式下,提示词和回复均保留在您的电脑上:Ollama 的 FAQ 指出,当您在本地运行模型时,公司看不到您的提示词或数据。所谓的云端模型则不同:它们会经过 Ollama 的服务器。如果您希望严格在本地使用,文档介绍了一种仅限本地运行的模式:设置变量 OLLAMA_NO_CLOUD=1,或在 ~/.ollama/server.json 中设置 disable_ollama_cloud。随后重启 Ollama。

默认情况下,服务器仅监听127.0.0.1的11434端口:您网络中的其他人无法向它发送请求。将OLLAMA_HOST改为0.0.0.0会使其向整个局域网开放,且没有身份验证。只有在防火墙或代理的保护下,才可这样设置。

#常见问题排查:五个高频问题

未找到命令
请关闭终端后重新打开:安装程序刚刚修改了 PATH。在 macOS 上,请重新启动应用程序,让它提示您在 /usr/local/bin 中创建链接。
未使用 GPU
启动一个模型后运行 ollama ps:处理器列会显示 GPU 或 CPU。更新驱动程序(Windows 下最低 NVIDIA 551.61,Linux 下 550),然后重新启动 Ollama。
Windows系统下无法识别AMD显卡
文档说明,部分 RDNA2 系统(RX 6000)在 Windows 下未提供 ROCm v7。此时,推荐使用默认启用的 Vulkan 作为备用方案。
端口 11434 被占用
另一个Ollama实例已经运行,或有其他程序占用了端口。请关闭该应用,然后重新启动。
使用网络代理时下载受阻
请使用 HTTPS_PROXY,避免使用 HTTP_PROXY:根据 FAQ,后者可能干扰客户端连接;代理证书必须安装为系统证书。
关于 Ollama 安装的常见问题
如何在Windows 10上安装Ollama?+
Ollama 要求 Windows 10 22H2 或更高版本,家庭版或专业版。请访问 ollama.com/download 下载 OllamaSetup.exe 并运行:无需管理员权限。随后打开 PowerShell 并输入 ollama --version。若使用 NVIDIA,请先安装 551.61 或更高版本的驱动程序,否则 Ollama 将回落至 CPU,响应速度会明显变慢。
Ollama 免费吗?+
本地使用是免费的:程序及其运行的开放模型都免费,您只需考虑设备的耗电成本。Ollama 另外还提供需要账户的云端模型服务,与在您自己的设备上运行模型不同;这是另一项独立服务,本指南无需使用。
使用 Ollama 是否需要 GPU?+
不需要。Ollama 仅靠 CPU 也能运行,但响应较慢,因此要获得流畅的使用体验,通常只能选择 30 亿至 40 亿参数的小模型。兼容的 NVIDIA 或 AMD 显卡,或搭载 Apple Silicon 的 Mac,能显著加快生成速度。随后请使用 ollama ps 检查模型实际加载在哪里。
Ollama 模型文件保存在何处?+
在 macOS 上为 ~/.ollama/models,Linux 上为 /usr/share/ollama/.ollama/models,Windows 上为 C:\Users\nom\.ollama\models。若要更改位置,请设置 OLLAMA_MODELS 环境变量,然后重启 Ollama 以使其生效。接着将现有模型复制到该目录,或选择从零重新下载,然后使用 ollama list 进行验证。
Ollama会将我的对话发送到互联网吗?+
在本地模式下不会:Ollama 表示,当模型在您的电脑上运行时,它不会看到您的提示词或数据。云端模型则会经过其服务器。设置 OLLAMA_NO_CLOUD=1 可禁用这些功能,使运行保持完全本地化;随后重启 Ollama 以应用该设置。
如何判断Ollama是否使用了我的GPU?+
启动一个模型,然后在第二个终端中输入 ollama ps。处理器列会显示模型在 GPU 或 CPU 上加载的比例。如果您有兼容的显卡,但该列显示 CPU,请更新驱动并重新启动 Ollama。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。