入门 7 分钟Ollama

Ollama 是什么以及如何运作(指南 初学者)

Ollama 是什么?它是在您自己的电脑上本地运行大语言模型(LLM)最简单的工具——无需云端、无需订阅,也不会向 OpenAI 发送任何一行内容。本指南从零开始介绍 Ollama 是什么、它如何下载和运行模型、您在 90% 的使用时间里会用到的三到四条命令,以及入门必需的基础知识。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#Ollama 是什么?

Ollama 是一个开源工具,可直接在您的计算机上下载、存储并运行语言模型(LLM)。您输入一条命令,模型就会加载到内存中,然后您可以与之对话——通过命令行,或通过连接到 Ollama 的图形界面。所有操作均在本地完成:模型下载后,不会有任何数据发送到互联网上。

具体来说,Ollama 同时承担两个角色:一个是守护进程(在后台运行的程序),另一个是与该守护进程通信的命令行工具(CLI)。守护进程监听您电脑上的 11434 端口,并提供一个小型 HTTP API——与 OpenAI 的 API 相同,或者说几乎相同。因此,所有兼容的界面(Open WebUI、客户端模式下的 LM Studio、Continue.dev 等)都可以直接连接,无需修改。

i
一句话总结
Ollama = 一个能够下载并运行开放权重 LLM 的本地守护进程,加上一个用于与之交互的命令行界面。其底层是经过妥善封装的 llama.cpp。您无需自行编译,也无需手动处理 GGUF 文件。

为什么如此多人选择它?因为它消除了本地大语言模型(LLM)的所有技术障碍:无需编译,无需手动配置GPU,无需管理Python版本。您只需安装并输入 ollama run qwen3.5:9b,即可立即运行。这相当于LLM的Docker:将模型及其运行环境打包成一个统一格式。

#内部运行机制

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

启动 Ollama 时,三个层次会协同工作。理解这三个层次,会显著提升您诊断问题的能力。

守护进程(ollama serve)
一个在后台运行的服务,监听 http://localhost:11434,并管理模型在内存中的加载与卸载。在 Windows 和 macOS 上,安装后会自动启动。在 Linux 上,通常以 systemd 服务形式运行。
推理引擎(llama.cpp)
这是运行模型的核心。Ollama 内置了预编译版本,支持 CUDA (NVIDIA)、Metal (Apple Silicon) 和 CPU。您无需进行任何编译操作。
命令行界面(ollama)
您调用的命令行程序。它本身功能有限:向服务进程发送HTTP请求并显示响应结果。

当您输入 ollama run qwen3.5:9b 时,实际发生的过程如下:命令行界面(CLI)请求守护进程加载该模型;如果磁盘上没有这个模型,守护进程就会从 Ollama 模型仓库下载它(有点像 Docker Hub);如果您有兼容的 GPU,就将模型加载到显存中,否则加载到系统内存中;然后开启一个交互式聊天会话。所有繁重的工作都由守护进程完成——CLI 只是一个客户端。

→
端口 11434
这是大家普遍使用的 HTTP 端口。如果某个应用声称“连接到您的 Ollama”,它连接的就是 http://localhost:11434。如果 Ollama 已启动,在浏览器中打开这个 URL,就会看到 Ollama is running 这条消息。这是最简单的健康检查。

#命令:run、pull、list

三条命令覆盖90%的使用场景。掌握它们,其余内容将显而易见。

#ollama run

需优先掌握的命令。该命令会下载模型(如果尚未存在),将其加载到内存中,然后在终端中启动交互式对话。

终端
ollama run qwen3.5:9b
# Première fois : télécharge ~6.6 Go puis lance le chat
# Fois suivantes : charge le modèle déjà présent et démarre

进入会话后,输入您的问题并按回车键。要退出,请输入 /bye 或按 Ctrl+D。要切换到多行模式,请以三个双引号(""")开头。所有以 / 开头的内容都是内部命令(/show、/set、/clear、/save、/load)。

您也可以直接将提示词作为参数传入——适用于脚本调用:

单次提示(prompt one-shot)
ollama run qwen3.5:9b "Résume ce texte en 3 points : [...]"

#ollama pull

下载模型而无需启动。适用于您希望提前准备多个模型,或获取特定版本(大小、量化)的情况。

终端
ollama pull granite4.2:3b
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

名称采用 modele:tag 格式。不带 tag 时,将获取默认版本(通常为 Q4_K_M 量化的 8B/9B 模型)。显式指定 tag 后,可选择模型大小(2b、4b、9b、27b、30b)和量化方式(q4_K_M、q5_K_M、q8_0、fp16)。

i
量化简介
一个“原始”模型在 FP16 下,70 亿参数重达 14 GB。量化将这些数值压缩到更少的位数:Q4_K_M(4 位)将体积缩小约 4 倍,且质量损失极小。这是推荐的入门甜点区。Q5_K_M 质量稍好,Q8_0 近乎完美但体积重 2 倍,FP16 则留给高性能 GPU。

#ollama list

显示本地机器上已安装的模型、其磁盘占用大小及安装日期。

终端
ollama list
# NAME               ID            SIZE    MODIFIED
# qwen3.5:9b         42182419e950  6.6 GB  2 days ago
# granite4.2:8b      f974a74358d6  5.3 GB  1 week ago

#其他有用的命令

ollama ps
显示当前已加载到内存中的模型(以及它们占用的显存和系统内存)。诊断“运行卡顿”问题时必不可少。
ollama rm <modele>
从磁盘中删除一个模型。当模型文件夹大小达到50 GB时,此操作非常有用。
ollama show <modele>
显示模型的元数据:上下文长度、量化方式、提示模板、能力(工具、视觉等)
ollama serve
手动在前台启动守护进程。适用于 Linux 或故障诊断(可以实时查看日志)。
ollama create
根据 Modelfile 创建自定义模型——Modelfile 相当于 LLM 的 Dockerfile。这属于较进阶的内容。

#模型存储位置

模型文件可能有数 GB 大小。了解它们的存储位置,对于清理文件、将模型库移到另一块磁盘或进行备份至关重要。

Windows
%USERPROFILE%\.ollama\models — 通常为 C:\Users\votrenom\.ollama\models
macOS
~/.ollama/models
Linux(官方脚本安装)
/usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
Linux(用户手动安装)
~/.ollama/models

该文件夹内包含两个子文件夹:blobs(模型的二进制文件,由哈希值标识)和manifests(描述哪个blob对应哪个标签的元数据)。请勿手动编辑这些文件——请使用 ollama rm et ollama pull pour 进行管理。

→
将模型移动到其他磁盘
如果您的系统 SSD 容量较小,而另一块磁盘容量更大,请设置环境变量 OLLAMA_MODELS,将模型存储位置指向别处。例如:Windows 下使用 OLLAMA_MODELS=D:\ollama-models,Linux 下使用 export OLLAMA_MODELS=/mnt/data/ollama-models。重启守护进程,使该变量生效。

#启动所需的最低配置

‘什么是 Ollama 以及我的机器能否运行它?’这个问题总是被反复提及。以下为真实门槛,而非营销所宣称的最低要求。

RAM 8 GB,无GPU
仅适用于2-3B参数的模型,Q4格式(Qwen 3.5 2B,Granite 4.2 3B)。在现代CPU上约为5到10个令牌/秒。可用于测试和学习。
16 GB 内存,无GPU
8B 模型使用 Q4 量化后可以运行(Granite 4.2 8B、Qwen 3.5 9B)。预计速度为每秒 4–8 个 token。对于持续的交互式使用来说速度较慢,但确实能运行。
GPU 显存 8 GB
运行 Q4 量化的 8B 模型较为轻松(Qwen 3.5 9B、Granite 4.2 8B——30–50 token/秒)。运行 12–14B 模型时便达到极限。
配备 12 GB 显存的 GPU(RTX 3060、4070)
2026 年入门配置的最佳平衡点。所有 8B 模型都能流畅运行,Gemma 4 12B 在 Q4 量化下也能轻松运行;或者选择 Q8 量化的 Qwen 3.5 9B,以获得这一档配置下的最佳质量。
配备 16 GB 显存的 GPU(RTX 4080、5080),或配备 32 GB 统一内存的 Mac M-Pro
可以升级到 Q4 量化的 24B 模型(Mistral Small 24B、Devstral 24B、gpt-oss 20B),或选择 Q8 量化的 Qwen 3.5 9B,以获得更高质量。
24 GB 显存的 GPU(RTX 3090、4090)或配备 48 GB 及以上内存的 Mac M-Max
可以较为流畅地运行27–35B模型(Qwen 3.8 27B、Qwen 3.6 35B-A3B);如果愿意多等一会儿,也能运行Q4量化的大型MoE模型。

磁盘空间方面,每个7B模型在Q4量化下需预留10 GB,每个32B模型需预留30 GB。初始时预留50至100 GB空闲空间,可避免过早进行清理操作。

!
“检测到 GPU”却未实际使用的陷阱
在 Windows 和 Linux 上,Ollama 会自动检测 GPU——除非您的 NVIDIA 驱动程序过旧,或您使用 AMD GPU 却未正确安装 ROCm。请使用 ollama ps 检查:如果您有 GPU,但 PROCESSOR 列显示 100% CPU,则硬件加速尚未启用。在搭载 Apple Silicon 的 macOS 设备上,Metal 加速会自动启用,并始终处于启用状态。

#推荐的第一个模型

刚接触 Ollama 时,人们往往会想试试能运行的最大模型,“看看效果”。这是个错误——显存会被占满,部分模型会转移到系统内存中运行,速度变慢,最后您就放弃了。请从小模型开始。

  1. 01
    Qwen 3.5 9B — 合理的默认选择
    ollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
  2. 02
    Granite 4.2 8B —— 节省资源的替代之选
    ollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
  3. 03
    Qwen 3.5 4B —— 日益受欢迎的小型多面手
    ollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
  4. 04
    Granite 4.2 3B —— 如果您的设备配置较低
    ollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
→
在聊天过程中运行ollama ps
与模型对话时,在另一个终端中运行 ollama ps。您会看到已加载的模型、内存使用量以及 GPU/CPU 的分配情况。这是具体了解实际运行情况的最佳方式。

#技巧与陷阱

模型在闲置 5 分钟后会自动从内存中卸载
这是 OLLAMA_KEEP_ALIVE 的默认值。如果您希望模型在 VRAM 中驻留更久,请设置 OLLAMA_KEEP_ALIVE=2h(或设为 -1,表示永不卸载)。相反,若希望在请求结束后立即释放 VRAM,请设为 0。
回答在几句话后被截断
默认的 num_ctx(上下文窗口)参数为 4096 个 token,无论模型支持多少。对于 RAG 或长文档使用,创建一个包含 PARAMETER num_ctx 32768 的 Modelfile,并执行 ollama create。注意,VRAM 的消耗会迅速增加。
不支持shell自动补全
输入 ollama help 查看所有命令,输入 ollama help <commande> 查看各个命令的详细信息。文档就在 CLI 中。
来自网络其他设备的连接被拒绝
默认情况下 Ollama 仅监听 127.0.0.1。若需在局域网暴露服务,请在启动服务前设置 OLLAMA_HOST=0.0.0.0:11434。请注意防火墙设置。
相同模型名称,多个版本
ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
i
5 分钟搭建图形界面
命令行界面足以帮助您理解其工作方式,但日常使用时,可以将 Open WebUI(类似 ChatGPT 的网页界面)或客户端模式下的 LM Studio 连接到 Ollama 守护进程。这些工具会自动检测 localhost:11434 上的服务器,并在简洁的界面中展示您的所有模型。

#深入了解

您已经了解了 Ollama 是什么,以及它的基本工作原理。接下来可以顺着以下方向继续探索:

真正安装到您的操作系统中
《在 Windows 上安装 Ollama》(或 macOS、Linux 对应指南)会逐步介绍如何在干净的环境中完成安装、检查 GPU 并运行第一个模型。
选择合适的量化
《选择量化方式(Q4、Q5、Q8、FP16)》指南直观比较实际的质量损失,帮助您在模型质量与显存占用之间做出权衡。
连接真正的图形界面
按照《Open WebUI 与 Ollama》指南,您可以在 10 分钟内,在现有的 Ollama 守护进程之上搭建一个类似 ChatGPT、支持多用户且内置 RAG 的界面。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。