进阶 10 分钟Gemma

使用 Ollama 在本地运行 Gemma 4:安装、显存、 perfs

Gemma 4 是 Google 于 2026 年推出的新一代开放权重模型。它原生支持多模态和长上下文,采用 Apache 2.0 许可证,Ollama 模型库中提供三种实用规格:E2B(紧凑型)、12B 和 26B-A4B(MoE 混合专家模型)。本指南将介绍如何通过 Ollama 运行 Gemma 4、如何根据您的显存选择量化方式、RTX 和 Apple Silicon 上以 token/s 衡量的速度大致处于什么水平,以及相比 Gemma 3 具体有哪些变化。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为何选择在本地运行 Gemma 4?

Gemma 4是同等规模的开放权重模型中法语表现最好的模型之一。12B Q4模型可以较为轻松地装入8至12GB显存,适用于RTX 3060、4070或Mac M系列中端机型。26B-A4B是一个仅激活40亿参数的混合专家模型,能利用24GB显存的显卡(3090、4090、7900 XTX)和配备充裕统一内存的Mac,同时保持较快的运行速度。对于法语助手、RAG和通用编程,它是一个很好的默认选择。

在本地运行它的另一个原因是:自 2026 年 4 月起,Gemma 4 采用 Apache 2.0 许可证发布,解除了旧版 Gemma Terms of Use 的限制(可自由用于商业用途、再分发和微调);而 Ollama 负责模型拉取、量化和推理,无需直接操作 Python、CUDA 或 llama.cpp。

i
简而言之
Gemma 4 + Ollama:一条命令下载模型,一条命令开始对话,再加上 localhost:11434 上兼容 OpenAI API 的端点。其余都只是设置。

#与Gemma 3相比的差异

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

Gemma 3(2025 年 3 月)带来了多模态能力和 128k 上下文。Gemma 4 保留了这些能力,并在三个方面进一步提升:质量(推理和代码基准测试显示出大幅提升)、效率(12B 模型在许多任务上能更好地替代 Gemma 3 的 27B 模型,而采用 MoE 架构的 26B-A4B 能以小模型的速度提供相当于大模型的能力),以及分词器(词表更紧凑,在生成相同内容时所需的 token 更少——因此每秒能生成更多有用的 token)。

大小
Gemma 3:1B、4B、12B、27B(稠密模型)。Gemma 4:E2B(紧凑型)、12B(稠密模型)和 26B-A4B(MoE,活跃参数为 4B)。这一系列着重提升效率,而不是单纯扩大参数规模。
多模态
12B 和 26B-A4B 原生具备视觉能力(文本 + 图像)。E2B 仍是面向文本的紧凑版本。
上下文
整个系列均支持 128k token。内存限制与之前相同:KV 缓存会迅速占用大量内存。
Tokenizer
SentencePiece,词汇表经过调整,以更好地覆盖法语、代码和使用非拉丁文字的语言。对于等效的提示词,token 消耗约减少 5% 至 15%。
许可证
自2026年4月起采用 Apache 2.0 许可证。可自由用于商业用途、再分发和微调,没有专门的可接受使用条款——与 Gemma 3 的 Gemma Terms of Use 相比,这是一个实质性的变化。
→
何时保留 Gemma 3
如果您已经在 Gemma 3 12B 上搭建了成熟的 RAG 流水线且质量已满足需求,则无需迁移。Gemma 4 12B 性能更优,但其 VRAM 轻微增加(约 8 GB 对比 Q4 下约 7 GB)以及提示词重新调优的代价,仅在您接近 Gemma 3 的 12B 参数上限时才值得。

#先决条件

Ollama 已安装
较新的版本(≥ 0.5)。如果尚未安装,请参阅 Windows、macOS 或 Linux 的安装指南。
磁盘空间
E2B 模型约 4.3 GB,12B Q4 模型约 7.6 GB,26B-A4B Q4 模型约 19 GB。12B 和 26B 的 Q5 及 Q8 变体重量分别高出 1.3 到 2 倍。
VRAM或统一内存
实际最低需求:E2B 需要 6 GB,Q4 量化的 12B 需要 8–12 GB,Q4 量化的 26B-A4B 需要 24 GB。低于这些容量时,部分模型运算会转由 CPU 承担,速度会大幅下降。
GPU驱动程序已更新
CUDA 12.x 适用于 NVIDIA,ROCm 6.x 适用于 AMD,Metal 原生支持 Apple 芯片。Ollama 可自动检测后端。

#1. 通过一条命令完成拉取与启动

Gemma 4 的 Ollama 标签遵循通常的命名规则:gemma4(latest 默认指向 12B Q4)、gemma4:e2b-it-qat、gemma4:12b、gemma4:26b。要明确指定量化方式,可以添加后缀:gemma4:12b-instruct-q4_K_M。

直接拉取并启动
ollama run gemma4:12b

首次运行时,Ollama 会下载模型(12B Q4 约为 7.6 GB),然后直接打开交互式命令提示符。之后,只要模型仍保留在内存缓存中,就能即时启动。

仅拉取(不启动)
ollama pull gemma4:e2b-it-qat
ollama pull gemma4:12b
ollama pull gemma4:26b
i
明确选择量化方式
默认情况下 Ollama 使用 Q4_K_M,这是在 95% 情况下质量与内存之间的最佳平衡。进一步优化:gemma4:12b-instruct-q5_K_M(质量略有提升,VRAM 增加 25%),gemma4:12b-instruct-q8_0(接近 FP16,VRAM 增加 100%)。E2B 则直接以 QAT int4 形式分发(gemma4:e2b-it-qat),无其他更重的版本具有实际意义。纯 FP16 仅在微调时有用途。

要实时查看显存中加载了哪些内容:

已加载模型状态
ollama ps

PROCESSOR 列应显示 100% GPU。如果看到 70%/30% GPU/CPU,说明模型无法完全放入显存——请采用量化程度更高的方案,或换用小一档的模型。

#2. 不同模型大小和量化方式下的显存需求

以下数值包含模型权重,以及用于 8k token 上下文窗口的 KV 缓存(这是 Ollama 的默认设置)。若要扩展至 32k 或 128k,需根据模型大小额外预留 2 至 8 GB 内存。

Gemma 4 E2B — QAT int4
≈ 4.5 GB 显存。紧凑版本(QAT,约20亿激活参数,类似MatFormer)。可运行在任意 GTX 1660(6 GB)、RTX 3050(8 GB)或 8 GB 统一内存的 Mac 上。
Gemma 4 12B — Q4_K_M
≈ 8 GB 显存。适合的硬件:RTX 3060 12 GB、4070 12 GB、5070 12 GB、Mac 16 GB 及以上。
Gemma 4 12B — Q5_K_M
约需 9.5 GB 显存。上下文较短时可装入 12 GB 显存,使用 16 GB 显存则余量更充足(4070 Ti Super、5080)。
Gemma 4 12B — Q8_0
约需 13 GB 显存。仅适用于显存为 16 GB 及以上的显卡,或内存充足的 Apple Silicon 设备。
Gemma 4 26B-A4B — Q4_K_M
≈ 19 GB 显存。最佳适配:RTX 3090、4090、5090、RX 7900 XTX、Mac Studio。MoE:仅加载4B激活参数,因此运行速度快,尽管显存占用较大。
Gemma 4 26B-A4B — Q5_K_M
约需 23 GB 显存。已接近 24 GB 显存配置的上限;否则应考虑配备至少 48 GB 统一内存的 Mac,或多 GPU 配置。
Gemma 4 26B-A4B — Q8_0
约需 30 GB 显存。适用于显存容量为 32 GB 及以上的显卡(RTX 5090),或配备 48 GB 及以上统一内存的 Mac。
!
128k 上下文的陷阱
在 12B 模型上启用最大上下文窗口(num_ctx=131072),可能会使 KV 缓存增加 4 至 6 GB。如果采用 Q4 量化、上下文为 8k 时就已经勉强装得下,那么扩展到 32k 时就会超出容量。请逐步增加上下文长度,并留意 ollama ps 的输出。

#3. 每秒 token 数:RTX 和 Apple Silicon

以下是在较新版本的 Ollama 上观察到的大致性能水平,测试条件为 8k 上下文、短提示词、生成 200 个 token。数值会随生成内容和 Ollama 版本的不同而波动 ±15%。26B-A4B 是 MoE 模型(4B 激活参数),一旦装入内存,运行速度就比 26B 的稠密模型快得多。

RTX 3060 12 GB
Gemma 4 E2B:约 90 tok/s。Gemma 4 12B Q4:约 28 tok/s。26B-A4B:所需显存超出容量(19 GB),应避免使用。
RTX 4070 12 GB
E2B:~130 tok/s。12B Q4:~46 tok/s。26B-A4B:超出容量。
RTX 4080 Super 16 GB
12B Q4:约 66 token/秒。12B Q8:约 40 token/秒。26B-A4B:16 GB 显存装不下。
RTX 4090 24 GB
12B Q4:~100 tok/s。26B-A4B Q4:~58 tok/s。26B-A4B Q5:~50 tok/s。
RTX 5090 32GB
12B Q4:~150 个 token/秒。26B-A4B Q4:~88 个 token/秒。26B-A4B Q8:~48 个 token/秒。
Mac M3 Max 64 GB
12B Q4:~38 tok/s。26B-A4B Q4:~30 tok/s。得益于统一内存,运行稳定。
Mac M4 Pro 48 GB
12B Q4:约 34 tok/s。26B-A4B Q4:约 24 tok/s。MoE 模型能轻松装下,就其规模而言,运行速度仍然很快。
Mac M4 Max 128 GB
26B-A4B Q4:约 36 tok/s。26B-A4B Q8:约 20 tok/s。这是日常运行 26B 模型最游刃有余的 Mac。
→
实用提示
超过 30 token/秒时,交互使用很流畅。介于 15 和 30 token/秒时,聊天仍算可用,但生成较长内容时会让人觉得慢。低于 10 token/秒时,建议只用于批处理,或那些本来就需要等到完成的任务。

#4. 第一个提示词与实用设置

Gemma 4 无需特殊的系统提示词,就能很好地用法语回答,但仍值得根据使用场景调整几个参数。

快速测试
ollama run gemma4:12b
>>> Explique la différence entre un index B-tree et un index hash en SQL, en 5 lignes.

要在交互式命令提示符中即时调整参数:

会话参数
/set parameter temperature 0.3
/set parameter num_ctx 16384
/set parameter num_predict 800
temperature
默认值为0.7。若需事实性内容、代码或RAG,可降低至0.2-0.4;若用于头脑风暴,则可提升至0.9-1.1。
num_ctx
上下文窗口。默认值为 4096 或 8192,具体取决于构建版本。请根据您的使用场景和可用显存增大该值。
num_predict
生成的最大标记数。-1表示无限制(直到停止)。可用于限制回复长度。
repeat_penalty
默认值为 1.1。如果 Gemma 4 陷入重复循环,可调高至 1.15–1.2。如果回复显得过于书面化,可调低至 1.05。
i
保留设置
要固定系统提示词和参数,请创建一个 Modelfile:先写 FROM gemma4:12b,再写 SYSTEM "..."、PARAMETER temperature 0.3 等。运行 ollama create monassistant -f Modelfile,之后即可像调用普通模型一样调用 monassistant。

#5. 通过 API 与代码集成

Ollama 提供一个兼容 OpenAI 的端点,地址为 http://localhost:11434/v1 。任何支持 OpenAI 接口的 SDK,只需将 base_url 指向您本地的地址,就能使用。

Python — openai SDK
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # valeur ignorée, mais le SDK l'exige
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[
        {"role": "system", "content": "Tu réponds en français, de manière concise."},
        {"role": "user", "content": "Résume la photosynthèse en 3 lignes."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

对于多模态版本(12B 和 26B-A4B),图像可通过 base64 编码或本地 URL 在消息中传入——与 GPT-4o 使用的协议相同。

通过 curl 实现视觉功能
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:12b",
  "prompt": "Décris cette image en français.",
  "images": ["'"$(base64 -w0 photo.jpg)"'"],
  "stream": false
}'

#故障排除

"Error: model gemma4 not found"
该标签在您当前版本的 Ollama 中尚不存在,或为拼写错误。请使用 ollama list 检查已安装的模型,并查阅 Ollama 库的官方文档以获取官方标签列表。
模型部分卸载到CPU
ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
运行几小时后速度降至三分之一
使用某些驱动程序时,KV 缓存会发生碎片化。请重启 Ollama 服务(Linux 上执行 sudo systemctl restart ollama,Mac/Windows 上重启应用)。
响应在约 400 词后被截断
num_predict 过低。请设置为 2048 或 -1(无限),并相应地增加 num_ctx。
E2B的法语表现不够准确
这是正常现象:E2B 相对于自身规模而言性能很强,但仍然是一个小型变体。如果您对法语表现要求较高,请选择 12B。
RTX 4060 8 GB 显存下 12B 模型出现 OOM
12B Q4 模型刚好能装入 8 GB 显存,没有留给上下文的余量。要么选择 gemma4:e2b-it-qat,要么接受卸载到 CPU(约 3–5 tokens/s),要么更换显卡。

#深入了解

您的 Gemma 4 已经运行起来了。根据您想用它做什么,下面提供一些进一步探索的方向:

Ollama 是什么以及它如何工作
如果您刚开始接触 Ollama,这份入门指南将介绍核心命令,并帮助您完整理解它的工作方式。
选择量化方案(Q4、Q5、Q8、FP16)
要准确理解从Q8转为Q4所付出的代价,以及这种代价在何时真正产生影响。
使用 Ollama 的 Open WebUI
为 Gemma 4 提供类似 ChatGPT 的界面:对话历史、内置 RAG、多用户共享。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。