入门 9 分钟Ollama

Gemma 3(Google)本地部署:完整指南 2026

Gemma 3 是 Google 于 2025 年 3 月发布的开放权重模型系列。该系列提供四种规模(1B、4B、12B、27B),从 4B 版本起集成视觉能力,上下文长度为 128k,并具备扎实的多语言支持,法语表现也尚可。本指南逐步介绍如何通过 Ollama 在本地安装 Gemma 3、需要了解的 Google 许可证条款,以及该模型真正表现出色的场景。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为何选择 Gemma 3?

Gemma 3 是 Google DeepMind 开放权重模型的第三代,与 Gemini 源自同一研究基础。该系列涵盖四种差异明显的规模——从 1B 到 27B 参数——可精确匹配您手头的硬件档位,从没有 GPU 的笔记本电脑到配备 24 GB 显存的工作站。

三项关键特性使 Gemma 3 在该类别模型中脱颖而出:支持 128k 上下文长度(1B 版本仅支持 32k);从 4B 版本起即内置多模态视觉能力,无需额外加载独立模型;以及对多语言能力的明确优化(Google 文档宣称 4B 及以上版本覆盖 140 多种语言)。

i
简而言之
Gemma 3 是 Google 的“多面手”模型系列。它并非某项基准测试中最强的系列,但属于功能最全面的系列之一:4 种规模、视觉能力、长上下文和多语言支持。非常适合作为一台机器上的默认模型。

#4种大小 Gemma 3

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

选择合适的规模是最重要的决定。以下是使用场景与硬件的对应关系:

gemma3:1b
仅支持文本,上下文长度为 32k。适用于纯 CPU 运行、Raspberry Pi 5 或配备 8 GB 内存的 Mac M1。质量有限,但能即时回应。适合分类和简短改写。
gemma3:4b
多模态(文本 + 图像),上下文长度 128k。“笔记本电脑”档位:可轻松容纳于 6 GB 显存,或配备 16 GB 内存的 Mac M2/M3。处理通用任务时,输出质量尚可。
gemma3:12b
多模态,128k 上下文。“中端 PC”档位:RTX 3060 12 GB、4070、M3 Pro 18 GB。质量确实足以满足日常使用。
gemma3:27b
多模态,上下文长度为 128k。「工作站」档位:RTX 3090/4090、M3 Max。最好的 Gemma 3,在许多任务上可与更高档次的模型相媲美。
→
如果您拿不定主意
先从 4B 模型开始。这是具备视觉能力和 128k 上下文的最小模型,几乎可以在任何设备上运行。等您弄清楚它的质量是否足够满足需求后,再升级到 12B 或 27B。

#VRAM 要求(量化 Q4_K_M)

gemma3:1b
≈ 1 GB 显存或内存。可在任意设备上运行,包括 Raspberry Pi 5。
gemma3:4b
≈ 3 GB VRAM。RTX 3050 6 GB、GTX 1660 6 GB、MacBook Air M2 8 GB均可满足。
gemma3:12b
约需 8 GB 显存。RTX 3060 12 GB、RTX 4070 12 GB,或配备 18 GB 统一内存的 Mac M3 Pro。
gemma3:27b
Q4 量化下约需 17 GB 显存。RTX 3090/4090 24 GB,或配备至少 36 GB 内存的 Mac M3/M4 Max。Q3 量化下(质量有所下降),16 GB 也能运行。

根据您实际使用的上下文长度,还需为 KV 缓存预留约 1–4 GB。加载一个 27B 模型的完整 128k 上下文,所需显存会超过仅加载模型本身所需的显存。

#1. 使用 Ollama 在本地安装 Gemma 3

如果 Ollama 尚未安装,请先按照 Ollama 安装指南为你的操作系统进行安装。一旦 Ollama 运行起来,下载 Gemma 3 只需一条命令。

终端
ollama run gemma3:4b

Ollama 下载模型(4B Q4版本约3.3 GB),然后直接以交互模式启动。当出现提示 >>> 时,即可进行测试。

只拉取,不运行
ollama pull gemma3:1b
ollama pull gemma3:4b
ollama pull gemma3:12b
ollama pull gemma3:27b

Ollama 守护进程在 http://localhost:11434 上监听——您可以将 Open WebUI、作为客户端使用的 LM Studio、Continue.dev 或任何兼容 OpenAI 的客户端连接到它。

→
选择合适的量化
默认标签(例如:gemma3:12b)指向 Q4_K_M,这是大多数使用场景下质量与内存之间的最佳平衡。若需更高质量,需以更多 VRAM 为代价,可使用 gemma3:12b-it-q5_K_M 或 q8_0。

#2. 多语言支持及法语质量

与以英语为中心的小型模型相比,Google 在多语言方面的工作仍是 Gemma 3 的一大优势。法语在训练语料中占有充分的比例,因此您几乎不会看到模型在回答过程中切换成英语,而这仍是更小模型的常见缺陷。2026 年的新一代模型(Qwen 3.5、Granite 4.2)在法语能力上已迎头赶上,但 Gemma 3 在这方面依然能与它们竞争。

Gemma 3 4B
处理简单任务(摘要、改写、分类)时,法语表现尚可。进行长篇写作时,措辞有时仍不够自然。
Gemma 3 12B
达到“可用的法语助手”水平。语法掌握良好,词汇丰富,不必要的英语词汇或表达较少。在这一指标上与 Qwen 3.5 9B 相当。
Gemma 3 27B
法语表现很好。写作能力与 Mistral Small 24B 相当,形式推理略逊一筹,但在表达的细腻程度和文风上往往更胜一筹。
法语快速测试
>>> Résume en 3 points clés les enjeux de la souveraineté numérique européenne.

1. **Dépendance technologique** : 80% du cloud européen repose sur trois acteurs américains...
2. **Conformité réglementaire** : le RGPD et l'AI Act créent un cadre que les fournisseurs hors-UE...
3. **Capacité industrielle** : la course aux semi-conducteurs et aux modèles d'IA...

#3. 集成多模态视觉功能

从4B版本开始,Gemma 3 支持输入图像——无需单独加载视觉模型。同一二进制文件支持文本和视觉处理,并内置SigLIP编码器。适用于OCR、图像描述或屏幕截图分析。

Ollama CLI:使用图片
ollama run gemma3:12b
>>> Décris cette capture d'écran et identifie les éléments d'interface : /chemin/vers/screenshot.png

在Python API中,可将图像以base64格式传递,或通过本地路径传入:

Ollama Python API
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{
        'role': 'user',
        'content': 'Extrais le texte visible sur cette facture.',
        'images': ['/chemin/vers/facture.jpg'],
    }]
)
print(response['message']['content'])
i
视觉能力的实际表现
Gemma 3 的视觉能力在一般描述、清晰文档的 OCR 和界面阅读方面表现尚可。对于模糊照片或手写内容的 OCR,像 Qwen 3.8 27B(视觉)这样更新、更大的视觉模型仍然表现更好。对于复杂的空间推理(物体计数、理解技术图示),各方面都还有改进空间——所有开放权重 LLM 都是如此。

#4. 128k上下文的实际应用

Gemma 3 的 128k 上下文(除 1B 版本受限于 32k)足以处理一本短书、一份完整的文档资料或数小时的语音转录。默认情况下,Ollama 加载的上下文要短得多(通常为 4k 或 8k),以节省 VRAM——您需要显式扩展上下文长度。

通过CLI扩展上下文
ollama run gemma3:12b
>>> /set parameter num_ctx 32768

或通过 API,在请求时传入 num_ctx 参数:

通过API实现扩展上下文
import ollama

response = ollama.chat(
    model='gemma3:12b',
    messages=[{'role': 'user', 'content': 'Résume ce document : ...'}],
    options={'num_ctx': 32768},
)
!
上下文会消耗 VRAM
每个上下文 token 都会占用 KV 缓存所需的内存。在 12B 模型上,将上下文长度从 8k 扩展到 128k,可能会增加 4–6 GB 的 VRAM 占用。如果显存占满,模型就会转为将部分计算卸载到 CPU,速度会骤降。请根据实际需求逐步扩展:16k → 32k → 64k。

#Gemma 许可证:需要了解的内容

Gemma 3 并不像 Mistral、Qwen 或 DeepSeek 那样采用 Apache 2.0 或 MIT 许可证。Google 使用自己的许可证:“Gemma Terms of Use”。它允许商业使用,包括分发衍生模型,但施加了两项真正自由的许可证所没有的限制。

禁止用途政策
您必须遵守 Gemma Prohibited Use Policy(Gemma 禁止用途政策):不得生成儿童性虐待材料(CSAM),不得公然侵犯权利等。Google 可单方面修订这份清单。
许可条款的传递
如果您再次分发该模型(或其衍生版本),必须向用户提供 Gemma 许可协议,并要求他们接受相同的限制。
不采用‘copyleft’协议
您调用 Gemma 3 的应用程序不会因此继承该许可证的约束。只有重新分发的权重才受这些约束。
!
用于专业用途
如果只是在内部 SaaS 或产品中使用(最终用户始终接触不到权重),使用 Gemma 3 没什么问题。如果要发布微调版本,或将 Gemma 3 集成到随权重一起分发的开源产品中,请先阅读许可证——此时,它与真正宽松的许可证之间的差异就会变得显著。值得注意的是,Google 已将下一代 Gemma 4 改为采用 Apache 2.0 许可证(2026 年 4 月)——如果权重再分发是您关注的问题,这一许可证恰好解除了上述限制。

#Gemma 3 27B 与 Llama 4 Scout 对比

两个模型都定位于“可在本地运行的高端模型”这一细分领域。要做出选择,需要比较它们真正的差异:

架构
Gemma 3 27B 是一个稠密模型(270 亿个参数全部处于激活状态)。Llama 4 Scout 是一个 MoE 模型(170 亿个激活参数,总计 1090 亿个参数)——在显存容量相同且模型能装入显存的情况下,性能强得多,但需要能够加载所有专家。
最小 VRAM 要求
Gemma 3 27B Q4:约 17 GB。Llama 4 Scout Q4:约 60 GB(所有专家均已加载)。在单张 RTX 4090 上,只有 Gemma 3 27B 能完整装入显存并留有充足余量。
上下文
Gemma 3:128k。Llama 4 Scout:10M(理论值,实际可用的上下文更小)。如果您确实需要处理超过 128k token 的内容,Scout 更有优势。
视觉
两者均原生支持多模态。在通用任务上的表现相当。
FR
Gemma 3 在日常法语中表现略优。Llama 4 Scout 在形式推理和编程方面更强。
许可证
Gemma 使用条款与 Llama 4 社区许可证。两者均不符合 OSI 标准,但都可用于商业用途,须遵守各自的特定限制。
→
结论
单张配备 24 GB 显存的 GPU:选择 Gemma 3 27B。在 Mac Studio Ultra 或多 GPU 配置上:Llama 4 Scout 凭借 MoE 的优势成为值得考虑的选择。许多用户会同时保留这两个模型,并根据任务切换使用。

#故障排除

加载时出现“Out of memory”
显存不足,无法容纳所选规模的模型。请换用小一档的模型(gemma3:12b → gemma3:4b),或采用更激进的量化方式(Q4 → Q3)。不要强行将 27B 模型的计算转交给 CPU,否则会变得无法使用。
图像被拒绝
您可能正在使用仅支持文本的 gemma3:1b。请至少升级到 gemma3:4b 以获得视觉能力
超过 4k 的上下文被忽略
Ollama 默认加载的 num_ctx 值很小。请使用 /set parameter num_ctx 32768 或通过 API 选项 options={'num_ctx': 32768} 显式扩展上下文长度。
在12B/27B模型上使用GPU时生成速度慢
使用 ollama ps 检查 PROCESSOR 列,确认它显示 100% GPU。如果看到 CPU 百分比,就说明模型及其上下文所需的显存超出了容量——请减小 num_ctx。
截断的回复
增加 num_predict(部分客户端默认为128)。对于 Ollama CLI:/set parameter num_predict 2048。

#深入了解

Gemma 3 是一个出色且用途广泛的入门选择。根据您打算如何使用它,下面列出几个适合的方向:

与 Gemma 4 进行对比
《使用 Ollama 在本地运行 Gemma 4》指南介绍了该系列的演进,以及在哪些情况下值得升级。
正确选择量化方式
《选择量化方式(Q4、Q5、Q8、FP16)》指南详细说明了适用于 4 种尺寸 Gemma 3 的权衡方案。
在流水线中利用视觉能力
《本地多模态视觉LLM指南》提供了可直接应用的Python实战示例(OCR、描述、分析),适用于Gemma 3 4B/12B/27B。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。