Gemma 3(Google)本地部署:完整指南 2026
Gemma 3 是 Google 于 2025 年 3 月发布的开放权重模型系列。该系列提供四种规模(1B、4B、12B、27B),从 4B 版本起集成视觉能力,上下文长度为 128k,并具备扎实的多语言支持,法语表现也尚可。本指南逐步介绍如何通过 Ollama 在本地安装 Gemma 3、需要了解的 Google 许可证条款,以及该模型真正表现出色的场景。
#为何选择 Gemma 3?
Gemma 3 是 Google DeepMind 开放权重模型的第三代,与 Gemini 源自同一研究基础。该系列涵盖四种差异明显的规模——从 1B 到 27B 参数——可精确匹配您手头的硬件档位,从没有 GPU 的笔记本电脑到配备 24 GB 显存的工作站。
三项关键特性使 Gemma 3 在该类别模型中脱颖而出:支持 128k 上下文长度(1B 版本仅支持 32k);从 4B 版本起即内置多模态视觉能力,无需额外加载独立模型;以及对多语言能力的明确优化(Google 文档宣称 4B 及以上版本覆盖 140 多种语言)。
#4种大小 Gemma 3
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
选择合适的规模是最重要的决定。以下是使用场景与硬件的对应关系:
- gemma3:1b
- 仅支持文本,上下文长度为 32k。适用于纯 CPU 运行、Raspberry Pi 5 或配备 8 GB 内存的 Mac M1。质量有限,但能即时回应。适合分类和简短改写。
- gemma3:4b
- 多模态(文本 + 图像),上下文长度 128k。“笔记本电脑”档位:可轻松容纳于 6 GB 显存,或配备 16 GB 内存的 Mac M2/M3。处理通用任务时,输出质量尚可。
- gemma3:12b
- 多模态,128k 上下文。“中端 PC”档位:RTX 3060 12 GB、4070、M3 Pro 18 GB。质量确实足以满足日常使用。
- gemma3:27b
- 多模态,上下文长度为 128k。「工作站」档位:RTX 3090/4090、M3 Max。最好的 Gemma 3,在许多任务上可与更高档次的模型相媲美。
#VRAM 要求(量化 Q4_K_M)
- gemma3:1b
- ≈ 1 GB 显存或内存。可在任意设备上运行,包括 Raspberry Pi 5。
- gemma3:4b
- ≈ 3 GB VRAM。RTX 3050 6 GB、GTX 1660 6 GB、MacBook Air M2 8 GB均可满足。
- gemma3:12b
- 约需 8 GB 显存。RTX 3060 12 GB、RTX 4070 12 GB,或配备 18 GB 统一内存的 Mac M3 Pro。
- gemma3:27b
- Q4 量化下约需 17 GB 显存。RTX 3090/4090 24 GB,或配备至少 36 GB 内存的 Mac M3/M4 Max。Q3 量化下(质量有所下降),16 GB 也能运行。
根据您实际使用的上下文长度,还需为 KV 缓存预留约 1–4 GB。加载一个 27B 模型的完整 128k 上下文,所需显存会超过仅加载模型本身所需的显存。
#1. 使用 Ollama 在本地安装 Gemma 3
如果 Ollama 尚未安装,请先按照 Ollama 安装指南为你的操作系统进行安装。一旦 Ollama 运行起来,下载 Gemma 3 只需一条命令。
Ollama 下载模型(4B Q4版本约3.3 GB),然后直接以交互模式启动。当出现提示 >>> 时,即可进行测试。
Ollama 守护进程在 http://localhost:11434 上监听——您可以将 Open WebUI、作为客户端使用的 LM Studio、Continue.dev 或任何兼容 OpenAI 的客户端连接到它。
#2. 多语言支持及法语质量
与以英语为中心的小型模型相比,Google 在多语言方面的工作仍是 Gemma 3 的一大优势。法语在训练语料中占有充分的比例,因此您几乎不会看到模型在回答过程中切换成英语,而这仍是更小模型的常见缺陷。2026 年的新一代模型(Qwen 3.5、Granite 4.2)在法语能力上已迎头赶上,但 Gemma 3 在这方面依然能与它们竞争。
- Gemma 3 4B
- 处理简单任务(摘要、改写、分类)时,法语表现尚可。进行长篇写作时,措辞有时仍不够自然。
- Gemma 3 12B
- 达到“可用的法语助手”水平。语法掌握良好,词汇丰富,不必要的英语词汇或表达较少。在这一指标上与 Qwen 3.5 9B 相当。
- Gemma 3 27B
- 法语表现很好。写作能力与 Mistral Small 24B 相当,形式推理略逊一筹,但在表达的细腻程度和文风上往往更胜一筹。
#3. 集成多模态视觉功能
从4B版本开始,Gemma 3 支持输入图像——无需单独加载视觉模型。同一二进制文件支持文本和视觉处理,并内置SigLIP编码器。适用于OCR、图像描述或屏幕截图分析。
在Python API中,可将图像以base64格式传递,或通过本地路径传入:
#4. 128k上下文的实际应用
Gemma 3 的 128k 上下文(除 1B 版本受限于 32k)足以处理一本短书、一份完整的文档资料或数小时的语音转录。默认情况下,Ollama 加载的上下文要短得多(通常为 4k 或 8k),以节省 VRAM——您需要显式扩展上下文长度。
或通过 API,在请求时传入 num_ctx 参数:
#Gemma 许可证:需要了解的内容
Gemma 3 并不像 Mistral、Qwen 或 DeepSeek 那样采用 Apache 2.0 或 MIT 许可证。Google 使用自己的许可证:“Gemma Terms of Use”。它允许商业使用,包括分发衍生模型,但施加了两项真正自由的许可证所没有的限制。
- 禁止用途政策
- 您必须遵守 Gemma Prohibited Use Policy(Gemma 禁止用途政策):不得生成儿童性虐待材料(CSAM),不得公然侵犯权利等。Google 可单方面修订这份清单。
- 许可条款的传递
- 如果您再次分发该模型(或其衍生版本),必须向用户提供 Gemma 许可协议,并要求他们接受相同的限制。
- 不采用‘copyleft’协议
- 您调用 Gemma 3 的应用程序不会因此继承该许可证的约束。只有重新分发的权重才受这些约束。
#Gemma 3 27B 与 Llama 4 Scout 对比
两个模型都定位于“可在本地运行的高端模型”这一细分领域。要做出选择,需要比较它们真正的差异:
- 架构
- Gemma 3 27B 是一个稠密模型(270 亿个参数全部处于激活状态)。Llama 4 Scout 是一个 MoE 模型(170 亿个激活参数,总计 1090 亿个参数)——在显存容量相同且模型能装入显存的情况下,性能强得多,但需要能够加载所有专家。
- 最小 VRAM 要求
- Gemma 3 27B Q4:约 17 GB。Llama 4 Scout Q4:约 60 GB(所有专家均已加载)。在单张 RTX 4090 上,只有 Gemma 3 27B 能完整装入显存并留有充足余量。
- 上下文
- Gemma 3:128k。Llama 4 Scout:10M(理论值,实际可用的上下文更小)。如果您确实需要处理超过 128k token 的内容,Scout 更有优势。
- 视觉
- 两者均原生支持多模态。在通用任务上的表现相当。
- FR
- Gemma 3 在日常法语中表现略优。Llama 4 Scout 在形式推理和编程方面更强。
- 许可证
- Gemma 使用条款与 Llama 4 社区许可证。两者均不符合 OSI 标准,但都可用于商业用途,须遵守各自的特定限制。
#故障排除
- 加载时出现“Out of memory”
- 显存不足,无法容纳所选规模的模型。请换用小一档的模型(gemma3:12b → gemma3:4b),或采用更激进的量化方式(Q4 → Q3)。不要强行将 27B 模型的计算转交给 CPU,否则会变得无法使用。
- 图像被拒绝
- 您可能正在使用仅支持文本的 gemma3:1b。请至少升级到 gemma3:4b 以获得视觉能力
- 超过 4k 的上下文被忽略
- Ollama 默认加载的 num_ctx 值很小。请使用 /set parameter num_ctx 32768 或通过 API 选项 options={'num_ctx': 32768} 显式扩展上下文长度。
- 在12B/27B模型上使用GPU时生成速度慢
- 使用 ollama ps 检查 PROCESSOR 列,确认它显示 100% GPU。如果看到 CPU 百分比,就说明模型及其上下文所需的显存超出了容量——请减小 num_ctx。
- 截断的回复
- 增加 num_predict(部分客户端默认为128)。对于 Ollama CLI:/set parameter num_predict 2048。
#深入了解
Gemma 3 是一个出色且用途广泛的入门选择。根据您打算如何使用它,下面列出几个适合的方向:
- 与 Gemma 4 进行对比
- 《使用 Ollama 在本地运行 Gemma 4》指南介绍了该系列的演进,以及在哪些情况下值得升级。
- 正确选择量化方式
- 《选择量化方式(Q4、Q5、Q8、FP16)》指南详细说明了适用于 4 种尺寸 Gemma 3 的权衡方案。
- 在流水线中利用视觉能力
- 《本地多模态视觉LLM指南》提供了可直接应用的Python实战示例(OCR、描述、分析),适用于Gemma 3 4B/12B/27B。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。