🇺🇸 Gemma 4 E4B
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
排名更新于 2026年9月22日
RTX 3060 12 GB 是本地运行大语言模型最受欢迎的经济型显卡。12 GB 显存可流畅运行 7–9B 模型(Q4/Q5 量化)。以下是最佳选择。
RTX 3060 12GB :可选购的本地 AI 替代方案 — RTX 5060 Ti 16 GB :
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
Dense 8B Apache 2.0,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。MMLU 73.84,HumanEval 85.37。发布于 2026 年 4 月 29 日。
# HuggingFace : ibm-granite/granite-4.1-8b
Gemma 4 12B(Google):稠密多模态模型(文本、视觉、音频),256k 上下文,Q4 约 7 GB VRAM。Apache 2.0,多语言支持。
# HuggingFace : google/gemma-4-12B
采用混合思考的 14B 稠密模型。在 STEM/代码方面与 Qwen 2.5 32B Base 持平。
ollama run qwen3:14b
采用MIT许可的14B推理模型。在Microsoft公布的AIME24/25评测中,以R1-Distill-Llama-70B五分之一的参数量取得了更高分数。
ollama run phi4-reasoning:14b
以其模型规模而言,推理能力非常出色。侧重 STEM 领域。
ollama run phi4:14b
Coder 14B。HumanEval 89.6,LiveCodeBench 37.1。自行部署编程模型时,显存需求处于最佳平衡点。
ollama run qwen2.5-coder:14b
将 R1 的推理能力蒸馏到 Qwen 14B。AIME24 69.7,MATH-500 93.9。在许多基准测试中超越 o1-mini。
ollama run deepseek-r1:14b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 RTX 3060 12GB 上 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | 14 tok/s · Q8 |
| #2 | Granite 4.1 8B Instruct | 8B | 5 GB | 131 072 | Apache 2.0 | 12 tok/s · Q8 |
| #3 | Gemma 4 12B | 12B | 7 GB | 262 144 | Apache 2.0 | 18 tok/s · Q5_K_M |
| #4 | Qwen 3 14B | 14B | 9 GB | 131 072 | Apache 2.0 | 6 tok/s · Q5_K_M |
| #5 | Phi-4 Reasoning 14B | 14B | 9 GB | 32 768 | MIT | 6 tok/s · Q5_K_M |
| #6 | Phi-4 14B | 14B | 9 GB | 16 384 | MIT | 6 tok/s · Q5_K_M |
| #7 | Qwen 2.5 Coder 14B Instruct | 14B | 9 GB | 131 072 | Apache 2.0 | 6 tok/s · Q5_K_M |
| #8 | DeepSeek R1 Distill Qwen 14B | 14B | 9 GB | 131 072 | MIT | 6 tok/s · Q5_K_M |
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选条件:以 Q4_K_M 量化后能装入 12 GB 显存的模型。使用至少 40% 显存的模型可获得额外加分——避免推荐过小、无法充分利用显卡的模型。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
RTX 3060 12 GB 能胜任实际的 RAG 应用吗?
支持 Llama 3.1 8B(上下文 128k)或 Qwen 2.5 7B(131k)。在 Q4 模式下,模型加上约 32k 的 RAG 上下文可容纳在 12 GB 内。当上下文超过 100k 时,请切换至 Q4_0 或限制批处理大小。
运行 LLM,选 RTX 3060 还是 RX 6700 XT?
CUDA 的支持要好得多(Ollama、llama.cpp 和 vLLM 都针对它进行了优化)。AMD 可通过 ROCm 运行,但配置更复杂。对于 LLM,NVIDIA 在 2026 年仍是显而易见的选择。
12 GB 显存应选择哪种 Q 量化版本?
7-8B 模型使用 Q5_K_M(占用约 7 GB,为长上下文留有余量);12B 模型使用 Q4_K_M(Mistral Nemo)。避免使用 Q3/Q2,因为质量下降很明显。
能否实时运行12B模型?
是的 — Mistral Nemo 12B 采用 Q4_K_M(约 7 GB)量化,在 3060 上可实现每秒 10-15 个 token,适用于聊天,但实时编辑较慢。