🇺🇸 DiffusionGemma 26B-A4B Instruct
DiffusionGemma 26B(Google):基于扩散的 Gemma 视觉语言模型,指令微调版,128k 上下文,Q4 量化下占用 15 GB 显存。Apache 2.0 许可证。2026 年 6 月发布。
# HuggingFace : google/diffusiongemma-26B-A4B-it
排名更新于 09/10/2026
16 GB VRAM 是 13-24B 量化 LLM 的理想配置。目标显卡:RTX 4080/4080 Super、RTX 5080、4070 Ti Super、4060 Ti 16 GB、RX 7800 XT。以下是该级别中的最佳模型。
RTX 4080 :可选购的本地 AI 替代方案 — RTX 5080 16 GB :
迷你PC是一台完整机器:请检查所需内存和软件兼容性。它不能替代macOS/MLX或CUDA。
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 €价位的电脑 →
联盟链接 — 哪个LLM 可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
DiffusionGemma 26B(Google):基于扩散的 Gemma 视觉语言模型,指令微调版,128k 上下文,Q4 量化下占用 15 GB 显存。Apache 2.0 许可证。2026 年 6 月发布。
# HuggingFace : google/diffusiongemma-26B-A4B-it
40 亿有效参数,多模态(文本+图像+音频)。140 种语言。适用于笔记本电脑和边缘设备。
ollama run gemma4:e4b
专注编程的 24B 模型,采用 Apache 2.0 许可证。SWE-Bench 得分 72.2%。256k 上下文,来自法国实验室。
ollama run devstral-small2:24b
Mistral 首个开源推理模型。AIME24 70.7%。基于 Small 3.1 并经 CoT 训练。
ollama run magistral:24b
gpt-oss 120B 的小型版本。总参数量 21B,激活参数量 3.6B。在笔记本电脑上即可达到 o3-mini 的水平。
ollama run openai/gpt-oss:20b
紧凑型 MoE 推理模型,总参数 21B,激活参数 3B。Apache 2.0 许可证。得益于仅 3B 的激活参数,运行速度很快。
ollama pull hf.co/baidu/ernie-4.5-21b-GGUF
美国实验室开发的 MoE 模型,总参数 26B,激活参数 3B。得益于 3B 激活参数,运行速度快。Apache 2.0。
ollama pull hf.co/arcee-ai/Trinity-Mini-26B-GGUF
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 RTX 4080 上 |
|---|---|---|---|---|---|---|
| #1 | DiffusionGemma 26B-A4B Instruct | 26B | 15 GB | 128 000 | Apache 2.0 | 14 tok/s · Q4_K_M |
| #2 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | 40 tok/s · FP16 |
| #3 | Devstral Small 2 24B | 24B | 14 GB | 256 000 | Apache 2.0 | 15 tok/s · Q4_K_M |
| #4 | Magistral Small 24B | 24B | 14 GB | 128 000 | Apache 2.0 | 15 tok/s · Q4_K_M |
| #5 | gpt-oss 20B | 21B | 13 GB | 128 000 | Apache 2.0 | 55 tok/s · Q5_K_M |
| #6 | ERNIE 4.5 21B-A3B Thinking | 21B | 13 GB | 131 072 | Apache 2.0 | 40 tok/s · Q5_K_M |
| #7 | Trinity Mini 26B-A3B | 26B | 15 GB | 131 072 | Apache 2.0 | 40 tok/s · Q4_K_M |
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地编程副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
我们保留采用 Q4_K_M 量化后能装入 16 GB 显存的模型,并优先选择显存占用比例较高(50%–95%)的模型——这表明硬件资源得到了充分利用。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
在 RTX 4080 16 GB 上运行哪个 LLM?
我们的首选推荐: DiffusionGemma 26B-A4B Instruct。为在质量与吞吐量之间取得良好平衡,请继续选择采用 Q4_K_M 或 Q5 量化的 13–24B 模型。
在 16 GB 显存下能否支持 Q5 或 Q8 量化?
8–14B 模型可以(14B 的 Q5 版本约 10 GB,8B 的 Q8 版本约 10 GB)。24B 模型不行(Q5 约 17 GB,超出显存容量限制)。对于 24B 模型,仍应选择 Q4。
16 GB 显存能装下 Gemma 2 27B 吗?
只有采用 Q4_K_M 量化时才能容纳(约 16 GB)——几乎没有任何余量。采用 Q5 时会超出显存容量(20 GB)。建议优先选择 Mistral Small 3.1 24B 采用Q4(14GB)量化以保留余量。
RTX 4080 与 RTX 4070 Ti Super 哪个更适合运行 LLM?
两者都配备16GB显存,但4080型号在性能上快30-40%(我们的评分中为tier 4 vs 3)。如果预算允许,4080 Super或5080显然更优。