🇺🇸 Gemma 4 26B-A4B MoE
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
排名更新于 09/10/2026
RTX 3090 Ti(24 GB GDDR6X,1008 GB/s)是Ampere系列的旗舰产品。24 GB + 1 TB/s 带宽 = 与4090相同VRAM能力,价格仅为新品的60%,约700欧元二手价。
RTX 3090 Ti :可选购的本地 AI 替代方案 — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :
迷你PC是一台完整机器:请检查所需内存和软件兼容性。它不能替代macOS/MLX或CUDA。
为什么选择它?查看我们对 GMKtec EVO-X2 64 GB / 1 TB(Ryzen AI Max+ 395)的完整介绍 →
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟链接——哪个LLM可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为亚马逊合作伙伴,哪个LLM会从符合条件的购买中获益。
Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。
ollama run qwen3.8:27b
GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。
ollama run gemma4:31b
300 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。支持兼容 OpenAI 的工具调用。发布于 2026 年 4 月 29 日。
ollama run granite4.1:30b
MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 RTX 3090 Ti 上 |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 | 22 tok/s · Q5_K_M |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · Q5_K_M |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q5_K_M |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q5_K_M |
| #5 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q5_K_M |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #7 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #8 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA 开放模型许可证 | 30 tok/s · Q5_K_M |
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选条件:Q4_K_M ≤ 22 GB。额外支持13-32B(峰值24 GB)和7-32B。带宽达1008 GB/s,为Ampere架构记录值。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
RTX 3090 Ti 与 3090 哪个更好?
同样是 24 GB。3090 Ti 的 CUDA 核心多 7%,GDDR6X 带宽为 1008 GB/s,而 3090 的 GDDR6X 带宽为 936 GB/s。LLM 性能差异约为 5–8%。3090 通常在二手市场更划算。参见 RTX 3090.
3090 Ti 与 4090 的对比?
同样是 24 GB。4090 也是 1008 GB/s,加上 16384 个 CUDA 核心,而 3090 Ti 是 10752 个。对于 LLM 来说,速度大约快 40-50%。如果是新的,选 4090。如果是二手,约 700 欧元对比约 1100 欧元,3090 Ti 非常出色。参见 RTX 4090.
Llama 70B 在 3090 Ti 上可行吗?
Q3_K_M(约32 GB)无法单独运行。Q2_K(约24 GB)勉强可以运行,但质量下降。对于70B模型的舒适使用,建议使用2块3090 Ti或RTX 5090 32 GB显卡。详见 RTX 5090.
搭建 2× 3090 Ti 二手显卡?
非常不错:两张卡合计提供 48 GB 显存,总价约 1400 欧元。Llama 70B Q4(约 40 GB)可以装下,并通过张量并行达到约 30 token/s 的速度。就 2026 年运行 LLM 的性价比而言,这套配置很难被超越。