🇺🇸 OLMo 3 7B Think (SFT)
OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
排名更新于 2026年9月22日
二手 RTX 2060(6 GB GDDR6,336 GB/s)约售 100 欧元,是最实惠的入门级 LLM 显卡。6 GB 显存将可运行的模型限制在 Q4 量化的 3–7B 范围内,但足以让您体验本地 LLM。
RTX 2060 :可选购的本地 AI 替代方案 — RTX 5060 Ti 16 GB :
如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →
联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。
OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。
ollama pull glm-5.3
Gemma 4 E2B:有效参数 20 亿(总参数 51 亿),Q4 约需 3 GB 显存(Ollama 权重:QAT 下为 4.3 GB,默认为 7.2 GB)。支持文本和图像多模态,128k 上下文,Apache 2.0。
ollama run gemma4:e2b
7B 稠密模型,100% 开放(权重 + 数据 + 代码)。为研究提供完全透明的信息。
ollama run olmo-3:7b
LFM2.5 7B(Liquid AI):稠密 Liquid Foundation Model,32k 上下文,Q4 量化下需 4.1 GB 显存。针对 CPU 和边缘设备优化。2026年5月发布。
ollama pull lfm2.5
LFM2.5 DSpark(Liquid AI):7B 参数的稠密 Liquid Foundation Model,32k 上下文,Q4 量化下约需 4.1 GB 显存。针对边缘设备和 CPU 优化的通用聊天模型。
# HuggingFace : LiquidAI/LFM2.5-DSpark
30 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 40Q/8KV。支持工具调用和代码中间补全(FIM)。发布于 2026 年 4 月 29 日。
ollama run granite4.1:3b
| 名次 | 模型 | Params | Q4 VRAM | 上下文 | 许可证 | 在 RTX 2060 上 |
|---|---|---|---|---|---|---|
| #1 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | 32 tok/s · Q5_K_M |
| #2 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | 32 tok/s · Q5_K_M |
| #3 | Gemma 4 E2B | 2B | 3 GB | 128 000 | Apache 2.0 | 20 tok/s · Q8 |
| #4 | OLMo 3 7B | 7B | 5 GB | 8 192 | Apache 2.0 | 12 tok/s · Q5_K_M |
| #5 | LFM2.5 7B | 7B | 4.1 GB | 32 768 | LFM Open License v1.0 | 32 tok/s · Q5_K_M |
| #6 | LFM2.5 DSpark | 7B | 4.1 GB | 32 768 | LFM Open License v1.0 | 32 tok/s · Q5_K_M |
| #7 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | 25 tok/s · FP16 |
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
免费备忘录
接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。
本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。
你的显卡 → 最适合在本地运行的编程模型,以及准确的 Ollama 命令:
| 你的 VRAM | 典型 GPU / Mac | 推荐的代码模型 | Ollama 命令 |
|---|---|---|---|
| 8 GB | RTX 4060 / 3060 · M1-M2 16 GB | Qwen 3.5 9B (Q4, 6.6 GB — 256k ctx) | ollama run qwen3.5:9b |
| 12 GB | RTX 3060 12 GB / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 GB) 或 Gemma 4 12B (7.6 GB) | ollama run qwen3.5:9b-q8_0 |
| 16 GB | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 GB | Devstral 24B (Q4, 14 GB) — 专长是编程智能体任务 | ollama run devstral:24b |
| 24 GB | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 GB | Qwen 3.8 27B (Q4, 18 GB) — “接近 Copilot” | ollama run qwen3.8:27b |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 GB) — 快速 MoE | ollama run qwen3.6:35b |
| 48 GB+ | Mac M4 Max 64 GB · M2 Ultra 128 GB | Qwen3-Coder 30B-A3B (Q8, 32 GB — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — 在这一特定用途上,它仍是标杆。⚠️ Qwen 3.8: 其推理强度默认设得很高,处理简单请求时会“过度思考”——请将其调低至 low (或在首次启动时关闭它)。⚠️ 许可证陷阱: Codestral 22B = Mistral Non-Production License(非生产用途许可证) → 禁止用于工作中的编程。Qwen 3.5/3.8、Gemma 4 和 Devstral 采用 Apache 2.0 许可证。💡 因内存不足而崩溃?请预留约 1.5 GB 的显存用于上下文,或将量化精度降低一档。🔌 要将其接入 VS Code: Cline (可处理多个文件的智能体), Aider (CLI) 或 Tabby/Twinny (FIM 自动补全) — 它们都连接到本地 Ollama。该套件 本地助手 — 可直接粘贴的配置 + 经过测试的设置 — 现已可用: /copilote-local.
筛选条件:Q4_K_M ≤ 5 GB。1–7B 模型加分,≤ 3B 模型大幅加分。336 GB/s,作为入门级配置表现尚可。
考虑的标准:
评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。
RTX 2060 6 GB:能运行 LLM 吗?
可以运行 1–7B 模型。Phi-4 Mini 3.8B Q4 的速度为 35–40 个 token/秒,Llama 3.2 3B Q4 为 50 个 token/秒以上,Mistral 7B Q4 为 15–18 个 token/秒。详见 guide.
6 GB在2026年是否足够?
勉强够用 — Mistral 7B Q4 占用 4.5 GB,加上上下文的 1 GB 和操作系统的 0.5 GB,内存余量很小。建议优先选择 Phi-4 Mini 或 Llama 3.2 3B(2–3 GB)。参见 6 GB 指南.
买二手显卡:2060 还是 3050 8 GB?
3050 8 GB = 增加 2 GB VRAM 但较旧(224 GB/s vs 2060 336 GB/s)。2060 在 7B 上更快,但 3050 能运行更多模型。视优先级而定。参见 RTX 3050 8GB.
升级到5050是否更合适?
5050 8 GB 新品约 280 欧元,对比 2060 6 GB 二手约 100 欧元。若 LLM 为主要用途,推荐 5050(GDDR7,+8 GB,现代神经引擎)。否则 2060 仍可正常使用。详见 RTX 5050.