首页 › 目录 › 2026 年适用于 8 GB 显存的最佳 LLM

2026 年适用于 8 GB 显存的最佳 LLM

◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

排名更新于 09/10/2026

8 GB 显存是本地 AI 的入门档位——RTX 3060 8GB、4060、5060、3070、2080 等。70 亿至 90 亿参数的模型采用 Q4_K_M 量化后可轻松装入显存。以下是这一显存容量下的最佳选择。

本地 AI 的优惠和替代方案

RTX 4060 Ti 8GB :可选购的本地 AI 替代方案 — RTX 5060 Ti 16 GB :

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟链接——哪个LLM可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为亚马逊合作伙伴,哪个LLM会从符合条件的购买中获益。

排名

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8B 参数 · Apache 2.0 · 131 072 tokens ctx

Dense 8B Apache 2.0,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。MMLU 73.84,HumanEval 85.37。发布于 2026 年 4 月 29 日。

排名原因 采用 Q5_K_M 量化时可以装入显存(约占用 6 GB,可用容量为 8 GB)。80亿参数,上下文长度为 131072 个 token。
# HuggingFace : ibm-granite/granite-4.1-8b
在 RTX 4060 Ti 8GB 上
Q5_K_M
6 GB · 12 tok/s
2

🇺🇸 Gemma 4 12B

Google · 12B 参数 · Apache 2.0 · 262 144 tokens ctx

Gemma 4 12B(Google):稠密多模态模型(文本、视觉、音频),256k 上下文,Q4 约 7 GB VRAM。Apache 2.0,多语言支持。

排名原因 采用 Q4_K_M 量化时可装入显存(可用显存为 8 GB,模型约占 7 GB)。120 亿参数,上下文长度为 262144 个 token。
# HuggingFace : google/gemma-4-12B
在 RTX 4060 Ti 8GB 上
Q4_K_M
7 GB · 18 tok/s
3

🇺🇸 Granite 4.2 8B

IBM · 8B 参数 · Apache 2.0 · 128 000 tokens ctx

Granite 4.2 8B(IBM):Apache 2.0 稠密模型,128k 上下文,Q4 量化约需 4.6 GB 显存。面向企业级多语言聊天、代码和推理。

排名原因 Q5_K_M 版本可以装入内存(约占 6 GB,可用容量为 8 GB)。80 亿参数,上下文长度为 128 000 token。
ollama pull granite4.2
在 RTX 4060 Ti 8GB 上
Q5_K_M
6 GB · 32 tok/s
4

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B 参数 · Apache 2.0 · 16 000 tokens 上下文

OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。

排名原因 支持 Q8(约 8 GB,共 8 GB 可用)。7B 参数,上下文长度 16,000 个 token。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
在 RTX 4060 Ti 8GB 上
Q8
8 GB · 32 tok/s
5

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B 参数 · MIT · 128 000 tokens ctx

GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。

排名原因 Q8 量化版本可以装入显存(可用显存为 8 GB,约占用 7 GB)。70亿参数,上下文长度为128,000个 token。
ollama pull glm-5.3
在 RTX 4060 Ti 8GB 上
Q8
7 GB · 32 tok/s
6

🇺🇸 OLMo 3 7B

Allen AI · 7B 参数 · Apache 2.0 · 8192 token 上下文

7B 稠密模型,100% 开放(权重 + 数据 + 代码)。为研究提供完全透明的信息。

排名原因 Q5_K_M 量化后可装入显存(约占用 6 GB,可用显存为 8 GB)。70 亿参数,上下文长度为 8,192 个 token。
ollama run olmo-3:7b
在 RTX 4060 Ti 8GB 上
Q5_K_M
6 GB · 12 tok/s
7

🇨🇳 Qwen 3 8B

Alibaba · 8B 参数 · Apache 2.0 · 131 072 tokens ctx

思考/快速混合模式。支持 119 种语言,原生上下文为 32k(通过 YaRN 可扩展至 131k)。

排名原因 采用 Q5_K_M 量化时可以装入显存(约占用 6 GB,可用容量为 8 GB)。80亿参数,上下文长度为 131072 个 token。
ollama run qwen3:8b
在 RTX 4060 Ti 8GB 上
Q5_K_M
6 GB · 12 tok/s
8

🇺🇸 LFM2.5 7B

Liquid AI · 7B 参数 · LFM Open License v1.0 · 上下文长度:32,768 tokens

LFM2.5 7B(Liquid AI):稠密 Liquid Foundation Model,32k 上下文,Q4 量化下需 4.1 GB 显存。针对 CPU 和边缘设备优化。2026年5月发布。

排名原因 Q8 量化后可容纳于可用显存中(约占 7 GB,可用容量为 8 GB)。70 亿参数,上下文长度为 32 768 个 token。
ollama pull lfm2.5
在 RTX 4060 Ti 8GB 上
Q8
7 GB · 32 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 RTX 4060 Ti 8GB 上
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#2 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 18 tok/s · Q4_K_M
#3 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 32 tok/s · Q5_K_M
#4 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 32 tok/s · Q8
#5 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 tok/s · Q8
#6 OLMo 3 7B 7B 5 GB 8 192 Apache 2.0 12 tok/s · Q5_K_M
#7 Qwen 3 8B 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 LFM2.5 7B 7B 4.1 GB 32 768 LFM Open License v1.0 32 tok/s · Q8
本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选条件:Q4 量化下 VRAM ≤ 8 GB 且 ≥ 3 GB(排除利用率低的超小模型)。保留 3-9B 模型,它们在 Q4_K_M 量化下能留出上下文余量。

考虑的标准:

  • Q4 量化下的显存需求 ≤ 8 GB
  • 可用上下文(32k+)
  • 质量与更高一档相当
  • 兼容 Ollama / LM Studio

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

只有 8 GB 显存,入门该选哪个 LLM?

Granite 4.1 8B Instruct 是最佳入门选择。Mistral 7B,Llama 3.1 8B 和 Qwen 2.5 7B 均表现优异且免费。建议从 Ollama(ollama run mistral:7b-instruct).

能否在 8 GB 显存下运行 Gemma 2 9B?

只能使用 Q4_K_M(模型约占 6 GB + 上下文占 1–2 GB = 合计约 8 GB)。没有足够余量容纳较大的上下文。如果希望轻松使用 32k 以上 token 的上下文,建议选择 Mistral 7B。

8 GB 显存下该选哪种量化?

7–9B 模型选用 Q4_K_M。3–5B 模型选用 Q5_K_M。Q8 仅用于 3B 及以下的模型。

RTX 4060 与 RTX 3060 12GB 哪个更好?

4060 在纯吞吐量上更快(+15-20%),但显存仅限于 8 GB —— 不支持 12B 模型或长上下文。3060 12 GB 虽然性能等级较低,但更适合 LLM 使用。

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €