8 GB VRAM 适合哪个 LLM ?
拥有8GB显存时,建议选择80至90亿参数的Q4量化模型,例如Qwen 3.5 9B(6GB权重)或Granite 4.2 8B(4.6GB),上下文长度设为数千token。12B模型在Q4量化下勉强能装入显存,14B模型则会超出显存容量。请为KV缓存和系统预留约1GB的余量。
8 GB 显存仍是近年来售出的显卡中最常见的容量。本指南说明哪些模型能装入显存、如何计算剩余空间、哪些显卡确实配备 8 GB 显存,以及何时应升级到 12 或 16 GB。
您正在挑选电脑吗? 按预算推荐 →
要升级到16GB显存: RTX 5060 Ti 16 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#8 GB显存:可运行40至90亿参数的模型
拥有 8 GB 显存时,合适的选择是采用 Q4 量化、参数量为 80 亿至 90 亿的模型,例如 Qwen 3.5 9B(根据 QuelLLM 目录,模型权重占 6 GB)或 Granite 4.2 8B(4.6 GB),并使用几千个 token 的上下文。120 亿参数的 Q4 模型(7 GB)勉强能装入显存,没有空间余量留给上下文。140 亿参数及以上的模型则会超出显存容量。决定因素不只是模型大小:还要加上随上下文增长的 KV 缓存,并为系统和显示预留空间。
预算计算很简单:模型权重,加上 KV 缓存,再加上约一吉字节用于缓冲和显示,总和必须保持在 8 GB 以下。使用 Q4 格式的 9B 模型(6 GB)时,因此仅剩下约 1 GB 用于上下文。如果使用更轻量的 8B 模型,如 Granite 4.2 8B(4,6 GB),则剩余空间超过 2 GB。这就是为什么模型选择与上下文长度需要共同决定。
| 模型与量化 | 模型大小 | 为 KV 缓存和系统预留的空间 | 结论 |
|---|---|---|---|
| Granite 4.2 8B Q4 | 4.6 GB | ≈ 3.4 GB | 运行轻松,可使用长上下文 |
| Granite 4.2 8B Q5 | 6 GB | ≈ 2 GB | 不错的折中选择 |
| Qwen 3.5 9B Q4 | 6 GB | ≈ 2 GB | 最佳通用选择 |
| Qwen 3.5 9B Q5 | 7 GB | ≈ 1 GB | 上下文非常短 |
| Gemma 4 12B Q4 | 7 GB | ≈ 1 GB | 刚刚好,无余量 |
| Qwen 3.5 4B Q4 | 2.3 GB | ≈ 5.7 GB | 非常宽裕,适合小任务 |
这些余量仅供参考:KV 缓存的实际大小取决于模型架构和上下文长度。最好的查看方式是先启动模型,再查看 ollama ps 和显卡监控工具(nvidia-smi 或 rocm-smi)。
#哪些显卡配有 8 GB 显存,哪些容易让您踩坑
许多显卡系列都有不同显存容量的版本,仅凭名称还不够。NVIDIA 列出的 RTX 3060 有 12 GB 或 8 GB 版本,RTX 4060 为 8 GB,RTX 4060 Ti 有 16 GB 或 8 GB 版本,RTX 5060 Ti 也有 16 GB 或 8 GB 版本,而 RTX 5060 为 8 GB。AMD 的 RX 9060 XT 有 8 GB 版本,带宽为 320 GB/s,与 16 GB 版本相同。因此,在购买或比较之前,务必查看具体型号的规格表,确认显存容量。
- NVIDIA 8 GB
- RTX 4060,RTX 5060,RTX 3060、4060 Ti 和 5060 Ti 的 8 GB 版本,以及旧款的 RTX 3070、3060 Ti 或 2060 Super
- AMD 8 GB
- RX 9060 XT 8 GB,RX 7600,RX 6600 XT,RX 5700 XT
- 注意:RX 7600 XT
- 这张卡是16GB,不是8GB:llama.cpp性能表中明确列出其配备16GB GDDR6显存。该指南的早期版本错误地将其标为8GB。
Mac 使用统一内存,并与系统共享:配备 8 GB 内存的 MacBook Air 并不会将全部 8 GB 都留给 AI。MacBook Air M1 和 M2 的专门指南详细说明了还剩多少内存可用;如果完全没有独立显卡,无 GPU 运行 LLM 的指南会按 RAM 容量列出可用模型。
#在8GB显存下可预期的推理速度
文本生成时,每生成一个 token 都要读取几乎全部权重:最大速度等于内存带宽除以权重大小。在 RX 9060 XT 8 GB(据 AMD 公布,带宽为 320 GB/s)上,Q4 量化的 Qwen 3.5 9B(6 GB)的理论上限约为每秒 53 个 token,Q4 量化的 Granite 4.2 8B(4.6 GB)则约为每秒 70 个 token。换一张显卡,上限也会不同;实际速度始终低于理论上限。
我们不按显卡发布 tokens/秒数据:生成速度取决于驱动程序、软件和上下文,而且没有我们可以引用的公开基准测试涵盖这些模型在这些显卡上的表现。llama.cpp 的社区表格测试了采用 Q4_0 量化的 Llama 2 7B,为一款旧款 8 GB 显卡提供了参考:RX 5700 XT 在 ROCm 下的生成速度为 67 tokens/s。对于您的硬件,请实际测量:运行 ollama run 时添加 --verbose 选项,即可显示生成速度。
#8 GB 显存下,不同用途该选哪些模型
QuelLLM 目录可以帮助您针对每种用途找到一个留有余量的模型。模型宣称的最大上下文长度并不意味着您就能用到:在 8 GB 显存下,限制实际长度的是加载模型权重后剩余的显存,而不是目录中的数字。
| 用途 | 模型 | Q4 权重 | 备注 |
|---|---|---|---|
| 对话与写作 | Qwen 3.5 9B | 6 GB | 标称上下文长度为 262,000 个 token;在 8 GB 显存下,实际可用长度远低于这一数值 |
| 日常任务,余量充足 | Granite 4.2 8B | 4.6 GB | 宣称的上下文长度为 128,000 个 token;为 KV 缓存留出更多空间 |
| 代码补全 | Qwen 2.5 Coder 7B | 5 GB | 70 亿参数的代码模型,公布的上下文长度为 131 072 个 token |
| 后台小任务 | Qwen 3.5 4B | 2.3 GB | 为其他工具保留部分VRAM |
| 视觉与多模态 | Gemma 4 12B | 7 GB | 标注支持视觉和音频;勉强能装入 8 GB 显存 |
有两点值得说明。标注了视觉能力的模型需要为图像编码器额外占用内存,因此,一个采用 Q4 量化的 120 亿参数多模态模型一旦加载图像,内存占用很快就会超过 8 GB。而对于代码,一个采用 Q4 量化的 70 亿参数专用模型(5 GB)能装得下且留有余量,响应也比更大的通用模型更快,这对行内代码补全很重要。
#充分利用 8 GB 显存的五项设置
这些设置中的任何一个都无法替代 VRAM,但它们能将极限推移数百兆字节至一吉字节,这足以将上下文从 4 000 个 token 扩展到 16 000 个 token。
- 限制上下文
- 根据 Ollama 的文档,其默认上下文窗口为 4 096 个 token;可通过 OLLAMA_CONTEXT_LENGTH 修改。如果只是用短消息聊天,请不要将上下文窗口设为 32 000 个 token。
- 量化KV缓存
- OLLAMA_KV_CACHE_TYPE=q8_0 相比默认的 f16 几乎将缓存内存减半;该设置需要 Flash Attention。
- 让 Flash Attention 发挥作用
- Ollama 在后端和显卡支持的情况下会自动启用;您可以通过设置 OLLAMA_FLASH_ATTENTION=1 强制启用。
- 释放显存
- 浏览器、游戏和视频应用会占用显存。加载模型前,请关闭这些应用;如果机器配有集成显卡,也可以将显示器连接到集成显卡。
- 根据显存余量选择 Q4 或 Q5
- 在 8 GB 显存下,Q4_K_M 是合适的默认选择。只有当使用更小的模型并留出超过一吉字节空闲空间时,才应切换到 Q5。
#8GB 无法支持的功能:RAG、代码处理、大模型
完整的 RAG 流水线包含一个嵌入模型、一个可选的重排序模型,以及负责撰写回答的 LLM。8 GB 显存难以轻松容纳这套组合:仅生成模型本身就占用 5 到 6 GB。有两种解决办法:让嵌入模型在 CPU 上运行,这对于索引处理完全可以接受;或者选择较小的生成模型,例如 Q4 量化的 Qwen 3.5 4B(2.3 GB)。对于行内代码补全,70 亿参数的模型就足够了;但对于需要读取大文件的代码智能体,所需上下文超出了 8 GB 显存能够容纳的范围。
对于 140 到 320 亿参数的模型,需升级到新的层级。网站规则指出,14B ≈ 9 GB,32B ≈ 19 至 20 GB(Q4 量化,无上下文):因此 8 GB 以上,14B 才是真正的分水岭,故建议设置 12 GB 的层级以提供充足余量。请勿依赖极端卸载技巧:一个只有一半权重驻留在 RAM 中的模型虽可运行,但读取速度会严重削弱交互体验。
#何时升级到12GB或16GB
| 档位 | 新增可实现的用途 | Guide |
|---|---|---|
| 12 GB | Gemma 4 12B 采用 Q8 量化,Qwen 3.5 9B 采用 Q8 量化,RAG 更轻量 | 12 GB 显存适合运行哪个 LLM |
| 16 GB | 200至240亿参数的Q4模型(gpt-oss 20B、Mistral Small 24B),还能留出一些上下文空间 | 拥有 16 GB VRAM 时选哪个 LLM |
| 24 GB | 采用Q4量化、支持长上下文的270亿参数稠密模型 | 24 GB 显存适合哪个 LLM |
购买时应关注每 GB 显存的价格,而非整张显卡的价格。本站的价格跟踪功能会为每张显卡计算这一指标,每周更新两次;做决定前请查阅,因为全新显卡与二手显卡之间的价格差距经常变化。
- 12 GB 显存适合运行哪个 LLM
- 拥有 16 GB VRAM 时选哪个 LLM
- 量化 KV 缓存以节省 VRAM
- 选择量化方案(Q4、Q5、Q8、FP16)
- 无 GPU 的本地 LLM:按 RAM 容量选择模型
- 本地 AI 显卡价格
- 来源:Ollama 的常见问题解答(上下文、KV 缓存、Flash Attention)
- 来源:NVIDIA 的 RTX 5060 系列产品资料
- 来源:AMD RX 9060 XT 8 GB 技术规格表
- QuelLLM 模型目录(模型的显存占用大小)
#常见问题
8 GB VRAM 下最适合的 LLM 是什么?+
能否在 8GB 显存上运行 14B 模型?+
如何判断模型能否完全装入我的显存?+
RX 7600 XT 是否有 8 GB 显存?+
8 GB 足够用 LLM 开发一个应用吗?+
一台8GB内存的Mac是否等同于一台配备8GB显存的PC?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。