入门 11 分钟按 VRAM 分类

8 GB VRAM 适合哪个 LLM ?

直接回答

拥有8GB显存时,建议选择80至90亿参数的Q4量化模型,例如Qwen 3.5 9B(6GB权重)或Granite 4.2 8B(4.6GB),上下文长度设为数千token。12B模型在Q4量化下勉强能装入显存,14B模型则会超出显存容量。请为KV缓存和系统预留约1GB的余量。

8 GB 显存仍是近年来售出的显卡中最常见的容量。本指南说明哪些模型能装入显存、如何计算剩余空间、哪些显卡确实配备 8 GB 显存,以及何时应升级到 12 或 16 GB。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

要升级到16GB显存: RTX 5060 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#8 GB显存:可运行40至90亿参数的模型

拥有 8 GB 显存时,合适的选择是采用 Q4 量化、参数量为 80 亿至 90 亿的模型,例如 Qwen 3.5 9B(根据 QuelLLM 目录,模型权重占 6 GB)或 Granite 4.2 8B(4.6 GB),并使用几千个 token 的上下文。120 亿参数的 Q4 模型(7 GB)勉强能装入显存,没有空间余量留给上下文。140 亿参数及以上的模型则会超出显存容量。决定因素不只是模型大小:还要加上随上下文增长的 KV 缓存,并为系统和显示预留空间。

预算计算很简单:模型权重,加上 KV 缓存,再加上约一吉字节用于缓冲和显示,总和必须保持在 8 GB 以下。使用 Q4 格式的 9B 模型(6 GB)时,因此仅剩下约 1 GB 用于上下文。如果使用更轻量的 8B 模型,如 Granite 4.2 8B(4,6 GB),则剩余空间超过 2 GB。这就是为什么模型选择与上下文长度需要共同决定。

8 GB 内存容量下的内存预算(权重占用数据:QuelLLM 目录)
模型与量化模型大小为 KV 缓存和系统预留的空间结论
Granite 4.2 8B Q44.6 GB≈ 3.4 GB运行轻松,可使用长上下文
Granite 4.2 8B Q56 GB≈ 2 GB不错的折中选择
Qwen 3.5 9B Q46 GB≈ 2 GB最佳通用选择
Qwen 3.5 9B Q57 GB≈ 1 GB上下文非常短
Gemma 4 12B Q47 GB≈ 1 GB刚刚好,无余量
Qwen 3.5 4B Q42.3 GB≈ 5.7 GB非常宽裕,适合小任务

这些余量仅供参考:KV 缓存的实际大小取决于模型架构和上下文长度。最好的查看方式是先启动模型,再查看 ollama ps 和显卡监控工具(nvidia-smi 或 rocm-smi)。

i
关于内存占用大小的更正
本指南的早期版本在 Q4 量化下将 Qwen 3.5 9B 标注为 6.6 GB,将 Gemma 4 12B 标注为 7.6 GB。QuelLLM 目录给出的数值为 6 GB 和 7 GB。这些数值经过四舍五入:请始终在计算值的基础上保留 1 GB 的余量。

#哪些显卡配有 8 GB 显存,哪些容易让您踩坑

许多显卡系列都有不同显存容量的版本,仅凭名称还不够。NVIDIA 列出的 RTX 3060 有 12 GB 或 8 GB 版本,RTX 4060 为 8 GB,RTX 4060 Ti 有 16 GB 或 8 GB 版本,RTX 5060 Ti 也有 16 GB 或 8 GB 版本,而 RTX 5060 为 8 GB。AMD 的 RX 9060 XT 有 8 GB 版本,带宽为 320 GB/s,与 16 GB 版本相同。因此,在购买或比较之前,务必查看具体型号的规格表,确认显存容量。

NVIDIA 8 GB
RTX 4060,RTX 5060,RTX 3060、4060 Ti 和 5060 Ti 的 8 GB 版本,以及旧款的 RTX 3070、3060 Ti 或 2060 Super
AMD 8 GB
RX 9060 XT 8 GB,RX 7600,RX 6600 XT,RX 5700 XT
注意:RX 7600 XT
这张卡是16GB,不是8GB:llama.cpp性能表中明确列出其配备16GB GDDR6显存。该指南的早期版本错误地将其标为8GB。

Mac 使用统一内存,并与系统共享:配备 8 GB 内存的 MacBook Air 并不会将全部 8 GB 都留给 AI。MacBook Air M1 和 M2 的专门指南详细说明了还剩多少内存可用;如果完全没有独立显卡,无 GPU 运行 LLM 的指南会按 RAM 容量列出可用模型。

#在8GB显存下可预期的推理速度

文本生成时,每生成一个 token 都要读取几乎全部权重:最大速度等于内存带宽除以权重大小。在 RX 9060 XT 8 GB(据 AMD 公布,带宽为 320 GB/s)上,Q4 量化的 Qwen 3.5 9B(6 GB)的理论上限约为每秒 53 个 token,Q4 量化的 Granite 4.2 8B(4.6 GB)则约为每秒 70 个 token。换一张显卡,上限也会不同;实际速度始终低于理论上限。

我们不按显卡发布 tokens/秒数据:生成速度取决于驱动程序、软件和上下文,而且没有我们可以引用的公开基准测试涵盖这些模型在这些显卡上的表现。llama.cpp 的社区表格测试了采用 Q4_0 量化的 Llama 2 7B,为一款旧款 8 GB 显卡提供了参考:RX 5700 XT 在 ROCm 下的生成速度为 67 tokens/s。对于您的硬件,请实际测量:运行 ollama run 时添加 --verbose 选项,即可显示生成速度。

测量自身的运行速度
ollama run <nom-du-modèle> --verbose
!
当显存容不下模型时,速度会骤降
如果模型有一部分无法装入 VRAM,Ollama 会将这部分放入系统内存,并交由 CPU 运行。生成速度便会受 RAM 速度限制,通常会慢上数倍。ollama ps 会显示模型在 GPU 和 CPU 之间的分配情况:应以模型完全在 GPU 上运行(100% GPU)为目标。

#8 GB 显存下,不同用途该选哪些模型

QuelLLM 目录可以帮助您针对每种用途找到一个留有余量的模型。模型宣称的最大上下文长度并不意味着您就能用到:在 8 GB 显存下,限制实际长度的是加载模型权重后剩余的显存,而不是目录中的数字。

各使用场景的入门选择(QuelLLM 目录)
用途模型Q4 权重备注
对话与写作Qwen 3.5 9B6 GB标称上下文长度为 262,000 个 token;在 8 GB 显存下,实际可用长度远低于这一数值
日常任务,余量充足Granite 4.2 8B4.6 GB宣称的上下文长度为 128,000 个 token;为 KV 缓存留出更多空间
代码补全Qwen 2.5 Coder 7B5 GB70 亿参数的代码模型,公布的上下文长度为 131 072 个 token
后台小任务Qwen 3.5 4B2.3 GB为其他工具保留部分VRAM
视觉与多模态Gemma 4 12B7 GB标注支持视觉和音频;勉强能装入 8 GB 显存

有两点值得说明。标注了视觉能力的模型需要为图像编码器额外占用内存,因此,一个采用 Q4 量化的 120 亿参数多模态模型一旦加载图像,内存占用很快就会超过 8 GB。而对于代码,一个采用 Q4 量化的 70 亿参数专用模型(5 GB)能装得下且留有余量,响应也比更大的通用模型更快,这对行内代码补全很重要。

#充分利用 8 GB 显存的五项设置

这些设置中的任何一个都无法替代 VRAM,但它们能将极限推移数百兆字节至一吉字节,这足以将上下文从 4 000 个 token 扩展到 16 000 个 token。

限制上下文
根据 Ollama 的文档,其默认上下文窗口为 4 096 个 token;可通过 OLLAMA_CONTEXT_LENGTH 修改。如果只是用短消息聊天,请不要将上下文窗口设为 32 000 个 token。
量化KV缓存
OLLAMA_KV_CACHE_TYPE=q8_0 相比默认的 f16 几乎将缓存内存减半;该设置需要 Flash Attention。
让 Flash Attention 发挥作用
Ollama 在后端和显卡支持的情况下会自动启用;您可以通过设置 OLLAMA_FLASH_ATTENTION=1 强制启用。
释放显存
浏览器、游戏和视频应用会占用显存。加载模型前,请关闭这些应用;如果机器配有集成显卡,也可以将显示器连接到集成显卡。
根据显存余量选择 Q4 或 Q5
在 8 GB 显存下,Q4_K_M 是合适的默认选择。只有当使用更小的模型并留出超过一吉字节空闲空间时,才应切换到 Q5。
Ollama 采用量化KV缓存
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=8192 ollama serve

#8GB 无法支持的功能:RAG、代码处理、大模型

完整的 RAG 流水线包含一个嵌入模型、一个可选的重排序模型,以及负责撰写回答的 LLM。8 GB 显存难以轻松容纳这套组合:仅生成模型本身就占用 5 到 6 GB。有两种解决办法:让嵌入模型在 CPU 上运行,这对于索引处理完全可以接受;或者选择较小的生成模型,例如 Q4 量化的 Qwen 3.5 4B(2.3 GB)。对于行内代码补全,70 亿参数的模型就足够了;但对于需要读取大文件的代码智能体,所需上下文超出了 8 GB 显存能够容纳的范围。

对于 140 到 320 亿参数的模型,需升级到新的层级。网站规则指出,14B ≈ 9 GB,32B ≈ 19 至 20 GB(Q4 量化,无上下文):因此 8 GB 以上,14B 才是真正的分水岭,故建议设置 12 GB 的层级以提供充足余量。请勿依赖极端卸载技巧:一个只有一半权重驻留在 RAM 中的模型虽可运行,但读取速度会严重削弱交互体验。

#何时升级到12GB或16GB

提升容量能带来什么收益
档位新增可实现的用途Guide
12 GBGemma 4 12B 采用 Q8 量化,Qwen 3.5 9B 采用 Q8 量化,RAG 更轻量12 GB 显存适合运行哪个 LLM
16 GB200至240亿参数的Q4模型(gpt-oss 20B、Mistral Small 24B),还能留出一些上下文空间拥有 16 GB VRAM 时选哪个 LLM
24 GB采用Q4量化、支持长上下文的270亿参数稠密模型24 GB 显存适合哪个 LLM

购买时应关注每 GB 显存的价格,而非整张显卡的价格。本站的价格跟踪功能会为每张显卡计算这一指标,每周更新两次;做决定前请查阅,因为全新显卡与二手显卡之间的价格差距经常变化。

#常见问题

常见问题
8 GB VRAM 下最适合的 LLM 是什么?+
Qwen 3.5 9B 的 Q4 量化版本是最佳通用模型,可使用数千个 token 的上下文;根据 QuelLLM 目录,其权重大小约为 6 GB。Granite 4.2 8B 的 Q4 量化版本(4.6 GB)为长上下文留出了更多余量。对于代码补全,70 亿参数的专用模型已足够。
能否在 8GB 显存上运行 14B 模型?+
无法流畅运行。按照本站的估算规则,14B 模型在 Q4 量化下的权重约占 9 GB,超过这张显卡的显存容量。部分计算会转由 CPU 执行,速度会大幅下降。Gemma 4 12B 在 Q4 量化下(7 GB)也只能勉强装入显存,没有留给上下文的余量:建议选择 9B 模型。
如何判断模型能否完全装入我的显存?+
先让模型生成回答,再输入 ollama ps:PROCESSOR 列显示 GPU 和 CPU 之间的分配情况,目标是达到 100% GPU。如果有一部分交由 CPU 处理,请缩短上下文,使用 OLLAMA_KV_CACHE_TYPE 量化 KV 缓存,或选择更小的模型。
RX 7600 XT 是否有 8 GB 显存?+
不,它配备 16 GB GDDR6 显存,llama.cpp 的性能表也显示了这一点。这是一个常见误解,因为基础版 RX 7600 的显存为 8 GB。请务必核实具体显卡型号的显存容量:多个系列都有 8 GB 和 16 GB 版本,例如 RTX 5060 Ti 和 RX 9060 XT。
8 GB 足够用 LLM 开发一个应用吗?+
如果是用80亿参数模型制作聊天或信息提取应用的原型,可以。如果是生产环境中的RAG,且同时使用嵌入模型、重排序模型和140亿参数模型,则不够:建议配备12至16 GB显存。您也可以在CPU上运行嵌入模型,为LLM腾出显存。
一台8GB内存的Mac是否等同于一台配备8GB显存的PC?+
不等同。在 Mac 上,内存采用统一内存架构,并与系统和应用程序共享:真正可供模型使用的部分少于 8 GB。在配备独立显卡的 PC 上,8 GB 显存专供 GPU 使用,因此能为模型留出更多空间。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。