在 RTX 2080 / 2080 Super(8 GB)上运行哪些 LLM? ?
一块 RTX 2080 或 2080 Super(8 GB GDDR6)可轻松运行具有 70 亿至 90 亿参数的 Q4 量化模型,例如 Granite 4.2 8B(4.6 GB)或 Qwen 3.5 9B(6 GB)。目前尚无这两款显卡的公开实测数据,但其 256 位显存总线使其性能处于 2070 Super 的水平,运行 7B 模型时约为 88 tokens/s。限制仍在于 8 GB 的显存容量。
RTX 2080(2018年9月)和 RTX 2080 Super(2019年7月)曾是高端显卡;到了2026年,它们用于本地 AI 的优势已较为有限,因为显存只有 8 GB。本指南区分有文档依据的信息与估算,将这些显卡与 12 GB 显存的替代方案进行比较,并说明如何验证模型是否确实能装入显存。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: RTX 5060 Ti 16 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RTX 2080 和 RTX 2080 Super:它们能运行什么模型
在 RTX 2080 或 2080 Super 上,70 亿到 90 亿参数的模型在 Q4 量化下可以完全装入显存并快速运行。根据 QuelLLM 目录,Granite 4.2 8B 在 Q4 下需要 4.6 GB,Qwen 3.5 9B 需要 6 GB,这为数千个 token 的上下文留出了余量。Gemma 4 12B(Q4 下 7 GB)接近 8 GB 的上限,一旦对话变长就会超出显存容量。这两款显卡都没有出现在 llama.cpp 的公开性能表中;不过仍可估计它们的性能水平,因为它们与 2070 Super 一样采用 256 位总线,而后者在 70 亿参数模型的 Q4_0 量化版本上测得每秒 88 个 token。2080 Super 的显存速度更快,表现应该略好一些。总之:速度快,但受限于其 8 GB 显存。
- RTX 2080
- 2018年9月,2944个CUDA核心,8 GB GDDR6显存,256位总线,带宽达448 GB/s(14 Gbit/s)
- RTX 2080 Super
- 2019 年 7 月,3072 个 CUDA 核心,8 GB GDDR6 显存,数据传输速率为 15.5 Gbit/s,对应带宽为 496 GB/s,比 2080 高约 11%。
- 对于 LLM
- 生成主要取决于带宽:Super 略有优势,容量不变。
#兼容模型:8 GB 显存能容纳哪些模型
| 模型 | Q4 量化后的模型大小 | 在 8 GB 显存上的预期表现 |
|---|---|---|
| Granite 4.2 8B | 4.6 GB | 舒适体验,支持数千 token 的上下文 |
| Qwen 3.5 9B | 6 GB | 采用 Q4 量化时可装入显存;上下文长度适中,必要时调整 K/V 缓存 |
| Gemma 4 12B | 7 GB | 空间太紧:已容不下缓存和系统所需的内存 |
| Qwen 3.5 9B Q8 量化版 | 10 GB | 装不下:所需显存超过 8 GB |
所有模型的推理逻辑一致:模型权重越大,上下文容量越长,所需显存约增加一吉字节,用于驱动和显示设备。若屏幕直接连接至该显卡,部分显存已为其预留。在8GB显存下,模型权重最大控制在6GB以内是稳妥做法。对于更长的上下文,缓存K/V的量化是效果最显著的优化手段。
#确认模型是否真的能装入显存
许多速度下降问题源于模型无法完全放入显存:Ollama 会将部分模型交由 CPU 运行,吞吐量随之下降,却不会显示错误消息。Ollama 文档说明了如何检查这一情况:ollama ps 命令会在 Processor 列中显示模型加载到哪种内存中。100% GPU 表示模型完全位于显卡中,而 48%/52% CPU/GPU 这样的比例则表示模型分别加载在 RAM 和显存中。
- 01加载模型使用 ollama run 命令并在其后加上模型名称来启动模型,然后发送第一个提示词。
- 02查看资源分配情况在另一个终端中输入 ollama ps。记录 Processor 列的内容和显示的大小。
- 03必要时进行修正如果模型没有 100% 加载在 GPU 上,请减少上下文、选择更轻的量化或改用更小的模型。量化 K/V 缓存也有帮助;文档指出这需要 Flash Attention。
#速度:实际测量值与估算值
llama.cpp 的社区协作表(Llama 2 7B,Q4_0,文件大小为 3.56 GiB)收录了 2070 Super、2080 Ti、3060 12 GB 和 4060 Ti 8 GB 的数据,但没有收录 2080 或 2080 Super。该表说明,即使芯片相同,结果也会因驱动、系统和显卡而异。下面先列出实际测量结果,再说明可以合理推导出的结论。
| 显卡 | 内存 | 总线 | 生成 | 状态 |
|---|---|---|---|---|
| RTX 2070 Super | 8 GB | 256位 | 88,1 | 已公布的实测结果 |
| RTX 2080 / 2080 Super | 8 GB | 256位 | 约88至97 | 估算:总线相同,Super 版的显存速度更快 |
| RTX 2080 Ti | 11 GB | 352位 | 107,5 | 已公布的实测结果 |
| RTX 3060 12 GB | 12 GB | 192位 | 75,6 | 已公布的实测结果 |
| RTX 4060 Ti 8 GB | 8 GB | 128 位 | 63,9 | 已公布的实测结果 |
2080显卡的性能估算遵循一个简单规则:当显存带宽达到448 GB/s时,2080的输出吞吐量应与2070 Super非常接近;当带宽提升至496 GB/s时,2080 Super最多可提升约10%,即达到每秒95个tokens的量级。这仅是预测,而非实测数据:请勿将其作为实际结果引用。
该表格为犹豫是否更换显卡的用户提供了重要启示:尽管RTX 4060 Ti 8GB是更新的型号,其文本生成速度(63.9个token/秒)却低于2070 Super,原因在于其128位显存总线限制了带宽。在文本生成方面,更先进的GPU并不一定意味着更高的速度。它带来的主要优势是能效提升和新功能,而非显存容量。
#2080 Super 或 RTX 3060 12GB:显存容量更重要
3060 12 GB的生成速度低于2070 Super(测试中分别为75.6和88.1 token/秒),但显存多出4 GB。这才是本地 AI 的关键:12 GB显存可以容纳 Gemma 4 12B(Q4量化后为7 GB),并为上下文留出余量,而8 GB显存的显卡做不到。2080 Super也无法靠速度弥补这一不足,因为即使生成速度提升到约95 token/秒,也改变不了显存装不下12B模型这一事实。
| 标准 | RTX 2080 Super | RTX 3060 12 GB |
|---|---|---|
| 内存 | 8 GB | 12 GB |
| 生成(7B Q4_0) | 估计约为 95 个 token/秒 | 75.6 tokens/s(测量值) |
| 120亿参数模型 | 否(模型权重占 7 GB,没有余量) | 可以,并留有上下文空间 |
| 70至90亿参数的模型 | 是 | 是 |
因此,结论取决于您的目标。对于拥有 80 亿或 90 亿参数的助手,您的 2080 已经足够,升级到 3060 12 GB 不会带来任何速度提升。如果目标是 12B 模型或长上下文,升级就有理由。二手价格每周都在变化:请查看价格跟踪信息,而不要依赖一个固定数字。
#8 GB 显存下的长上下文:K/V 缓存是关键
对于显存为8GB的显卡,问题不在模型本身,而在上下文缓存。对话中的每个token都会增加内存中的数据量,一个在没有上下文时能装入显存的8B Q4模型,在您粘贴长文档后就可能超出显存容量。Ollama提供了两种调节手段。Flash Attention会在显卡支持时由软件自动启用,可减少上下文增长时所需的内存。启用后,还可以对K/V缓存进行量化;根据文档,q8_0格式的内存占用约为默认格式的一半。q4_0格式能节省更多内存,但在较长上下文下会更明显地降低精度。
此设置为全局配置:适用于实例中所有服务的模型,对于专用机器来说非常方便,但若频繁更改则需注意。最佳实践是先测量再调整:加载您的模型,填充代表实际使用场景的上下文,然后使用ollama ps检查模型是否始终保持在GPU上100%占用。如果确实如此,则说明有余量;否则,可尝试减少缓存大小或缩短上下文长度。
#当 8 GB 显存不再够用时:接下来的升级档位
| 显存容量 | 开始能够运行的模型 | Q4 量化后的模型大小 |
|---|---|---|
| 8 GB(您的显卡) | 70至90亿参数的模型 | 4.6至6GB |
| 12 GB | Gemma 4 12B(含上下文) | 7 GB |
| 16 GB | gpt-oss 20B(13 GB)或 Qwen 3.5 27B(16 GB,容量余量极小) | 13至16 GB |
这张表很容易理解:显存容量每提升一个档位,就能运行一类新的模型;而当速度超过每秒 30 或 40 个 token 后,单纯提速对使用体验几乎没有影响。如果您犹豫是否要投入购买,先想清楚自己想运行哪个模型,再选择显存容量相应的显卡。在 16 GB 显存上运行一个 270 亿参数的模型已经接近极限;如果这是您的目标,最好考虑 24 GB 显存的显卡。
#2026 年的驱动程序与技术支持
RTX 2080 和 2080 Ti 都属于 Ollama 列出的计算能力为 7.5 的显卡;Ollama 要求使用 550 或更新版本的驱动。这适用于当前各版本的 Ollama;如果安装失败,首先应使用 nvidia-smi 检查驱动版本。因此,无需担心在这些显卡上安装 Ollama 或 llama.cpp 会遇到软件层面的阻碍。唯一需要留意的是驱动版本:先更新驱动,再排查其他问题。
#2026 结论
- 在以下情况下继续保留
- 它已经装在您的电脑里,而且您的目标是运行 70 亿到 90 亿参数的 Q4 模型。速度绰绰有余,成本为零。
- 不要为了AI而购买
- 除非价格低且保修条款明确。价格接近时,12 GB 显存的显卡比每秒多生成几个 token 更有价值。
- 如果您符合以下情况,请考虑其他方案
- 您想运行 12B、14B 或更大的模型,或在 8B 模型上使用超过一万个 token 的上下文。此时需要 12 到 16 GB 显存。
#常见问题
RTX 2080能否运行80至90亿参数的模型?+
运行 LLM,该选 RTX 2080 Super 还是 RTX 2080 Ti?+
能否在 RTX 2080 Super 上运行 Gemma 4 12B?+
如何判断我的模型是否完全运行在 GPU 上?+
RTX 2080是否比RTX 4060 Ti 8GB在文本生成上更快?+
到了 2026 年,Ollama 还能在 RTX 2080 上运行吗?+
- 来源:llama.cpp 在 CUDA 上的性能表格
- 来源:Ollama 支持的 NVIDIA 显卡
- 来源:Ollama FAQ(ollama ps,K/V 缓存)
- 数据来源:GeForce 20系列显卡规格
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。