进阶 11 分钟RTX 20

在 RTX 2080 / 2080 Super(8 GB)上运行哪些 LLM? ?

直接回答

一块 RTX 2080 或 2080 Super(8 GB GDDR6)可轻松运行具有 70 亿至 90 亿参数的 Q4 量化模型,例如 Granite 4.2 8B(4.6 GB)或 Qwen 3.5 9B(6 GB)。目前尚无这两款显卡的公开实测数据,但其 256 位显存总线使其性能处于 2070 Super 的水平,运行 7B 模型时约为 88 tokens/s。限制仍在于 8 GB 的显存容量。

RTX 2080(2018年9月)和 RTX 2080 Super(2019年7月)曾是高端显卡;到了2026年,它们用于本地 AI 的优势已较为有限,因为显存只有 8 GB。本指南区分有文档依据的信息与估算,将这些显卡与 12 GB 显存的替代方案进行比较,并说明如何验证模型是否确实能装入显存。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5060 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RTX 2080 和 RTX 2080 Super:它们能运行什么模型

在 RTX 2080 或 2080 Super 上,70 亿到 90 亿参数的模型在 Q4 量化下可以完全装入显存并快速运行。根据 QuelLLM 目录,Granite 4.2 8B 在 Q4 下需要 4.6 GB,Qwen 3.5 9B 需要 6 GB,这为数千个 token 的上下文留出了余量。Gemma 4 12B(Q4 下 7 GB)接近 8 GB 的上限,一旦对话变长就会超出显存容量。这两款显卡都没有出现在 llama.cpp 的公开性能表中;不过仍可估计它们的性能水平,因为它们与 2070 Super 一样采用 256 位总线,而后者在 70 亿参数模型的 Q4_0 量化版本上测得每秒 88 个 token。2080 Super 的显存速度更快,表现应该略好一些。总之:速度快,但受限于其 8 GB 显存。

RTX 2080
2018年9月,2944个CUDA核心,8 GB GDDR6显存,256位总线,带宽达448 GB/s(14 Gbit/s)
RTX 2080 Super
2019 年 7 月,3072 个 CUDA 核心,8 GB GDDR6 显存,数据传输速率为 15.5 Gbit/s,对应带宽为 496 GB/s,比 2080 高约 11%。
对于 LLM
生成主要取决于带宽:Super 略有优势,容量不变。

#兼容模型:8 GB 显存能容纳哪些模型

适用于 RTX 2080 / 2080 Super 的模型(模型大小依据 QuelLLM 目录)
模型Q4 量化后的模型大小在 8 GB 显存上的预期表现
Granite 4.2 8B4.6 GB舒适体验,支持数千 token 的上下文
Qwen 3.5 9B6 GB采用 Q4 量化时可装入显存;上下文长度适中,必要时调整 K/V 缓存
Gemma 4 12B7 GB空间太紧:已容不下缓存和系统所需的内存
Qwen 3.5 9B Q8 量化版10 GB装不下:所需显存超过 8 GB

所有模型的推理逻辑一致:模型权重越大,上下文容量越长,所需显存约增加一吉字节,用于驱动和显示设备。若屏幕直接连接至该显卡,部分显存已为其预留。在8GB显存下,模型权重最大控制在6GB以内是稳妥做法。对于更长的上下文,缓存K/V的量化是效果最显著的优化手段。

#确认模型是否真的能装入显存

许多速度下降问题源于模型无法完全放入显存:Ollama 会将部分模型交由 CPU 运行,吞吐量随之下降,却不会显示错误消息。Ollama 文档说明了如何检查这一情况:ollama ps 命令会在 Processor 列中显示模型加载到哪种内存中。100% GPU 表示模型完全位于显卡中,而 48%/52% CPU/GPU 这样的比例则表示模型分别加载在 RAM 和显存中。

  1. 01
    加载模型
    使用 ollama run 命令并在其后加上模型名称来启动模型,然后发送第一个提示词。
  2. 02
    查看资源分配情况
    在另一个终端中输入 ollama ps。记录 Processor 列的内容和显示的大小。
  3. 03
    必要时进行修正
    如果模型没有 100% 加载在 GPU 上,请减少上下文、选择更轻的量化或改用更小的模型。量化 K/V 缓存也有帮助;文档指出这需要 Flash Attention。
控制GPU与CPU的分配
ollama ps

#速度:实际测量值与估算值

llama.cpp 的社区协作表(Llama 2 7B,Q4_0,文件大小为 3.56 GiB)收录了 2070 Super、2080 Ti、3060 12 GB 和 4060 Ti 8 GB 的数据,但没有收录 2080 或 2080 Super。该表说明,即使芯片相同,结果也会因驱动、系统和显卡而异。下面先列出实际测量结果,再说明可以合理推导出的结论。

测试llama.cpp,Llama 2 7B Q4_0,生成速度(tokens/s)
显卡内存总线生成状态
RTX 2070 Super8 GB256位88,1已公布的实测结果
RTX 2080 / 2080 Super8 GB256位约88至97估算:总线相同,Super 版的显存速度更快
RTX 2080 Ti11 GB352位107,5已公布的实测结果
RTX 3060 12 GB12 GB192位75,6已公布的实测结果
RTX 4060 Ti 8 GB8 GB128 位63,9已公布的实测结果

2080显卡的性能估算遵循一个简单规则:当显存带宽达到448 GB/s时,2080的输出吞吐量应与2070 Super非常接近;当带宽提升至496 GB/s时,2080 Super最多可提升约10%,即达到每秒95个tokens的量级。这仅是预测,而非实测数据:请勿将其作为实际结果引用。

该表格为犹豫是否更换显卡的用户提供了重要启示:尽管RTX 4060 Ti 8GB是更新的型号,其文本生成速度(63.9个token/秒)却低于2070 Super,原因在于其128位显存总线限制了带宽。在文本生成方面,更先进的GPU并不一定意味着更高的速度。它带来的主要优势是能效提升和新功能,而非显存容量。

#2080 Super 或 RTX 3060 12GB:显存容量更重要

3060 12 GB的生成速度低于2070 Super(测试中分别为75.6和88.1 token/秒),但显存多出4 GB。这才是本地 AI 的关键:12 GB显存可以容纳 Gemma 4 12B(Q4量化后为7 GB),并为上下文留出余量,而8 GB显存的显卡做不到。2080 Super也无法靠速度弥补这一不足,因为即使生成速度提升到约95 token/秒,也改变不了显存装不下12B模型这一事实。

2080 Super 或 3060 12 GB:如何取舍
标准RTX 2080 SuperRTX 3060 12 GB
内存8 GB12 GB
生成(7B Q4_0)估计约为 95 个 token/秒75.6 tokens/s(测量值)
120亿参数模型否(模型权重占 7 GB,没有余量)可以,并留有上下文空间
70至90亿参数的模型是是

因此,结论取决于您的目标。对于拥有 80 亿或 90 亿参数的助手,您的 2080 已经足够,升级到 3060 12 GB 不会带来任何速度提升。如果目标是 12B 模型或长上下文,升级就有理由。二手价格每周都在变化:请查看价格跟踪信息,而不要依赖一个固定数字。

#8 GB 显存下的长上下文:K/V 缓存是关键

对于显存为8GB的显卡,问题不在模型本身,而在上下文缓存。对话中的每个token都会增加内存中的数据量,一个在没有上下文时能装入显存的8B Q4模型,在您粘贴长文档后就可能超出显存容量。Ollama提供了两种调节手段。Flash Attention会在显卡支持时由软件自动启用,可减少上下文增长时所需的内存。启用后,还可以对K/V缓存进行量化;根据文档,q8_0格式的内存占用约为默认格式的一半。q4_0格式能节省更多内存,但在较长上下文下会更明显地降低精度。

Linux:强制启用Flash Attention,并将缓存量化为q8_0
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

此设置为全局配置:适用于实例中所有服务的模型,对于专用机器来说非常方便,但若频繁更改则需注意。最佳实践是先测量再调整:加载您的模型,填充代表实际使用场景的上下文,然后使用ollama ps检查模型是否始终保持在GPU上100%占用。如果确实如此,则说明有余量;否则,可尝试减少缓存大小或缩短上下文长度。

#当 8 GB 显存不再够用时:接下来的升级档位

各显存容量档位可运行哪些模型(Q4 量化权重,QuelLLM 目录)
显存容量开始能够运行的模型Q4 量化后的模型大小
8 GB(您的显卡)70至90亿参数的模型4.6至6GB
12 GBGemma 4 12B(含上下文)7 GB
16 GBgpt-oss 20B(13 GB)或 Qwen 3.5 27B(16 GB,容量余量极小)13至16 GB

这张表很容易理解:显存容量每提升一个档位,就能运行一类新的模型;而当速度超过每秒 30 或 40 个 token 后,单纯提速对使用体验几乎没有影响。如果您犹豫是否要投入购买,先想清楚自己想运行哪个模型,再选择显存容量相应的显卡。在 16 GB 显存上运行一个 270 亿参数的模型已经接近极限;如果这是您的目标,最好考虑 24 GB 显存的显卡。

#2026 年的驱动程序与技术支持

RTX 2080 和 2080 Ti 都属于 Ollama 列出的计算能力为 7.5 的显卡;Ollama 要求使用 550 或更新版本的驱动。这适用于当前各版本的 Ollama;如果安装失败,首先应使用 nvidia-smi 检查驱动版本。因此,无需担心在这些显卡上安装 Ollama 或 llama.cpp 会遇到软件层面的阻碍。唯一需要留意的是驱动版本:先更新驱动,再排查其他问题。

#2026 结论

在以下情况下继续保留
它已经装在您的电脑里,而且您的目标是运行 70 亿到 90 亿参数的 Q4 模型。速度绰绰有余,成本为零。
不要为了AI而购买
除非价格低且保修条款明确。价格接近时,12 GB 显存的显卡比每秒多生成几个 token 更有价值。
如果您符合以下情况,请考虑其他方案
您想运行 12B、14B 或更大的模型,或在 8B 模型上使用超过一万个 token 的上下文。此时需要 12 到 16 GB 显存。

#常见问题

常见问题
RTX 2080能否运行80至90亿参数的模型?+
是的。根据 QuelLLM 目录,在 Q4 量化下,Granite 4.2 8B 的大小为 4.6 GB,Qwen 3.5 9B 为 6 GB,因此在上下文长度适中的情况下,都能装入该显卡的 8 GB 显存。它的运行速度与 2070 Super 相当;后者在运行 Q4_0 量化的 7B 模型时,实测速度为每秒 88 个 token。
运行 LLM,该选 RTX 2080 Super 还是 RTX 2080 Ti?+
2080 Ti 拥有 11 GB 显存和 616 GB/s 的带宽,2080 Super 拥有 8 GB 显存和 496 GB/s 的带宽。对于 LLM,额外的 3 GB 显存比速度更重要:它们让您能够运行 120 亿参数的模型。如果预算允许,2080 Ti 是两者中更好的选择。
能否在 RTX 2080 Super 上运行 Gemma 4 12B?+
并不宽裕。目录显示 Q4 量化下的权重为 7 GB,在 8 GB 显存中仅留出一千兆字节用于上下文缓存和系统。模型可以加载,但 Ollama 会迅速将部分数据转移到 RAM 中,ollama ps 命令会显示这一点。建议优先选择 8 或 9B 模型。
如何判断我的模型是否完全运行在 GPU 上?+
使用 ollama ps 命令:当模型完全加载到显卡中时,Processor 列显示 100% GPU;当模型分布在显存和系统内存中时,则显示类似 48%/52% CPU/GPU 的比例。在后一种情况下,速度会显著下降,最好缩短上下文或选择更小的模型。
RTX 2080是否比RTX 4060 Ti 8GB在文本生成上更快?+
在 llama.cpp 的公开表格中,8 GB 版 4060 Ti 每秒生成 63.9 个 token,而 2070 Super 为 88.1 个;后者的总线与 2080 相同。4060 Ti 的 128 位总线限制了其带宽。因此,在容量相同的情况下,预计 2080 的吞吐量会更高。
到了 2026 年,Ollama 还能在 RTX 2080 上运行吗?+
是的。Ollama 将 RTX 2080 列为计算能力为 7.5 的显卡,仅要求使用 550 或更新版本的驱动。在查阅的文档中,没有宣布终止对这一显卡系列的支持;进行重大版本更新时,只需留意驱动和 CUDA 的发行说明。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。