进阶 11 分钟RTX 20

在 RTX 2080 Ti(11 GB)上运行哪个 LLM? ?

直接回答

凭借 11 GB GDDR6 显存和 616 GB/s 带宽,RTX 2080 Ti 可以运行 Q4 量化的 120 亿参数模型,如 Gemma 4 12B(7 GB),或 Q8 量化的 80 亿参数模型,如 Granite 4.2 8B(9 GB),而无需将部分模型加载到系统内存。在 llama.cpp 基准测试中,它运行 7B Q4_0 模型时的生成速度为每秒 107 个 token。这是一款少见的 2018 年显卡,其显存容量至今仍有实用价值。

RTX 2080 Ti(2018 年 9 月)是 Turing 一代中唯一显存超过 8 GB 的显卡:它拥有 11 GB 显存。本指南将其规格与公开测量结果联系起来,说明哪些模型能装入其显存,比较它与较新显卡在容量和速度方面的权衡,并介绍如何安装以及检查模型是否完全装入显存。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5060 Ti 16GB (ASUS Prime).

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#2026 年的 RTX 2080 Ti:关键在于显存容量

RTX 2080 Ti 能运行 120 亿参数的 Q4 模型而不超出显存容量,这是任何 8 GB 显卡都难以妥善做到的。根据 QuelLLM 目录,Gemma 4 12B 在 Q4 下大小为 7 GB,Granite 4.2 8B 为 4.6 GB,Qwen 3.5 9B 为 6 GB;在 Q8 下,Granite 4.2 8B 增至 9 GB,也能装入 11 GB 显存。该显卡采用 TU102 芯片,配备 4,352 个 CUDA 核心,以及通过 352 位总线连接的 11 GB GDDR6 显存,带宽为 616 GB/s。在 llama.cpp 的公开表格中,它使用 70 亿参数的 Q4_0 模型时,生成速度达到每秒 107.5 个 token。速度与容量的这种结合,解释了为何 2080 Ti 依然有价值:较新的 8 GB 显卡虽然在游戏中超过它,却没有在 AI 中超过它。

架构
Turing,TU102芯片,2018年9月发布。
内存
11 GB GDDR6,352 位总线,616 GB/s 带宽
Cœurs
4352 个 CUDA 核心和第二代张量核心
电源
请查阅您所用具体型号的规格说明:不同厂商的出厂版本存在差异。

#可在 11 GB 显存下运行的模型

适用于 RTX 2080 Ti 的模型(权重大小依据 QuelLLM 目录)
模型Q4Q5Q8在 11 GB 显存上
Granite 4.2 8B4.6 GB6 GB9 GBQ4 和 Q5 都能轻松运行,Q8 在上下文长度适中的情况下也可运行
Qwen 3.5 9B6 GB7 GB10 GBQ4 和 Q5 都能宽裕地运行;Q8 留给上下文的空间仅勉强达到 1 GB
Gemma 4 12B7 GB9 GB13 GBQ4可留出3至4 GB余量;Q5勉强装得下;Q8装不下

Q5 一列展示了 11 GB 显存显卡的优势:对于 8B 或 9B 模型,可以选择比 Q4 更忠实的量化方式,而不必作出任何牺牲。相比之下,12B 模型的 Q5 版本(9 GB)留给缓存的空间不足 2 GB,因此会限制上下文长度。具有较大上下文窗口的 Q4 模型,往往比窗口狭小的 Q5 模型更实用:请根据您的用途权衡,是总结长文档,还是进行简短对话。

两个实用参考。首先,8B 模型的 Q8 量化版本(9 GB)能装入这张显卡的显存,质量非常接近全精度版本:这是 8 GB 显存显卡无法实现的用法。其次,12B 模型采用 Q4 量化时剩余的 3 至 4 GB 空间会被上下文消耗:超过数千个 token 后,请量化 K/V 缓存或缩小上下文窗口。关于量化等级的选择,专题指南详细介绍了质量损失。

#安装与验证

Ollama 支持 Turing 架构:文档将 RTX 2080 Ti、2080、2070 和 2060 列为计算能力 7.5 的显卡,并要求使用 550 或更新版本的驱动程序。操作流程与其他 NVIDIA 显卡相同,但最后有一项重要检查:确认模型已完整加载到显卡中。

  1. 01
    更新驱动程序
    安装 550 或更新版本的 NVIDIA 驱动程序,然后使用 nvidia-smi 检查显卡是否已被识别,并确认显示的显存容量为 11 GB。
  2. 02
    安装 Ollama
    根据您的系统遵循 Ollama 的安装指南,然后使用 ollama run 命令启动模型。
  3. 03
    检查分配情况
    输入 ollama ps:Processor 列应显示 100% GPU。如果出现 CPU 占比,说明部分模型已转移到系统内存中运行:请缩短上下文或换用更小的模型。
  4. 04
    根据需要调整 K/V 缓存
    启动 Ollama 时,请设置 OLLAMA_FLASH_ATTENTION=1 和 OLLAMA_KV_CACHE_TYPE=q8_0,以提升长上下文的内存效率。

#速度:llama.cpp 测量的是什么

llama.cpp 仓库中的协作表格给出了 RTX 2080 Ti 的数据:运行 Llama 2 7B Q4_0(文件大小为 3.56 GiB)时,生成速度为每秒 107.5 个 token,提示词读取速度为每秒 2,891 个 token。启用 Flash Attention 后,这两个数值分别变为 109.2 和 3,108。有一点值得注意:616 GB/s 的带宽理论上可使这个 3.82 GB 的文件达到每秒约 161 个 token,但实测速度仅达到理论值的 67%。性能较低的显卡反而更接近理论值。因此,实际吞吐量还取决于内存之外的因素,例如频率或驱动程序;表格本身也提醒,结果会因显卡和系统而异。

要估算当前模型的速度,可以按文件大小进行比例换算。例如,Q4 量化的 Granite 4.2 8B 这类大小为 4.6 GB 的模型,速度最多为 107.5 × 3.82 ÷ 4.6,即约每秒 89 个 token。对于大小为 7 GB 的 Gemma 4 12B,速度则降至约每秒 59 个 token。这些是理论上限,不是实测结果;较新的架构可能偏离这些估算值。无论如何,这些速度都超过了阅读速度。

#长上下文和文档:读取提示词及 K/V 缓存

生成速度只是体验的一半:一旦你粘贴文档或在文件中启动搜索,真正造成等待的是提示词的读取。llama.cpp 的表格会单独测量这一过程(pp512)。在每秒2891个token的速度下,2080 Ti读取一个10000个token的文档仅需稍多于三秒半,而3060 12GB(2138)则需要约四秒半,3080 10GB(5014)仅需两秒。该计算为理论值,假设了恒定的吞吐量,但能反映大致情况:2080 Ti在RAG场景下依然表现良好。

第二个限制是显存。K/V 缓存会随着上下文长度增加而增长;一个 Q4 量化的 12B 模型如果只留下 3 至 4 GB 的余量,长文档很快就会耗尽这部分空间。Ollama 文档说明,启用 Flash Attention 时可以量化 K/V 缓存,而 q8_0 格式的内存占用约为默认 f16 格式的一半。这项设置对整个 Ollama 实例生效,适用于该实例提供服务的所有模型。

Linux:Flash Attention及q8_0格式的K/V缓存
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

通过实际测量来逐步试验:加载模型,填充与实际使用情况相当的上下文,然后用 ollama ps 确认模型仍然 100% 在 GPU 上运行。如果模型无法完全装入显存,成本最低的解决办法几乎总是先缩小上下文窗口,再考虑更换模型或显卡。上下文窗口指南介绍了如何调整这一设置。

#2080 Ti、3060 12GB、5060 Ti 16GB:如何权衡选择

使用 Llama 2 7B Q4_0 生成文本(llama.cpp 公开表格)
显卡内存生成速度 (tok/s)提示词读取速度 (tok/s)
RTX 3060 12 GB12 GB75,62 138
RTX 5060 Ti 16 GB16 GB90,93 737
RTX 2080 Ti11 GB107,52 891
RTX 3080 10 GB10 GB139,75 014

2080 Ti 的生成速度比 3060 12GB 快约 42%,甚至比 16GB 的 RTX 5060 Ti 更快,后者受限于 128 位显存总线。不过,在显存容量方面,2080 Ti 落后于另外两者:分别为 11GB、12GB 和 16GB。因此,选择取决于目标模型。对于 Q4 量化的 12B 模型,2080 Ti 足够,而且仍是三者中最快的。对于 200 亿参数及以上的模型,或超长上下文,需要 16GB 显存,此时新一代显卡成为最佳选择。价格每周都在变化;本站的价格跟踪提供每 GB 显存的价格。

问题1:您想使用哪个模型?
80 亿至 120 亿参数的模型:保留或购买 2080 Ti。200 亿参数或更大的模型:选择 16 GB 显存的显卡。
问题 2:上下文长度是多少?
几千个 token:11 GB 足够。数万个 token:剩余显存空间就不够了。
问题 3:用电预算是多少?
请将您所用显卡型号的规格表中标注的功耗与较新显卡的功耗进行比较;在速度相近的情况下,较新显卡更省电。

#Turing 支持情况:哪些已确认,哪些尚未确认

Turing 目前是 CUDA 13 支持的最低架构:发行说明指出,其库已停止支持更早的架构(Maxwell、Volta、Pascal)。这意味着 2080 Ti 仍受支持,但也意味着它是仍在支持范围内的最老显卡之一。已查阅的资料均未宣布将停止支持 Turing;不过,新一代硬件的新特性(例如更节省资源的计算格式)永远不会在该架构上提供。对于使用常规 GGUF 模型的 llama.cpp 和 Ollama 来说,这并不构成障碍。

#2026 结论

在以下情况下继续保留
您已经拥有这张显卡:它拥有 11 GB 显存,运行 7B 模型时可达到每秒 107 个 token,因此在 AI 用途中比许多较新的 8 GB 显卡更实用。
符合以下条件时,可购买二手显卡
其价格明显低于 12 至 16 GB 显存的显卡,且您的目标模型是 8B 或 12B。请检查风扇状态和保修情况;这些显卡已有数年的使用历史。
在以下情况下升级至 16 GB
您希望运行 200 亿参数或更大的模型,或使用数万个 token 的上下文。

#常见问题

常见问题
RTX 2080 Ti在2026年是否仍适用于LLM?+
是的,主要得益于它的 11 GB 显存。它可以运行 Q4 量化的 12B 模型,例如 Gemma 4 12B(7 GB),也可以运行 Q8 量化的 8B 模型,而 8 GB 显存的显卡做不到。在 llama.cpp 的公开测试中,它运行 Q4_0 量化的 7B 模型时,每秒生成 107 个 token,使用起来非常流畅。
运行 LLM,该选 RTX 2080 Ti 还是 RTX 3060 12 GB?+
2080 Ti 的运行速度比 75.6 tokens/秒快约 42%(达到 107.5 tokens/秒),3060 配备额外 1GB 显存且功耗更低。对于 12B 模型的 Q4 量化,这两款显卡均足够,其中 2080 Ti 更快。3060 12GB 主要因其价格更便宜和功耗更低而具有优势。
RTX 2080 Ti 上每秒能处理多少 token?+
llama.cpp 公开表格显示,Llama 2 7B 在 Q4_0 模式下每秒可处理 107.5 个 token。模型越重,速度越慢,大致呈比例关系:8B 模型(4.6 GB)约 89 token/秒,12B 模型(7 GB)约 59 token/秒(理论估算值)。长上下文会进一步降低这些数值。
RTX 2080 Ti 支持 Flash Attention 吗?+
支持:llama.cpp 的表格列出了一项 2080 Ti 启用 Flash Attention 的测试结果,速度为每秒 109.2 个 token,而未启用时为每秒 107.5 个 token。Ollama 会在显卡支持时自动启用该功能,您也可以通过 OLLAMA_FLASH_ATTENTION=1 强制启用。主要优势是节省长上下文所需的内存。
如何判断显卡显存能否完整容纳我的模型?+
运行 ollama ps:当模型完全加载到显卡中时,Processor 列会显示 100% GPU。像 48%/52% CPU/GPU 这样的比例表示模型分布在系统内存和显存中,因此速度会明显下降。此时,请缩短上下文长度、量化 K/V 缓存,或选择更轻量的模型。
RTX 2080 Ti 是否有失去支持的风险?+
查阅过的来源均未宣布停止支持。Ollama 将这张显卡列在计算能力为 7.5、要求驱动版本为 550 或更新版本的显卡之中,而 CUDA 13 将 Turing 作为最低支持架构。每次 CUDA 进行重大版本更新时,请留意发行说明:如果取消支持,会在那里宣布。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。