入门 11 分钟GTX 10

在 GTX 1080 Ti(11 GB)上运行哪个 LLM? ?

直接回答

是的:GTX 1080 Ti(11 GB,484 GB/s)仍是运行本地 LLM 的最佳 Pascal 架构显卡之一。llama.cpp 的公开基准测试测得,它运行 Q4_0 格式的 Llama 2 7B 时,生成速度为 62.49 tokens/s,与 RTX 2060 Super 处于同一水平,但显存多出 3 GB。它可以容纳 Q4 格式的 8B 或 9B 模型并留有余量,也能容纳上下文长度较短的 12B 模型。不过,它未来的软件支持有限:CUDA 13 已不再支持 Pascal。

GTX 1080 Ti 于 2017 年 3 月推出,配备 11 GB GDDR5X 显存和 352 位总线。这一显存容量长期以来都很少见,至今仍让它相较于 8 GB 显存的显卡具有优势。本指南用具体数字说明这些显存如今能满足哪些需求、公开测量结果说明了什么,并纠正一个普遍误解:Pascal 架构显卡的 FP16 并不是“速度只有一半”,而是几乎无法使用;不过,对于量化模型,这一点影响不大。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#2026 年的 GTX 1080 Ti:它具备什么,又缺少什么

GTX 1080 Ti 是一款 Pascal 架构显卡(GP102 芯片),拥有 3584 个 CUDA 核心、11 GB GDDR5X 显存和 484 GB/s 带宽,功耗预算为 250 W。在 llama.cpp 的公开基准测试中,运行 Q4_0 量化的 Llama 2 7B 时,它的生成速度为 62.49 tokens/s,提示词处理速度为 1084.41 tokens/s。这些结果表明,其生成性能与 RTX 2060 Super 相当,同时多出 3 GB 显存:这种容量优势比速度更能说明它为何至今仍值得关注。

特性(维基百科,GeForce 10系列)
元素数值
芯片GP102-350,Pascal
CUDA 核心3 584
内存11 GB GDDR5X,352 位总线
带宽484 GB/s
FP32计算能力10 609 GFLOPS
FP16 计算能力166 GFLOPS
热设计功耗(TDP)250 W

表格中已经包含了最重要的信息:在这张显卡上,FP16 的性能约为 FP32 的 1/64。下一段将解释为什么这带来的影响没有想象中那么大。

#Pascal 架构的局限:哪些重要,哪些不重要

确实存在三个限制。第一个是缺少 Tensor Cores,即随 Volta 和 Turing 架构出现的矩阵计算单元:它们能加速提示词处理和训练,但不能加速依赖内存的生成过程。第二个是 FP16 在消费级 Pascal 架构上的计算吞吐量低得惊人(约 166 GFLOPS,而 FP32 为 10,609 GFLOPS):llama.cpp 等引擎通过使用整数运算计算量化模型来绕过这个问题。第三个是软件支持终止的问题,下文会介绍。

两个经常被重复的说法都是错误的。FP16 并非只是慢两倍,而是慢六十倍。而且,Flash Attention 并非仅限于 Tensor Cores:在 llama.cpp 基准测试中,1080 Ti 启用 Flash Attention 后,提示词读取速度为 1,138.14 tokens/s,生成速度为 61.38 tokens/s;未启用时则分别为 1,084.41 和 62.49 tokens/s。吞吐量的提升很小,但该功能确实可用,而且能减少上下文的内存占用。

!
不支持 FP8 和 FP4
较新的硬件量化格式(FP8、FP4)需要较新的显卡。在 1080 Ti 上,请继续使用传统的 GGUF 量化格式(Q4_K_M、Q5_K_M、Q8_0),这些格式通过整数运算工作。

#11 GB 能做什么:决策表

本站的参考数据将 Q4 量化的 8B 模型权重大小估为约 5 GB,14B 模型约为 9 GB,不含 KV 缓存。在 11 GB 显存上,12B 模型留有 4 GB 余量,而 14B 模型仅留有 2 GB。表格将测试平台上观察到的效率(达到 484 GB/s 理论上限的 49%,即在模型权重为 3.82 GB 时达到 62.49 tokens/s)应用于常见模型:这些是推算值,并非实测值。

可在 11 GB 显存上运行的模型、理论上限及按 49% 效率推算的性能
模型 (Q4)模型大小11 GB 容量下的剩余空间在 484 GB/s 带宽下的理论速度上限预测值
Granite 4.2 8B4.6 GB6.4 GB105 tokens/s约51个token/秒
Qwen3.5 9B6 GB5 GB81 tokens/s约 40 个标记/秒
Gemma 4 12B7 GB4 GB69 tokens/s约 34 tokens/s
Phi-4 14B9 GB2 GB54 tokens/s约26个token/秒,上下文较短
Gemma 4 26B-A4B(MoE)16 GB负向超出 GPU 显存容量超出硬件能力

最值得关注的是 12B:这是仍能从容运行的最大模型,还能容纳数千个 token 的上下文。在配备 8 GB 显存的显卡上,同一个模型只留下不到或勉强 1 GB 的余量,必须大幅缩短上下文。再往上,采用 Q4 量化的 14B 模型能装下,但没有余量;300 亿参数的模型则装不下。

#公开基准测试结果

QuelLLM 没有自行测试这张显卡。讨论帖「Performance of llama.cpp on Nvidia CUDA」中的基准测试使用同一个模型比较所有显卡,因此可以看出 1080 Ti 相对于相近显卡的表现。

llama.cpp CUDA 基准测试,Llama 2 7B Q4_0,不启用 Flash Attention
显卡内存提示词 (pp512)生成(tg128)
GTX 1080 Ti11 GB GDDR5X,352 位1,084.41 tokens/s62.49 tokens/s
Tesla P40 (Pascal)24 GB GDDR5,384 位1,007.42 tokens/s54.74 tokens/s
RTX 2060 Super8 GB GDDR6,256 位1,420.24 tokens/s60.04 tokens/s
RTX 306012 GB GDDR6,192 位2,137.50 tokens/s75.57 tokens/s
RTX 2080 Ti11GB GDDR6,352位2890.66 tokens/s107.51 tokens/s

可以得出三个结论。在生成阶段,1080 Ti 与 RTX 2060 Super 相当,仍比 12 GB 的 RTX 3060 慢 17%。在读取提示词时,差距进一步拉大:RTX 3060 的速度几乎是它的两倍,而显存容量相同的 RTX 2080 Ti 的速度是它的 2.7 倍。最后,Tesla P40 这张采用 Pascal 架构、配备 24 GB 显存的显卡达到了 54.74 tokens/s:这说明该架构能够提供 24 GB 的显存容量,但吞吐量低于 1080 Ti。

i
生成与提示词处理的对比
对于短消息聊天,耗时主要在生成阶段,1080 Ti 仍有竞争力。对于长文档摘要或 RAG,提示词的读取速度很重要:Turing 和 Ampere 架构的显卡在这一环节有 2 至 3 倍的速度优势。

#充分利用11 GB显存:降低量化强度

11GB版本的一个优势是可以在模型质量上提升,而非单纯增加模型大小。QuelLLM目录显示,一个Granite 4.2 8B在Q4下为4.6GB,在Q5下为6GB,在Q8下为9GB。在8GB配置下,仅Q4有余量;而在11GB配置下,Q5(6GB)使用非常舒适,Q8(9GB)在短上下文场景下也能顺利运行。

Granite 4.2 8B 在 11 GB 显存下不同量化方式的表现
量化模型大小余量在 484 GB/s 带宽下的理论速度上限
Q44.6 GB6.4 GB105 tokens/s
Q56 GB5 GB81 tokens/s
Q89 GB2 GB54 tokens/s

取舍很明确:量化精度每提高一个档位,模型错误就会减少,但生成速度也会下降,因为每生成一个 token 都要重新读取更多权重。对于日常聊天,Q5 是一个不错的平衡点;当生成速度不太重要而需要精确性时(如信息提取、代码任务),采用 Q8 就有理由。量化指南详细说明了质量上的差异。

#两块显卡凑出 22 GB:有可能,但需验证

llama.cpp 基准测试的说明指出,拥有多个 GPU 的贡献者必须使用 -sm none -mg 强制只使用一个 GPU,除非模型太大,无法装入显存:这说明该引擎确实能够将一个模型分配到多张显卡上。两张 GTX 1080 Ti 可为权重提供 22 GB 显存,足以容纳一个 320 亿参数的 Q4 模型(根据本站的参考数据,需 19 至 20 GB),但没有为上下文留下余量。

分摊运行并不会让速度相加:模型各层分配到不同显卡上,数据经 PCIe 总线传输,因此性能提升有限。这种配置还需要合适的机箱、电源和主板,并且会让受 Pascal 支持终止影响的硬件数量翻倍。对于需要 24 GB 显存的项目,请先比较使用一张更新显卡的成本。

#四步安装与验证

  1. 01
    检查驱动程序
    运行 nvidia-smi。对于计算能力为 5.0 至 6.2 的显卡,例如 GTX 1080 Ti,Ollama 的文档要求驱动版本为 570 或更高版本。
  2. 02
    安装 Ollama
    请按照适用于您操作系统的安装指南操作。Ollama 在其官方列表中将该显卡识别为 GTX 1080 Ti(计算能力 6.1)。
  3. 03
    选择合适的模型
    先从 Q4 的 8B 模型开始验证链路,然后测试 12B 模型,上下文长度为 4,096 个 token。
  4. 04
    检查模型的运行位置
    运行 ollama ps:PROCESSOR 列应显示 100% GPU。否则,请减少上下文或模型大小。

如果加载失败,不要寻找奇怪的绕过用变量:当引擎和显卡都支持 Flash Attention 时,Ollama 会自动启用它,文档中说明的变量是 OLLAMA_FLASH_ATTENTION(1 表示强制启用,0 表示禁用)。故障排除指南详细介绍了常见错误。

#帕斯卡的生命周期结束:需要提前规划的内容

CUDA 13的版本日志显示,Maxwell、Pascal和Volta架构已不再受支持。维基百科指出,NVIDIA已于2025年12月停止这些架构的Game Ready支持,安全更新将延续至2028年10月。目前,GTX 1080 Ti可配合Ollama及570版本或更高版本的驱动程序使用:未来推理引擎可能仅支持CUDA 13。请在进行任何更新前,记录您的驱动版本和Ollama版本。

#结论:已有的可以继续用;购买则需满足条件

根据您的具体情况选择
您的情况建议
您已拥有1080 Ti保留:8-12B 模型运行良好,基准测试中达到 62 tokens/s
您想不花钱运行一个 12B 模型,并留有上下文空间适用:11 GB,余量为 4 GB
您正在处理长文档或RAG任务Ampere 或 Turing 显卡的提示词读取速度是原来的 2 到 3 倍
您希望买一款能长期使用的产品选择 Turing 或更新的架构:CUDA 13 不再支持 Pascal
您想要 16 GB 或更多升级到其他档次:1080 Ti 的显存上限为 11 GB

为了比较当前可选方案,同时避免列出每周都会变化的价格,本站页面会介绍适合各档内存容量的模型,并提供显卡价格页面的链接。

FAQ
GTX 1080 Ti 在 2026 年仍能运行 LLM 吗?+
可以。llama.cpp 的公开基准测试在 Q4_0 量化的 7B 模型上测得 62.49 tokens/s;这张显卡的 11 GB 显存可以容纳 8B 或 9B 模型并留有余量,也能容纳上下文长度适中的 12B 模型。只要工具仍支持 Pascal 架构,这张显卡就仍有使用价值。
运行 LLM,该选 GTX 1080 Ti 还是 RTX 2060 Super?+
在生成性能方面,两者表现相当:基准测试结果分别为 62.49 和 60.04 tokens/s。1080 Ti 多出 3 GB 显存,这对 12B 模型很重要;2060 Super 读取提示词更快(1420 对 1084 tokens/s),且仍受 CUDA 13 支持。
运行大语言模型时,GTX 1080 Ti 是否比 RTX 3060 更慢?+
是的,生成速度下降 17%(62.49 对比 75.57 tokens/s),提示词读取速度几乎减半(1084 对比 2137 tokens/s)。3060 显存为 12 GB 对比 11 GB,容量优势微乎其微。3060 的主要优势在于更长的软件支持周期。
1080 Ti 支持 Flash Attention 吗?+
是的。llama.cpp 基准测试在启用 Flash Attention 时测得,该显卡处理提示词的速度为 1,138.14 tokens/s,生成速度为 61.38 tokens/s。吞吐量提升不大,但该功能可减少上下文的内存占用。当显卡支持该功能时,Ollama 会自动启用它。
GTX 1080 Ti 配合 Ollama 需要什么显卡驱动?+
Ollama 文档要求 compute capability 5.0 至 6.2 的显卡(包括 GTX 1080 Ti)使用 NVIDIA 570 或更高版本的驱动程序。安装前请使用 nvidia-smi 检查您的版本。NVIDIA 计划为 580 分支提供安全更新直至 2028 年 10 月,但不会提供新的优化。
何时应更换GTX 1080 Ti?+
当您需要的工具不再支持 Pascal 架构,或者您的使用场景需要超过 11 GB 的显存或快速处理提示词时,例如处理长文档和使用 RAG,就该考虑更换。CUDA 13 已经移除了对 Pascal 的支持:每次更新 Ollama 或 llama.cpp 时,都应留意这一信号。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。