入门 11 分钟GTX 10

GTX 1070 / 1080(8 GB)能运行哪些 LLM ?

直接回答

可以:配备8GB显存的GTX 1070、1070 Ti或1080,在上下文长度合理的情况下,能轻松运行70亿至90亿参数的Q4量化模型。llama.cpp公开基准测试测得,GTX 1070 Ti运行7B Q4_0模型时的速度为37.82 tokens/s;1080配备更快的显存,表现应该更好,但尚无直接测量数据。参数量超过90亿后,8GB显存就会成为限制,而Pascal架构在软件层面已无发展前景。

GTX 1070(2016 年 6 月)、1070 Ti(2017 年 11 月)和 1080(2016 年 5 月)使用相同的 GP104 芯片,均配备 8 GB 显存。它们已成为希望不花钱尝试本地 LLM 的人最心动的二手显卡选择。本指南用数字说明这些显卡的显存能支持什么、公开测量结果如何反映它们的速度,以及为什么 Pascal 停止支持的日期比价格更重要。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#GTX 1070、1070 Ti、1080:运行大语言模型时有何区别

对于 LLM 而言,这三款显卡的显存容量相同,均为 8 GB,区别在于决定生成速度的显存带宽。1070 和 1070 Ti 使用 256 位总线的 GDDR5,带宽为 256 GB/s;1080 使用 GDDR5X,带宽达到 320 GB/s。由于 LLM 每生成一个 token 都会重新读取全部权重,这 25% 的带宽差异几乎会直接转化为生成速度差异,其影响远大于 1080 的 2,560 个核心与 1070 的 1,920 个核心之间的数量差异。三款显卡都没有 Tensor Cores:Pascal 仍使用传统的 CUDA 计算。

三卡一览(维基百科,GeForce 10系列;测试:llama.cpp基准)
显卡CUDA 核心内存带宽实测吞吐量(7B Q4_0)
GTX 10701 9208 GB GDDR5256 GB/s未在基准测试中测量
GTX 1070 Ti2 4328 GB GDDR5256 GB/s37.82 tokens/s
GTX 10802 5608 GB GDDR5X320 GB/s未在基准测试中测量

一块 GTX 1080 Ti,配备 11 GB 显存和 484 GB/s 带宽,属于另一类:它有自己的独立页面。如果你的显卡是 1080 Ti,请参考为其专门准备的指南。

#8 GB 实际能做什么

关键在于模型权重大小与可用内存容量之间的关系,因为 KV 缓存还会占用额外内存。本站给出的参考值是:7–8B 模型经 Q4 量化后,权重大小约为 5 GB;在 8 GB 内存中,还剩约 3 GB 可用于上下文和系统,确实有一定余量。9B 模型经 Q4 量化后,权重大小为 6 GB,还剩 2 GB:上下文较短时可以运行。参数达到 120 亿时,权重大小达到 7 GB:几乎没有余量。

在 8 GB 显存上运行的模型及其理论上限(带宽 ÷ 模型权重大小;并非实测结果)
模型 (Q4)模型大小8 GB 容量下的剩余空间带宽为 256 GB/s 时的理论速度上限在 320 GB/s 带宽下的理论上限
Granite 4.1 3B2 GB6 GB128 tokens/秒160 tokens/s
Granite 4.2 8B4.6 GB3.4 GB55 tokens/s每秒 70 个 token
Qwen3.5 9B6 GB2 GB43 tokens/s53 tokens/s
Gemma 4 12B7 GB1 GB不推荐不推荐
Phi-4 14B9 GB负向超出 GPU 显存容量超出 GPU 显存容量

理论上限永远不会被达到。在公共测试平台上,GTX 1070 Ti 在 3.56 GiB 模型上达到 37.82 tokens/s,约为其 256 GB/s 理论上限的 56%。将这一效率应用于上述模型,一个 Granite 4.2 8B 在 1070 Ti 上的运行速度大约为 30 tokens/s:这是一种比例外推,而非实际测量。

#公开基准测试结果

QuelLLM 未测试这些显卡。相关数据来自 llama.cpp 仓库中的讨论“Performance of llama.cpp on Nvidia CUDA”,其中每位贡献者都在 Q4_0 量化的 Llama 2 7B 上运行 llama-bench,所有层均在 GPU 上运行。GTX 1070 Ti 在该讨论中的提示词处理速度为 714.44 tokens/s,生成速度为 37.82 tokens/s。

对同一页面中有实测数据的显卡进行比较很有参考价值:RTX 2060 Super是一款采用Turing架构、配备8 GB显存和256位显存总线的显卡,在同一测试中生成速度为60.04 tokens/s,而1070 Ti为37.82 tokens/s。在显存带宽相近的情况下,速度提升了59%。因此,比起核心或价格,这项基准测试更能解释性能差距:Turing能更高效地利用显存。

llama.cpp CUDA 基准测试,Llama 2 7B Q4_0,不启用 Flash Attention
显卡内存提示词 (pp512)生成(tg128)
GTX 1070 Ti8 GB GDDR5,256 位714.44 tokens/s37.82 tokens/s
RTX 2060 Super8 GB GDDR6,256 位1,420.24 tokens/s60.04 tokens/s
GTX 1080 Ti11 GB GDDR5X,352 位1,084.41 tokens/s62.49 tokens/s

解读这些数字时,需要注意三点。基准测试中的每一行数据都是一份个人贡献:不同贡献者使用的驱动程序、系统、散热方案和显卡厂商各不相同,这解释了为何同一芯片的成绩会相差几个点。测试模型 Llama 2 7B 比当前的模型更旧、规模更小:它只是共同的衡量基准,不能用于预测某个具体模型的表现。最后,生成主要依赖内存,而提示词处理则依赖计算能力:这两列反映的是不同的情况。

i
吞吐量差异也来自提示本身
1070 Ti 读取提示词的速度约为 2060 Super 的一半。因此,将长文档粘贴到对话中时,Pascal 上等待首次回答的时间会明显更长。

#没有实测数据时如何估算 GTX 1080 的性能:方法与局限

1080 未纳入这次基准测试。要大致估计其性能,可以按带宽比计算:320 ÷ 256 = 1.25。如果效率与 1070 Ti 相同,则约为 47 tokens/s(37.82 × 1.25)。这是一个合理的假设,而不是测试结果:驱动程序、llama.cpp 版本、温度或显卡散热都会显著影响吞吐量。

如果您为此用途购买二手显卡,请向卖家索要实际测试的截图,或在收到显卡后立即自行运行 llama-bench,测试时使用基准测试中的同一模型:结果可以直接与公开表格对比。

#上下文:预留的 3 GB 显存用在哪里

在 8 GB 显存上,Q4 量化的 Granite 4.2 8B 会留下约 3.4 GB 的余量。这部分空间由 KV 缓存、计算缓冲区,以及驱动程序和显示所占用的空间共同使用;KV 缓存会随着对话中每个 token 的增加而增长,显示占用则出现在显卡也负责驱动屏幕的情况下。Ollama 启动时的上下文窗口为 4,096 个 token,可通过变量 OLLAMA_CONTEXT_LENGTH 修改;窗口扩大一倍,KV 缓存也会扩大一倍。

一个简单的选择规则:如果您想处理长文档(16,000 个 token 及以上),请选择 30 亿至 40 亿参数的模型,或使用带有量化 KV 缓存的 8B 模型。如果只进行短消息对话,Q4 量化的 8B 模型是合适的选择。无论哪种情况,都请使用 ollama ps 检查模型是否 100% 加载在 GPU 上:如果有一部分交由 CPU 处理,就说明已经没有剩余空间。

#在 Pascal 上使用 Flash Attention 是否有效?

有一种误解认为 Flash Attention 仅适用于配备 Tensor Cores 的显卡。llama.cpp 的基准测试否定了这一说法:它对每张显卡分别测试开启和关闭 Flash Attention 的情况,Pascal 架构的 GTX 1080 Ti 也出现在两张表中。开启 Flash Attention 后,它的提示处理速度从 1,084.41 tokens/s 提升至 1,138.14 tokens/s,提升约 5%;生成速度则从 62.49 tokens/s 降至 61.38 tokens/s,下降约 2%。Flash Attention 的主要收益不是速度,而是节省内存:它降低了上下文的内存占用,这对只有 8 GB 显存的显卡很重要。

当推理引擎和显卡支持 Flash Attention 时,Ollama 会自动启用它;环境变量 OLLAMA_FLASH_ATTENTION=1 会强制启用它,值为 0 则将其禁用。KV 缓存量化可进一步减少上下文的内存占用,但要求先启用 Flash Attention。

启动服务器时强制启用 Flash Attention
OLLAMA_FLASH_ATTENTION=1 ollama serve

#配备 8 GB 显存的 Pascal 显卡适合哪些用途?

常见工作负载与适配程度
用途适配建议设置
聊天、改写、翻译良好Granite 4.2 8B,采用 Q4 量化,上下文长度为 4,096 个 token
编辑器代码辅助尚可7-8B模型,中等上下文长度,仅加载一个模型
长文档摘要有限3-4B 模型或量化后的 KV 缓存
检索自己的文档(RAG)尚可使用 3–8B 模型,处理短文本片段,不要使用 12B 模型
支持工具调用链的智能体弱上下文和调用量过大,超出 8 GB 显存的承受范围

#Pascal:软件支持才是真正的限制

主要风险并非来自速度,而是软件。Ollama 需要计算能力为5.0至6.2的显卡安装 NVIDIA 570或更新版本的驱动程序,GTX 1070至1080也包含在内。但CUDA 13的版本说明指出Pascal架构已被移除,维基百科则提到 NVIDIA 已于2025年12月停止对该系列的Game Ready支持,安全更新支持至2028年10月。

Aujourd'hui
Ollama 和 llama.cpp 可在驱动版本为 570 或更高、且使用 CUDA 12 构建版本的条件下运行。
明天
新功能和新引擎将面向 CUDA 13:每次更新都可能移除对 Pascal 架构的支持。
安全
驱动安全补丁更新至2028年10月,但无新的性能优化。
!
不要被2028年的日期所误导
这一日期涉及驱动程序的安全性,而不是 AI 工具的兼容性。推理引擎可能早在这一日期之前就停止支持 Pascal:请提前准备替换显卡。

#选择 1070 Ti 更好,还是选择其他显卡?

在二手预算相同的情况下,需要比较三个指标:显存(至少 8 GB)、架构代际(Turing 或更新架构才能使用 CUDA 13)以及带宽。价格每周都在变化,因此这里不列具体价格,只介绍各选项的定位。

适用于本地大语言模型的入门级配置选项
选项优点缺点
GTX 1070 / 1070 Ti / 1080(已拥有)免费;运行 7–9B 模型较为轻松Pascal 已接近支持周期末期,相同带宽下速度更慢
RTX 2060 Super (8 GB)实测 60.04 tokens/s,Turing 架构,Tensor Cores仍然只有 8 GB
RTX 3050(6或8 GB)Ampere,长期软件支持部分版本的带宽有限
12 GB 显存的显卡(RTX 3060 12 GB)为 12–14B 模型和长上下文留有余量预算更高

#结论:尝试可行,投资不推荐

如果您已经有 GTX 1070、1070 Ti 或 1080,它就是一个很好的入门选择:8 GB 显存足以运行 Q4 量化的 8B 模型,生成速度也足够满足舒适聊天的需求。如果您打算购买显卡,请优先选择采用 Turing 或更新架构的 8 GB 显卡:在显存容量相同的情况下,生成速度明显更快,软件支持周期也更长。

最后一个实用的考量因素是功耗。这些显卡在游戏中的功耗为 150 至 180 W;推理时的发热量低于游戏时,但机箱通风不良可能导致吞吐量下降。在认定显卡速度慢之前,请先检查它在长时间生成过程中的温度。

FAQ
GTX 1070或1080能否运行8B模型?+
可以。采用 Q4 量化的 Granite 4.2 8B 大小约为 4.6 GB,因此在总共 8 GB 的显存中,还能留下超过 3 GB 供上下文和系统使用。llama.cpp 基准测试中,1070 Ti 运行 7B Q4_0 模型的实测速度为 37.82 tokens/s,这一速度足以提供流畅的聊天体验。
本地运行 LLM,选 GTX 1070 还是 GTX 1080?+
1080显卡。其GDDR5X内存带宽为320 GB/s,相比1070的256 GB/s,提升了约25%的生成速度(在相同模型下),因为速度受限于内存带宽。显存容量保持不变,仍为8 GB。请检查二手显卡的使用状态和散热情况。
GTX 1080 每秒能处理多少 token?+
在llama.cpp公共基准测试中,不存在GTX 1080的性能数据。GTX 1070 Ti在256 GB/s带宽下,7B Q4_0模型的吞吐量为37.82 tokens/s。按带宽比例计算,GTX 1080的性能应超过45 tokens/s,该估算需通过llama-bench进行验证。
能否在GTX 1070上运行Qwen3.5 9B?+
是的,但余量很小:Q4 格式的权重占用约 6 GB(共 8 GB),剩下 2 GB 用于 KV 缓存和系统运行。请保持上下文较短,并通过 ollama ps 监控模型是否始终驻留在 GPU 上。
2026 年值得购买二手 GTX 1080 吗?+
只有价格非常低、且只是想试用时才值得购买。Pascal架构已从CUDA 13中移除,Game Ready支持已于2025年12月终止;8 GB显存的RTX 2060 Super在基准测试中达到60.04 tokens/s,而1070 Ti为37.82 tokens/s。预算相近时,Turing架构显卡是更好的购买选择。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。