GTX 1070 / 1080(8 GB)能运行哪些 LLM ?
可以:配备8GB显存的GTX 1070、1070 Ti或1080,在上下文长度合理的情况下,能轻松运行70亿至90亿参数的Q4量化模型。llama.cpp公开基准测试测得,GTX 1070 Ti运行7B Q4_0模型时的速度为37.82 tokens/s;1080配备更快的显存,表现应该更好,但尚无直接测量数据。参数量超过90亿后,8GB显存就会成为限制,而Pascal架构在软件层面已无发展前景。
GTX 1070(2016 年 6 月)、1070 Ti(2017 年 11 月)和 1080(2016 年 5 月)使用相同的 GP104 芯片,均配备 8 GB 显存。它们已成为希望不花钱尝试本地 LLM 的人最心动的二手显卡选择。本指南用数字说明这些显卡的显存能支持什么、公开测量结果如何反映它们的速度,以及为什么 Pascal 停止支持的日期比价格更重要。
您正在挑选电脑吗? 按预算推荐 →
本地 AI 的高性价比之选: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
#GTX 1070、1070 Ti、1080:运行大语言模型时有何区别
对于 LLM 而言,这三款显卡的显存容量相同,均为 8 GB,区别在于决定生成速度的显存带宽。1070 和 1070 Ti 使用 256 位总线的 GDDR5,带宽为 256 GB/s;1080 使用 GDDR5X,带宽达到 320 GB/s。由于 LLM 每生成一个 token 都会重新读取全部权重,这 25% 的带宽差异几乎会直接转化为生成速度差异,其影响远大于 1080 的 2,560 个核心与 1070 的 1,920 个核心之间的数量差异。三款显卡都没有 Tensor Cores:Pascal 仍使用传统的 CUDA 计算。
| 显卡 | CUDA 核心 | 内存 | 带宽 | 实测吞吐量(7B Q4_0) |
|---|---|---|---|---|
| GTX 1070 | 1 920 | 8 GB GDDR5 | 256 GB/s | 未在基准测试中测量 |
| GTX 1070 Ti | 2 432 | 8 GB GDDR5 | 256 GB/s | 37.82 tokens/s |
| GTX 1080 | 2 560 | 8 GB GDDR5X | 320 GB/s | 未在基准测试中测量 |
一块 GTX 1080 Ti,配备 11 GB 显存和 484 GB/s 带宽,属于另一类:它有自己的独立页面。如果你的显卡是 1080 Ti,请参考为其专门准备的指南。
#8 GB 实际能做什么
关键在于模型权重大小与可用内存容量之间的关系,因为 KV 缓存还会占用额外内存。本站给出的参考值是:7–8B 模型经 Q4 量化后,权重大小约为 5 GB;在 8 GB 内存中,还剩约 3 GB 可用于上下文和系统,确实有一定余量。9B 模型经 Q4 量化后,权重大小为 6 GB,还剩 2 GB:上下文较短时可以运行。参数达到 120 亿时,权重大小达到 7 GB:几乎没有余量。
| 模型 (Q4) | 模型大小 | 8 GB 容量下的剩余空间 | 带宽为 256 GB/s 时的理论速度上限 | 在 320 GB/s 带宽下的理论上限 |
|---|---|---|---|---|
| Granite 4.1 3B | 2 GB | 6 GB | 128 tokens/秒 | 160 tokens/s |
| Granite 4.2 8B | 4.6 GB | 3.4 GB | 55 tokens/s | 每秒 70 个 token |
| Qwen3.5 9B | 6 GB | 2 GB | 43 tokens/s | 53 tokens/s |
| Gemma 4 12B | 7 GB | 1 GB | 不推荐 | 不推荐 |
| Phi-4 14B | 9 GB | 负向 | 超出 GPU 显存容量 | 超出 GPU 显存容量 |
理论上限永远不会被达到。在公共测试平台上,GTX 1070 Ti 在 3.56 GiB 模型上达到 37.82 tokens/s,约为其 256 GB/s 理论上限的 56%。将这一效率应用于上述模型,一个 Granite 4.2 8B 在 1070 Ti 上的运行速度大约为 30 tokens/s:这是一种比例外推,而非实际测量。
#公开基准测试结果
QuelLLM 未测试这些显卡。相关数据来自 llama.cpp 仓库中的讨论“Performance of llama.cpp on Nvidia CUDA”,其中每位贡献者都在 Q4_0 量化的 Llama 2 7B 上运行 llama-bench,所有层均在 GPU 上运行。GTX 1070 Ti 在该讨论中的提示词处理速度为 714.44 tokens/s,生成速度为 37.82 tokens/s。
对同一页面中有实测数据的显卡进行比较很有参考价值:RTX 2060 Super是一款采用Turing架构、配备8 GB显存和256位显存总线的显卡,在同一测试中生成速度为60.04 tokens/s,而1070 Ti为37.82 tokens/s。在显存带宽相近的情况下,速度提升了59%。因此,比起核心或价格,这项基准测试更能解释性能差距:Turing能更高效地利用显存。
| 显卡 | 内存 | 提示词 (pp512) | 生成(tg128) |
|---|---|---|---|
| GTX 1070 Ti | 8 GB GDDR5,256 位 | 714.44 tokens/s | 37.82 tokens/s |
| RTX 2060 Super | 8 GB GDDR6,256 位 | 1,420.24 tokens/s | 60.04 tokens/s |
| GTX 1080 Ti | 11 GB GDDR5X,352 位 | 1,084.41 tokens/s | 62.49 tokens/s |
解读这些数字时,需要注意三点。基准测试中的每一行数据都是一份个人贡献:不同贡献者使用的驱动程序、系统、散热方案和显卡厂商各不相同,这解释了为何同一芯片的成绩会相差几个点。测试模型 Llama 2 7B 比当前的模型更旧、规模更小:它只是共同的衡量基准,不能用于预测某个具体模型的表现。最后,生成主要依赖内存,而提示词处理则依赖计算能力:这两列反映的是不同的情况。
#没有实测数据时如何估算 GTX 1080 的性能:方法与局限
1080 未纳入这次基准测试。要大致估计其性能,可以按带宽比计算:320 ÷ 256 = 1.25。如果效率与 1070 Ti 相同,则约为 47 tokens/s(37.82 × 1.25)。这是一个合理的假设,而不是测试结果:驱动程序、llama.cpp 版本、温度或显卡散热都会显著影响吞吐量。
如果您为此用途购买二手显卡,请向卖家索要实际测试的截图,或在收到显卡后立即自行运行 llama-bench,测试时使用基准测试中的同一模型:结果可以直接与公开表格对比。
#上下文:预留的 3 GB 显存用在哪里
在 8 GB 显存上,Q4 量化的 Granite 4.2 8B 会留下约 3.4 GB 的余量。这部分空间由 KV 缓存、计算缓冲区,以及驱动程序和显示所占用的空间共同使用;KV 缓存会随着对话中每个 token 的增加而增长,显示占用则出现在显卡也负责驱动屏幕的情况下。Ollama 启动时的上下文窗口为 4,096 个 token,可通过变量 OLLAMA_CONTEXT_LENGTH 修改;窗口扩大一倍,KV 缓存也会扩大一倍。
一个简单的选择规则:如果您想处理长文档(16,000 个 token 及以上),请选择 30 亿至 40 亿参数的模型,或使用带有量化 KV 缓存的 8B 模型。如果只进行短消息对话,Q4 量化的 8B 模型是合适的选择。无论哪种情况,都请使用 ollama ps 检查模型是否 100% 加载在 GPU 上:如果有一部分交由 CPU 处理,就说明已经没有剩余空间。
#在 Pascal 上使用 Flash Attention 是否有效?
有一种误解认为 Flash Attention 仅适用于配备 Tensor Cores 的显卡。llama.cpp 的基准测试否定了这一说法:它对每张显卡分别测试开启和关闭 Flash Attention 的情况,Pascal 架构的 GTX 1080 Ti 也出现在两张表中。开启 Flash Attention 后,它的提示处理速度从 1,084.41 tokens/s 提升至 1,138.14 tokens/s,提升约 5%;生成速度则从 62.49 tokens/s 降至 61.38 tokens/s,下降约 2%。Flash Attention 的主要收益不是速度,而是节省内存:它降低了上下文的内存占用,这对只有 8 GB 显存的显卡很重要。
当推理引擎和显卡支持 Flash Attention 时,Ollama 会自动启用它;环境变量 OLLAMA_FLASH_ATTENTION=1 会强制启用它,值为 0 则将其禁用。KV 缓存量化可进一步减少上下文的内存占用,但要求先启用 Flash Attention。
#配备 8 GB 显存的 Pascal 显卡适合哪些用途?
| 用途 | 适配 | 建议设置 |
|---|---|---|
| 聊天、改写、翻译 | 良好 | Granite 4.2 8B,采用 Q4 量化,上下文长度为 4,096 个 token |
| 编辑器代码辅助 | 尚可 | 7-8B模型,中等上下文长度,仅加载一个模型 |
| 长文档摘要 | 有限 | 3-4B 模型或量化后的 KV 缓存 |
| 检索自己的文档(RAG) | 尚可 | 使用 3–8B 模型,处理短文本片段,不要使用 12B 模型 |
| 支持工具调用链的智能体 | 弱 | 上下文和调用量过大,超出 8 GB 显存的承受范围 |
#Pascal:软件支持才是真正的限制
主要风险并非来自速度,而是软件。Ollama 需要计算能力为5.0至6.2的显卡安装 NVIDIA 570或更新版本的驱动程序,GTX 1070至1080也包含在内。但CUDA 13的版本说明指出Pascal架构已被移除,维基百科则提到 NVIDIA 已于2025年12月停止对该系列的Game Ready支持,安全更新支持至2028年10月。
- Aujourd'hui
- Ollama 和 llama.cpp 可在驱动版本为 570 或更高、且使用 CUDA 12 构建版本的条件下运行。
- 明天
- 新功能和新引擎将面向 CUDA 13:每次更新都可能移除对 Pascal 架构的支持。
- 安全
- 驱动安全补丁更新至2028年10月,但无新的性能优化。
#选择 1070 Ti 更好,还是选择其他显卡?
在二手预算相同的情况下,需要比较三个指标:显存(至少 8 GB)、架构代际(Turing 或更新架构才能使用 CUDA 13)以及带宽。价格每周都在变化,因此这里不列具体价格,只介绍各选项的定位。
| 选项 | 优点 | 缺点 |
|---|---|---|
| GTX 1070 / 1070 Ti / 1080(已拥有) | 免费;运行 7–9B 模型较为轻松 | Pascal 已接近支持周期末期,相同带宽下速度更慢 |
| RTX 2060 Super (8 GB) | 实测 60.04 tokens/s,Turing 架构,Tensor Cores | 仍然只有 8 GB |
| RTX 3050(6或8 GB) | Ampere,长期软件支持 | 部分版本的带宽有限 |
| 12 GB 显存的显卡(RTX 3060 12 GB) | 为 12–14B 模型和长上下文留有余量 | 预算更高 |
#结论:尝试可行,投资不推荐
如果您已经有 GTX 1070、1070 Ti 或 1080,它就是一个很好的入门选择:8 GB 显存足以运行 Q4 量化的 8B 模型,生成速度也足够满足舒适聊天的需求。如果您打算购买显卡,请优先选择采用 Turing 或更新架构的 8 GB 显卡:在显存容量相同的情况下,生成速度明显更快,软件支持周期也更长。
最后一个实用的考量因素是功耗。这些显卡在游戏中的功耗为 150 至 180 W;推理时的发热量低于游戏时,但机箱通风不良可能导致吞吐量下降。在认定显卡速度慢之前,请先检查它在长时间生成过程中的温度。
GTX 1070或1080能否运行8B模型?+
本地运行 LLM,选 GTX 1070 还是 GTX 1080?+
GTX 1080 每秒能处理多少 token?+
能否在GTX 1070上运行Qwen3.5 9B?+
2026 年值得购买二手 GTX 1080 吗?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。