RTX 3070 / 3070 Ti(8 GB)显卡上适合的LLM ?
RTX 3070 或 3070 Ti 提供 8 GB VRAM:在 Q4 量化下,它能在 VRAM 中保留最多 80 亿至 90 亿参数的模型(Granite 4.2 8B 为 5.3 GB,Qwen 3.5 9B 为 6.6 GB),但无法容纳 120 亿参数及以上的模型。3070 Ti 的带宽为 608 GB/s,高于 448 GB/s,在相同容量下生成速度更快。没有已发布的测量数据:吞吐量均为估算值。
RTX 3070和3070 Ti配备8GB显存,运行80亿参数模型仍算不错,但显存容量是它们的限制。本指南列出了真正能装入显存的模型及其精确文件大小、基于带宽估算的生成速度、上下文长度限制,以及与相近显卡的差距。您还将了解到何时该升级到12GB或16GB显存。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: RTX 5060 Ti 16 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#用 RTX 3070 和 RTX 3070 Ti 运行本地 LLM:8 GB 显存能做什么
对于本地 LLM,RTX 3070 或 3070 Ti 的价值在于其 8 GB 显存,而这一容量决定了一切:最多 80 亿至 90 亿参数的 Q4 量化模型可以放得下,120 亿参数及以上的模型则放不下。根据 Ollama 模型库,Granite 4.2 8B 大小为 5.3 GB,Qwen3 8B 为 5.2 GB,Qwen 3.5 9B 为 6.6 GB;Qwen3 14B(9.3 GB)和 gpt-oss 20B(14 GB)都超出了显卡的显存容量。3070 Ti 的显存带宽为 608 GB/s,而 3070 为 448 GB/s,因此前者生成速度更快,但显存容量相同。
- 内存
- 8 GB 显存,256 位总线:3070 使用 GDDR6,带宽为 448 GB/s;3070 Ti 使用 GDDR6X,带宽为 608 GB/s,数据依据维基百科的表格和 NVIDIA。
- 计算
- 根据维基百科,3070 显卡拥有 5888 个 CUDA 核心,3070 Ti 拥有 6144 个 CUDA 核心。
- 功耗
- 根据 NVIDIA 的规格,3070 的显卡功耗为 220 W,所需电源功率为 650 W;3070 Ti 的显卡功耗为 290 W,所需电源功率为 750 W。所需电源功率高于有时看到的 550 W。
#能装入 8 GB 显存的模型
权重大小取自 Ollama 模型库中的文件,查阅日期为 2026 年 9 月 29 日。余量是指 8 GB 显存中,扣除模型权重后、尚未计入上下文、缓存和引擎缓冲区时剩余的空间;如果这张显卡还负责驱动您的屏幕,余量也必须满足显示所需的显存。
| 模型 | Ollama 文件 | 毛利率 | 结论 |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 4.6 GB | 余量充足,可以使用长上下文 |
| Qwen3 8B | 5.2 GB | 2.8 GB | 舒适 |
| Granite 4.2 8B | 5.3 GB | 2.7 GB | 舒适 |
| Qwen 3.5 9B | 6.6 GB | 1.4 GB | 可运行,需限制上下文 |
| Gemma 4 12B | 7.6 GB | 0.4 GB | 没有剩余空间:无法容纳实用的上下文 |
| Qwen3 14B | 9.3 GB | 缺少 1.3 GB | 无法容纳 |
| gpt-oss 20B | 14 GB | 缺少6 GB | 无法容纳 |
最稳妥的起点是一个 80 亿参数的模型:Granite 4.2 8B 或 Qwen3 8B 可为上下文留出近 3 GB 空间。Qwen 3.5 9B 是实际使用中的上限:1.4 GB 的余量足以支持简短对话,但不足以处理长文档。本地 RAG 会额外引入一个嵌入模型:bge-m3 在 Ollama 中占用 1.2 GB,与 Granite 4.2 8B 合计占用 6.5 GB,剩余 1.5 GB 可供其他部分使用。
#在 RTX 3070 上安装 Ollama
- 01检查驱动程序在终端中运行 nvidia-smi:驱动版本需为 550 或以上(Windows 下为 551.61),且显存总容量应显示为约 8 GB。
- 02安装 Ollama请从官方网站安装 Ollama。本地 API 的监听地址为 http://localhost:11434。
- 03运行模型运行 ollama run granite4.2:8b:下载 5.3 GB 仅需一次。
- 04检查分配情况在第二个终端中执行 ollama ps:Processeur 列应显示 100% GPU。若显示 CPU/GPU 混合分配,则说明模型或上下文超出了显存容量,部分内容被转移到了系统内存中。
- 05调整上下文通过 OLLAMA_CONTEXT_LENGTH 设置上下文长度,然后再次运行 ollama ps。启动服务器时,将 OLLAMA_FLASH_ATTENTION 设置为 1,将 OLLAMA_KV_CACHE_TYPE 设置为 q8_0,以节省显存。
#吞吐速度:根据带宽可以预期怎样的表现
没有任何主流基准测试网站发布 RTX 3070 的测量结果,因此以下数值是估算值,而非实测数据。该方法基于生成速度受带宽限制这一事实:理论上限约等于带宽除以模型权重的大小。对于 Granite 4.2 8B(5.3 GB),448 ÷ 5.3 得出 3070 上约每秒 85 个 token,608 ÷ 5.3 得出 3070 Ti 上约每秒 115 个 token。对于 Qwen 3.5 9B(6.6 GB),理论上限分别为每秒 68 和 92 个 token。
llama.cpp 的社区排行榜可以将这些理论上限换算为大致的性能量级。运行 Llama 2 7B Q4_0 时,RTX 3060 Ti 8 GB 是一款采用 256 位总线、与 3070 接近的显卡,未启用 Flash Attention 时每秒生成 92.23 个 token,启用后为 96.50 个。RTX 3060 12 GB 的带宽为 360 GB/s,两种情况下的生成速度分别为每秒 75.57 和 76.92 个 token:速度比(1.22)与带宽比(448 ÷ 360 = 1.24)接近。因此,3070 的生成速度应该接近 3060 Ti,运行 7B 模型时约为每秒 90 至 95 个 token;3070 Ti 则预计高出约 35%,即每秒 120 至 130 个 token。这些都是估算值。
| 模型 | Ollama 文件 | 3070 的理论上限(448 GB/s) | 3070 Ti 上限(608 GB/s) |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 132 | 179 |
| Granite 4.2 8B | 5.3 GB | 85 | 115 |
| Qwen 3.5 9B | 6.6 GB | 68 | 92 |
| Gemma 4 12B | 7.6 GB | 59 | 80 |
根据其他来源对显卡的测量,实际吞吐量通常约为这些上限的 70% 至 80%:因此,Granite 4.2 8B 在 3070 上预计可达到每秒 55 至 65 个 token。无论确切数值是多少,这些速度都超过了人类阅读速度:3070 的限制在于显存容量,而非速度。
#8 GB显存的限制:上下文、RAG和大型模型
Ollama 根据显存容量设置默认上下文长度:其文档指出,显存低于 24 GiB 时默认使用 4k 个 token,并建议智能体、网页搜索和代码工具至少使用 64000 个 token。在 8 GB 显存上,使用 80 亿参数模型时想达到 64000 个 token 的上下文并不现实:KV 缓存会存储每个 token 的注意力键和值,消耗剩余的内存空间。根据 Ollama 的常见问题解答,对缓存使用 q8_0 量化可将其内存占用降至 f16 的约一半,精度损失非常小:这是应首先启用的设置。
- 12B 至 24B 参数的模型
- Gemma 4 12B(7.6 GB)没有为上下文留下空间;Qwen3 14B(9.3 GB)和gpt-oss 20B(14 GB)则无法装入显存。这些模型会将超出显存的部分卸载到系统内存,速度随之下降。
- 长上下文
- 使用 Qwen 3.5 9B 时,1.4 GB 的剩余容量很快就会耗尽:请将上下文长度保持在几千个 token,并留意 ollama ps 的输出。
- 多阶段RAG
- Granite 4.2 8B 和 bge-m3 占用 6.5 GB:添加重排序模型或第二个模型将超出容量。
- Fine-tuning
- 据Unsloth介绍,使用4位QLoRA时,30亿参数模型的绝对最低内存需求为3.5GB,80亿参数模型为6GB:8B模型也只能勉强装下,批大小需设为1,且上下文要短。
要将显存占用控制在 8 GB 以下,一个简单方法只需三项设置。首先,选择模型文件大小能留出至少 2 GB 余量的模型:Granite 4.2 8B 或 Qwen3 8B。其次,启用 q8_0 量化缓存和 Flash Attention;Flash Attention 官方仓库注明它兼容 3070 等 Ampere 架构 GPU。最后,分阶段增加上下文长度,从 4 000 到 8 000,再到 16 000 个 token,每一步都重新运行 ollama ps:一旦显示有部分计算由 CPU 承担,就退回上一个阶段。这样逐步增加,可以避免在对话进行到一半时才发现已经达到限制。
#3070 与其他 8 至 16 GB 显存显卡的对比
| 显卡 | 内存 | 带宽 | 它所实现的改变 |
|---|---|---|---|
| RTX 3070 | 8 GB GDDR6 | 448 GB/s | 80至90亿参数的模型 |
| RTX 3070 Ti | 8 GB GDDR6X | 608 GB/s | 相同显存,更快生成 |
| RTX 3060 12 GB | 12 GB GDDR6 | 360 GB/s | 还能运行120至140亿参数的模型 |
| RTX 4060 Ti 16 GB | 16 GB | 288 GB/s | 还能运行 gpt-oss 20B,但速度更慢 |
该表格凸显了权衡关系。3060 12GB 的带宽比 3070 低 20%,但显存多出 4GB:它能够支持 Qwen3 14B(9.3GB),而 3070 无法支持。4060 Ti 16GB 增加了对 200 亿参数模型的支持,其带宽为 288 GB/s,这使其在处理小模型时速度较慢。对于 LLM 来说,一旦目标模型超过 7.5GB,容量的重要性就超过速度。
#结论:保留、替换或不购买
| 情况 | 决策 | 数字依据 |
|---|---|---|
| 您已拥有 3070 显卡,希望运行 8B 模型 | 保留它 | Granite 4.2 8B:5.3 GB,估算速度约60 token/s |
| 您想要一个 12B 到 14B 的模型 | 升级至 12 或 16 GB | Qwen3 14B占用9.3GB,3070显卡有8GB显存 |
| 您需要 20B 模型或较长的上下文 | 显存为 16 GB 或以上的显卡 | gpt-oss 20B 体积为 14 GB |
| 你正在犹豫选择3070还是3070 Ti | 选择最便宜的选项 | 相同显存容量,608 对 448 GB/s |
| 您正在寻找用于入门的显卡 | 与3060 12GB进行对比 | 带宽相近,内存容量更大 |
3070 对于 80 亿参数模型来说是一张还算可以的显卡,仅此而已。它仍可作为入门显卡使用:Ollama 支持该显卡,且 80 亿参数模型在该显卡上的回复速度比人的阅读速度更快。如果您计划使用编程智能体或处理长文档,则它不适用,因为这些任务所需的上下文超出了 8 GB 显存所能容纳的范围。如果您已经拥有该显卡,它足以用于探索本地 LLM。如果您仅为这一用途选择显卡,请优先考虑容量:能装下的更大模型,比速度更快的小模型更有价值。关于当日价格,请参阅我们的价格追踪页面,该页面每周两次记录每张显卡的最低价格。
- 来源:NVIDIA,RTX 3070和3070 Ti规格
- 来源:llama.cpp 在 CUDA 平台上的社区排名
- 来源:Ollama文档,上下文长度
- 来源:Ollama FAQ,Flash Attention及KV缓存
- 来源:Unsloth,微调所需的显存
#常见问题
在 RTX 3070 上运行哪个 LLM?+
RTX 3070 能运行 140 亿或 240 亿参数的模型吗?+
运行 LLM,该选 RTX 3070 还是 RTX 3060 12 GB?+
3070 和 3070 Ti 在运行 LLM 时有何区别?+
RTX 3070 Ti需要什么电源?+
在 RTX 3070 上能否对模型进行微调?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。