RTX 4070 / 4070 Super / 4070 Ti(12 GB)适合运行哪些 LLM ?
一张 RTX 4070、4070 Super 或 4070 Ti 提供 12 GB 显存和 504 GB/s 带宽:足以以 Q4 量化运行参数规模达 14B 的模型(Qwen 3.5 9B、Gemma 4 12B、Qwen3 14B),但无法运行 24B 至 27B 的模型。这三张显卡的生成速度几乎相同,因为它们的内存规格一致;唯一区别在于长提示词的读取速度。
RTX 4070 系列的三款显卡配备相同的显存,但计算能力不同,而这种差异对大语言模型(LLM)的影响比人们想象的要小。本指南列出了真正能装入 12 GB 显存的模型及其准确的文件大小、需要预留的上下文空间、第三方实测吞吐量,以及模型过大时的处理步骤。您还将了解购买二手显卡时应选择哪个版本,以及何时该升级到 16 GB 显存。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: RTX 5070 Ti 16 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RTX 4070 和本地 LLM:12 GB 能实现什么
对于本地 LLM,RTX 4070 的价值首先在于其 12 GB 显存和 504 GB/s 带宽:这两个数值决定了能容纳哪些模型,以及运行速度。70 亿至 140 亿参数的 Q4 模型可以完全放入显存:根据 Ollama 模型库,Qwen 3.5 9B 大小为 6.6 GB,Gemma 4 12B 为 7.6 GB,Qwen3 14B 为 9.3 GB。Hardware Corner 在 RTX 4070 上使用 4000 token 的上下文测得,Qwen3 8B 每秒生成 71 个 token,Qwen3 14B 每秒生成 42 个 token。240 亿至 270 亿参数的模型,例如 Mistral Small 24B(14 GB)或 Qwen 3.8 27B(18 GB),无法完全放入显存:超出显存容量的部分会转移到系统内存中,速度随之下降。Super 和 Ti 版本并未增加带宽。
- 发布日期
- 据维基百科,4070 Ti 于 2023 年 1 月 5 日发布,4070 于 2023 年 4 月 13 日发布,4070 Super 于 2024 年 1 月 17 日发布。
- 内存
- 12 GB GDDR6X,192 位总线,速率为 21 Gbit/s:192 × 21 ÷ 8 = 504 GB/s,这是 Puget Systems 为这三款显卡记录的数值。
- CUDA 核心
- 据 NVIDIA,4070 为 5 888,Super 为 7 168,Ti 为 7 680。
- 功耗
- 据 NVIDIA,显卡功耗分别为 200、220 和 285 W;所需电源功率分别为 650、650 和 700 W。
#4070、Super 或 Ti:显存容量相同,算力不同
| 显卡 | CUDA 核心 | 带宽 | FP16 (TFLOPS) | 图形性能 | 所需电源 |
|---|---|---|---|---|---|
| RTX 4070 | 5 888 | 504 GB/s | 29,15 | 200 W | 650 W |
| RTX 4070 Super | 7 168 | 504 GB/s | 35,48 | 220 W | 650 W |
| RTX 4070 Ti | 7 680 | 504 GB/s | 40,09 | 285 W | 700 W |
生成一个 token 时,GPU 会重新读取模型的所有活跃权重:生成速度受限于内存带宽,而非核心数量。而这三款显卡的内存带宽相同,均为 504.2 GB/s。Puget 使用 llama.cpp 测试了 GGUF 4 位量化的 Phi-3-mini:4070 与 4070 Ti 在提示词读取阶段有 25% 的性能差距,但在生成阶段,两者的成绩几乎相同。Hardware Corner 使用其他模型测试时,测得 Super 的性能为 4070 的 114%,Ti 则为 116%。因此,实际性能差距从几乎为零到约 15% 不等,而 CUDA 核心数量的增幅为 22% 至 30%。
计算用于提示词的解析阶段,即生成第一个词之前的阶段。在FP16精度下,根据Puget的数据,Super显卡相比4070性能提升22%,相比Ti提升38%。这对于RAG、长文档或发送大提示词的代码代理而言尤为显著:响应延迟明显降低。但对于短对话场景,这种优势并不明显。
#能装入 12 GB 显存的模型
这里列出的大小来自 2026 年 9 月 29 日查阅的 Ollama 模型库文件。余量是指在 12 GB 显存中扣除模型文件占用后、尚未计入上下文、缓存和引擎缓冲区时剩余的空间。
| 模型 | Ollama 文件 | 毛利率 | 用于何种场景 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 6.7 GB | RAG 和工具调用,128K 上下文,Apache 2.0 |
| Qwen 3.5 9B (Q4_K_M) | 6.6 GB | 5.4 GB | 多功能,支持文本和图像,Apache 2.0 |
| Gemma 4 12B (Q4_K_M) | 7.6 GB | 4.4 GB | 文本、图像、音频;7.2 GB 的 QAT 版本 |
| Qwen3 14B | 9.3 GB | 2.7 GB | 能够轻松运行的最大稠密模型 |
| Qwen 3.5 9B (Q8_0) | 11 GB | 1 GB | 应避免:留给上下文和缓冲区的显存余量太小 |
Qwen 3.5 9B 是最安全的起点。Gemma 4 12B 根据 Google 的数据拥有 119.5 亿参数,如果您还需要音频和图像功能,它将成为接替者。Granite 4.2 8B 适用于文档检索,IBM 在此场景中强调 RAG 和工具调用。Qwen3 14B 是上限:2.7 GB 的余量足以支持数千个 token 的上下文。Qwen 3.5 9B 的 Q8_0 仅留出一 GB:上下文、缓冲区以及 Windows 占用的内存可能导致其溢出。
本地RAG会增加一个嵌入模型:bge-m3在Ollama中占用1.2 GB,与Granite 4.2 8B组合后总大小为6.5 GB,与Gemma 4 12B组合后为8.8 GB。
#上下文:模型占用内存之后剩余的内存
Ollama 根据显存容量设置上下文长度:其文档指出,显存低于 24 GiB 时,默认上下文长度为 4k tokens,并建议为智能体、代码工具和网页搜索使用至少 64,000 tokens。RTX 4070 属于默认 4k 的档位:使用默认设置启动的智能体,会在显存用满之前很早就丢失历史记录。增加上下文长度会消耗显存,具体体现为 KV 缓存;该缓存存储每个已读取 token 的注意力键和值。
其大小可按以下公式计算:2(键和值)× 完全注意力层数 × KV 头数 × 单个头的维度 × 每个值的字节数 × token 数。根据 Qwen 3.5 9B 在 Hugging Face 上的模型介绍页,它的 32 层中只有 8 层采用完全注意力,并有 4 个维度为 256 的 KV 头。Gemma 4 12B 结合了采用 1,024 个 token 滑动窗口的层,以及键和值统一的全局注意力层。这两个模型的缓存占用都远小于传统 Transformer。
| 模型 | 8000个标记 | 32 000个token | 128 000 个 token |
|---|---|---|---|
| Qwen 3.5 9B | 0,25 | 1,0 | 4,0 |
| Gemma 4 12B | 0,4 | 0,6 à 0,8 | 1,3 à 2,3 |
| 经典 Transformer(示例:32 层,8 个 KV 头,每个头的维度为 128) | 1,0 | 4,0 | 16,0 |
这些是理论估算,并非实测结果:它们未计入计算缓冲区、DeltaNet 层的状态和图像编码器;Gemma 的估算区间则源于键和值共享方式的不确定性。Qwen 3.5 9B(6.6 GB)在上下文为 32,000 个 token 时,还剩约 4.4 GB;在 128,000 个 token 时,仅缓存就达到 4 GiB,总占用接近 12 GB。请使用 ollama ps 检查实际结果。
下一个优化手段是缓存量化:根据 Ollama 的 FAQ,q8_0 相比 f16 约节省一半内存,精度损失极小,且依赖 Flash Attention,而 Ollama 在显卡和模型支持时会自动启用该功能。长上下文也会降低生成速度:Hardware Corner 在 Qwen3 8B 模型中,从 4k、16k 到 32k 上下文,每秒生成的 token 数分别从 71 降至 52,再降至 38。
#安装 Ollama 并检查显存是否容得下模型
在Windows上,Ollama 需要驱动程序 NVIDIA 551.61 或更高版本(具体以文档为准),且4070系列显卡属于支持的显卡范围。安装流程会部署模型并验证其在显卡上运行至100%。
- 01检查驱动程序打开NVIDIA应用程序或在终端中运行nvidia-smi:驱动版本必须为551.61或更高版本。
- 02安装 Ollama从 Ollama 官网下载适用于 Windows 的程序。随后,本地 API 会在 http://localhost:11434 上监听。
- 03运行模型打开终端并执行 ollama run qwen3.5:9b。6.6 GB 的下载仅需进行一次。
- 04检查内存分配在第二个终端中执行 ollama ps。处理器列应显示 100% GPU。若出现类似 48% / 52% 的 CPU/GPU 分配,则说明模型有一部分已从显存转移到系统内存中。
- 05设置上下文和缓存在 Ollama 应用设置中,或通过 OLLAMA_CONTEXT_LENGTH 增大上下文长度,然后再次运行 ollama ps。如果剩余显存空间不足,请在启动服务器时将 OLLAMA_FLASH_ATTENTION 设为 1,并将 OLLAMA_KV_CACHE_TYPE 设为 q8_0。
#第三方测得的处理速度与理论上限
QuelLLM 未在此处提供自测数据:所有吞吐量均来自第三方来源,包含其具体模型和上下文环境。Hardware Corner 在2026年3月测得RTX 4070的性能;XDA 在2026年6月发布了一项关于RTX 4070 Ti的测试报告。
| 来源 | 显卡 | 模型 | 上下文 | 生成 | 读取提示词 |
|---|---|---|---|---|---|
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 4k | 71,2 | 3 564 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 16k | 52,1 | 2 064 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 32k | 38,1 | 1 117 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 4k | 42,5 | 2 100 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 16k | 32,7 | 1 356 |
| XDA | RTX 4070 Ti | Qwen 3.5 9B (Ollama) | 未明确说明 | 65 à 67 | 未明确说明 |
理论上限有助于评估这些数值:生成速度不能超过带宽除以模型权重大小所得的值。对于 Qwen3 8B(在 Ollama 中大小为 5.2 GB),504 ÷ 5.2 约为每秒 97 个 token;在 4k 上下文下测得的 71.2 达到了该上限的 73%。Qwen3 14B(9.3 GB)的上限为 54,实测为 42.5,即上限的 78%。XDA 在 Qwen 3.5 9B 上测得 65 至 67(上限为 76),即上限的 85% 至 88%。对于 Gemma 4 12B(7.6 GB,上限为 66),按上述 73% 至 88% 的范围估算,速度为每秒 48 至 58 个 token:这是估算,并非实测。
| 显卡 | 带宽 | 生成速度(token/秒) |
|---|---|---|
| RTX 4060 Ti 8 GB | 288 GB/s | 64,03 |
| RTX 5070 12 GB | 672 GB/s | 128,21 |
| RTX 4070 Ti Super 16 GB | 672 GB/s | 132,85 |
| RTX 3080 10 GB | 760 GB/s | 139,95 |
这些数据来自 llama.cpp 的社区排行榜,其中没有 RTX 4070。生成速度随带宽变化:两块带宽均为 672 GB/s 的显卡,一块有 12 GB 显存,另一块有 16 GB,生成速度大致相同;带宽为 288 GB/s 的 4060 Ti 则只有它们一半的速度。按比例推算,带宽为 504 GB/s 的 4070 在这个 3.56 GiB 的模型上预计能达到约每秒 99 个 token:这是估算,并非实测。
#超过 12 GB:Qwen 3.8,Mistral Small,gpt-oss
Ollama 库中的 Qwen 3.8 只有 270 亿参数版本,采用 Q4_K_M 量化时占用 18 GB:比 RTX 4070 的显存容量多出 6 GB,因此需要将模型分配到显存和系统内存中。由于它是稠密模型,每生成一个 token 都要重新读取全部权重。若显存中存放 11 GB 权重,带宽为 504 GB/s,系统内存中存放 7 GB 权重,带宽为 60 GB/s(假设使用双通道 DDR5),则每个 token 在 GPU 端需要 22 ms,在系统内存端需要 117 ms:速度上限降至约每秒 7 个 token,而 Qwen 3.5 9B 为每秒 76 个 token。
| 模型 | Ollama 文件 | 超额 | 性质 | 可行路径 |
|---|---|---|---|---|
| Mistral Small 24B | 14 GB | 2 GB | Dense | 不推荐:稠密模型 |
| gpt-oss 20B | 14 GB | 2 GB | MoE,36亿激活参数 | 专家模块卸载(llama.cpp) |
| Gemma 4 26B | 19 GB | 7 GB | MoE (A4B) | 相同,需自行测量 |
| Qwen 3.8 27B | 18 GB | 6 GB | Dense | 否:太慢 |
专家模型更适合将显存放不下的部分卸载到系统内存。根据模型说明,gpt-oss 20B 有 210 亿参数,其中每个 token 激活 36 亿参数。llama.cpp 的 --n-cpu-moe 选项将前 N 层的专家保留在系统内存中,而注意力层和缓存仍留在显卡上。llama.cpp 的 gpt-oss 官方指南给出了一个使用 8 GB RTX 2060 的示例:将 16 层的专家放在 CPU 上运行,上下文长度为 32,000 个 token。如果有 12 GB 显存,逐档降低 N,直到出现内存不足错误,再调高一档。
我们没有找到这种方法在 RTX 4070 上有明确来源的测量数据:吞吐量取决于您的系统内存和 N,需要您自行测量。2025 年 8 月,一名用户报告称,在 RTX 4070 上通过 Ollama 运行 gpt-oss 20B 时,速度约为每秒 10 个 token,自动分配比例为 CPU 47%、GPU 53%;此后版本和设置可能已经发生变化。
#结论:选择哪款4070,以及何时升级到16GB显存
| 情况 | 决策 | 数字依据 |
|---|---|---|
| 你已经有一块 4070,Super 或 Ti | 保留它,用于运行70至140亿参数的模型 | 带宽相同,生成性能差距为 0–16% |
| 聊天、助手、简单编程 | 标准版 4070 就够用 | 生成速度与带宽有关 |
| RAG、大文档、智能体 | 选择 Super,没有的话就选 Ti | FP16 算力(TFLOPS)提高 22% 和 38% |
| 您希望将一个 24B 模型完全放入显存(14 GB) | 升级至16 GB(4070 Ti Super) | 16 GB 和 672 GB/s |
| 您希望在 12 GB 显存下获得更快的运行速度 | 一张 RTX 5070 | 672 GB/s 对比 504,提升33% |
RTX 5070 改善的是速度,而非容量:NVIDIA 为其配备了 12 GB GDDR7 显存和 192 位总线,在 28 Gbit/s 的数据速率下带宽达到 672 GB/s,而 4070 为 504 GB/s。要容纳更大的模型,关键在于 16 GB 显存。本站的 5070 和 4070 Ti Super 指南详细说明了各种情况。
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
- 来源:NVIDIA,RTX 4070系列规格
- 来源:Puget Systems,消费级GPU的LLM性能数据
- 来源:Ollama文档,上下文长度
- 来源:Ollama FAQ,Flash Attention及KV缓存
- 来源:llama.cpp 的 gpt-oss 运行指南
#常见问题
在 RTX 4070 上应安装哪个模型?+
Qwen 3.8 是否能在 RTX 4070 上运行?+
RTX 4070、4070 Super 或 4070 Ti:哪种适合本地运行 LLM?+
12 GB 显存对于 2026 年的 LLM 仍足够吗?+
RTX 4070 Super需要多大电源?+
运行 LLM,选 RTX 4070 还是 RTX 3080 10 GB?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。