进阶 14 分钟RTX 40

RTX 4070 / 4070 Super / 4070 Ti(12 GB)适合运行哪些 LLM ?

直接回答

一张 RTX 4070、4070 Super 或 4070 Ti 提供 12 GB 显存和 504 GB/s 带宽:足以以 Q4 量化运行参数规模达 14B 的模型(Qwen 3.5 9B、Gemma 4 12B、Qwen3 14B),但无法运行 24B 至 27B 的模型。这三张显卡的生成速度几乎相同,因为它们的内存规格一致;唯一区别在于长提示词的读取速度。

RTX 4070 系列的三款显卡配备相同的显存,但计算能力不同,而这种差异对大语言模型(LLM)的影响比人们想象的要小。本指南列出了真正能装入 12 GB 显存的模型及其准确的文件大小、需要预留的上下文空间、第三方实测吞吐量,以及模型过大时的处理步骤。您还将了解购买二手显卡时应选择哪个版本,以及何时该升级到 16 GB 显存。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5070 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RTX 4070 和本地 LLM:12 GB 能实现什么

对于本地 LLM,RTX 4070 的价值首先在于其 12 GB 显存和 504 GB/s 带宽:这两个数值决定了能容纳哪些模型,以及运行速度。70 亿至 140 亿参数的 Q4 模型可以完全放入显存:根据 Ollama 模型库,Qwen 3.5 9B 大小为 6.6 GB,Gemma 4 12B 为 7.6 GB,Qwen3 14B 为 9.3 GB。Hardware Corner 在 RTX 4070 上使用 4000 token 的上下文测得,Qwen3 8B 每秒生成 71 个 token,Qwen3 14B 每秒生成 42 个 token。240 亿至 270 亿参数的模型,例如 Mistral Small 24B(14 GB)或 Qwen 3.8 27B(18 GB),无法完全放入显存:超出显存容量的部分会转移到系统内存中,速度随之下降。Super 和 Ti 版本并未增加带宽。

发布日期
据维基百科,4070 Ti 于 2023 年 1 月 5 日发布,4070 于 2023 年 4 月 13 日发布,4070 Super 于 2024 年 1 月 17 日发布。
内存
12 GB GDDR6X,192 位总线,速率为 21 Gbit/s:192 × 21 ÷ 8 = 504 GB/s,这是 Puget Systems 为这三款显卡记录的数值。
CUDA 核心
据 NVIDIA,4070 为 5 888,Super 为 7 168,Ti 为 7 680。
功耗
据 NVIDIA,显卡功耗分别为 200、220 和 285 W;所需电源功率分别为 650、650 和 700 W。
!
核查二手 4070 的显存型号
据 Wikipedia 介绍,自 2024 年 8 月起,RTX 4070 也有采用 20 Gbit/s GDDR6 显存而非 GDDR6X 的版本。在相同的 192 位总线下,这意味着带宽为 480 GB/s,而不是 504 GB/s,低了 5%。请询问确切型号。

#4070、Super 或 Ti:显存容量相同,算力不同

三款 12 GB RTX 4070 显卡并列对比(NVIDIA、Puget Systems)
显卡CUDA 核心带宽FP16 (TFLOPS)图形性能所需电源
RTX 40705 888504 GB/s29,15200 W650 W
RTX 4070 Super7 168504 GB/s35,48220 W650 W
RTX 4070 Ti7 680504 GB/s40,09285 W700 W

生成一个 token 时,GPU 会重新读取模型的所有活跃权重:生成速度受限于内存带宽,而非核心数量。而这三款显卡的内存带宽相同,均为 504.2 GB/s。Puget 使用 llama.cpp 测试了 GGUF 4 位量化的 Phi-3-mini:4070 与 4070 Ti 在提示词读取阶段有 25% 的性能差距,但在生成阶段,两者的成绩几乎相同。Hardware Corner 使用其他模型测试时,测得 Super 的性能为 4070 的 114%,Ti 则为 116%。因此,实际性能差距从几乎为零到约 15% 不等,而 CUDA 核心数量的增幅为 22% 至 30%。

计算用于提示词的解析阶段,即生成第一个词之前的阶段。在FP16精度下,根据Puget的数据,Super显卡相比4070性能提升22%,相比Ti提升38%。这对于RAG、长文档或发送大提示词的代码代理而言尤为显著:响应延迟明显降低。但对于短对话场景,这种优势并不明显。

→
选择 Ti 版很少值得
它的功耗为 285 W,而 Super 为 220 W,高出 30%;据 Hardware Corner 的数据,生成性能却只高出 2 个点,而且它是三者中最旧的型号。价格相近时,Super 是该系列中最值得购买的型号。

#能装入 12 GB 显存的模型

这里列出的大小来自 2026 年 9 月 29 日查阅的 Ollama 模型库文件。余量是指在 12 GB 显存中扣除模型文件占用后、尚未计入上下文、缓存和引擎缓冲区时剩余的空间。

可在 RTX 4070、Super 或 Ti 上测试的模型(Ollama 文件)
模型Ollama 文件毛利率用于何种场景
Granite 4.2 8B5.3 GB6.7 GBRAG 和工具调用,128K 上下文,Apache 2.0
Qwen 3.5 9B (Q4_K_M)6.6 GB5.4 GB多功能,支持文本和图像,Apache 2.0
Gemma 4 12B (Q4_K_M)7.6 GB4.4 GB文本、图像、音频;7.2 GB 的 QAT 版本
Qwen3 14B9.3 GB2.7 GB能够轻松运行的最大稠密模型
Qwen 3.5 9B (Q8_0)11 GB1 GB应避免:留给上下文和缓冲区的显存余量太小

Qwen 3.5 9B 是最安全的起点。Gemma 4 12B 根据 Google 的数据拥有 119.5 亿参数,如果您还需要音频和图像功能,它将成为接替者。Granite 4.2 8B 适用于文档检索,IBM 在此场景中强调 RAG 和工具调用。Qwen3 14B 是上限:2.7 GB 的余量足以支持数千个 token 的上下文。Qwen 3.5 9B 的 Q8_0 仅留出一 GB:上下文、缓冲区以及 Windows 占用的内存可能导致其溢出。

本地RAG会增加一个嵌入模型:bge-m3在Ollama中占用1.2 GB,与Granite 4.2 8B组合后总大小为6.5 GB,与Gemma 4 12B组合后为8.8 GB。

#上下文:模型占用内存之后剩余的内存

Ollama 根据显存容量设置上下文长度:其文档指出,显存低于 24 GiB 时,默认上下文长度为 4k tokens,并建议为智能体、代码工具和网页搜索使用至少 64,000 tokens。RTX 4070 属于默认 4k 的档位:使用默认设置启动的智能体,会在显存用满之前很早就丢失历史记录。增加上下文长度会消耗显存,具体体现为 KV 缓存;该缓存存储每个已读取 token 的注意力键和值。

其大小可按以下公式计算:2(键和值)× 完全注意力层数 × KV 头数 × 单个头的维度 × 每个值的字节数 × token 数。根据 Qwen 3.5 9B 在 Hugging Face 上的模型介绍页,它的 32 层中只有 8 层采用完全注意力,并有 4 个维度为 256 的 KV 头。Gemma 4 12B 结合了采用 1,024 个 token 滑动窗口的层,以及键和值统一的全局注意力层。这两个模型的缓存占用都远小于传统 Transformer。

根据已公布的配置估算的f16 KV缓存大小(GiB)
模型8000个标记32 000个token128 000 个 token
Qwen 3.5 9B0,251,04,0
Gemma 4 12B0,40,6 à 0,81,3 à 2,3
经典 Transformer(示例:32 层,8 个 KV 头,每个头的维度为 128)1,04,016,0

这些是理论估算,并非实测结果:它们未计入计算缓冲区、DeltaNet 层的状态和图像编码器;Gemma 的估算区间则源于键和值共享方式的不确定性。Qwen 3.5 9B(6.6 GB)在上下文为 32,000 个 token 时,还剩约 4.4 GB;在 128,000 个 token 时,仅缓存就达到 4 GiB,总占用接近 12 GB。请使用 ollama ps 检查实际结果。

下一个优化手段是缓存量化:根据 Ollama 的 FAQ,q8_0 相比 f16 约节省一半内存,精度损失极小,且依赖 Flash Attention,而 Ollama 在显卡和模型支持时会自动启用该功能。长上下文也会降低生成速度:Hardware Corner 在 Qwen3 8B 模型中,从 4k、16k 到 32k 上下文,每秒生成的 token 数分别从 71 降至 52,再降至 38。

#安装 Ollama 并检查显存是否容得下模型

在Windows上,Ollama 需要驱动程序 NVIDIA 551.61 或更高版本(具体以文档为准),且4070系列显卡属于支持的显卡范围。安装流程会部署模型并验证其在显卡上运行至100%。

  1. 01
    检查驱动程序
    打开NVIDIA应用程序或在终端中运行nvidia-smi:驱动版本必须为551.61或更高版本。
  2. 02
    安装 Ollama
    从 Ollama 官网下载适用于 Windows 的程序。随后,本地 API 会在 http://localhost:11434 上监听。
  3. 03
    运行模型
    打开终端并执行 ollama run qwen3.5:9b。6.6 GB 的下载仅需进行一次。
  4. 04
    检查内存分配
    在第二个终端中执行 ollama ps。处理器列应显示 100% GPU。若出现类似 48% / 52% 的 CPU/GPU 分配,则说明模型有一部分已从显存转移到系统内存中。
  5. 05
    设置上下文和缓存
    在 Ollama 应用设置中,或通过 OLLAMA_CONTEXT_LENGTH 增大上下文长度,然后再次运行 ollama ps。如果剩余显存空间不足,请在启动服务器时将 OLLAMA_FLASH_ATTENTION 设为 1,并将 OLLAMA_KV_CACHE_TYPE 设为 q8_0。
基本命令
ollama run qwen3.5:9b
ollama run gemma4:12b
ollama ps

# Exemple de la documentation Ollama pour fixer le contexte à 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#第三方测得的处理速度与理论上限

QuelLLM 未在此处提供自测数据:所有吞吐量均来自第三方来源,包含其具体模型和上下文环境。Hardware Corner 在2026年3月测得RTX 4070的性能;XDA 在2026年6月发布了一项关于RTX 4070 Ti的测试报告。

已公布的 RTX 4070 和 4070 Ti 吞吐量(每秒 token 数)
来源显卡模型上下文生成读取提示词
Hardware CornerRTX 4070Qwen3 8B Q4_K4k71,23 564
Hardware CornerRTX 4070Qwen3 8B Q4_K16k52,12 064
Hardware CornerRTX 4070Qwen3 8B Q4_K32k38,11 117
Hardware CornerRTX 4070Qwen3 14B Q4_K4k42,52 100
Hardware CornerRTX 4070Qwen3 14B Q4_K16k32,71 356
XDARTX 4070 TiQwen 3.5 9B (Ollama)未明确说明65 à 67未明确说明

理论上限有助于评估这些数值:生成速度不能超过带宽除以模型权重大小所得的值。对于 Qwen3 8B(在 Ollama 中大小为 5.2 GB),504 ÷ 5.2 约为每秒 97 个 token;在 4k 上下文下测得的 71.2 达到了该上限的 73%。Qwen3 14B(9.3 GB)的上限为 54,实测为 42.5,即上限的 78%。XDA 在 Qwen 3.5 9B 上测得 65 至 67(上限为 76),即上限的 85% 至 88%。对于 Gemma 4 12B(7.6 GB,上限为 66),按上述 73% 至 88% 的范围估算,速度为每秒 48 至 58 个 token:这是估算,并非实测。

不同带宽下的 llama.cpp 生成速度(Llama 2 7B Q4_0,tg128 测试,已启用 Flash Attention)
显卡带宽生成速度(token/秒)
RTX 4060 Ti 8 GB288 GB/s64,03
RTX 5070 12 GB672 GB/s128,21
RTX 4070 Ti Super 16 GB672 GB/s132,85
RTX 3080 10 GB760 GB/s139,95

这些数据来自 llama.cpp 的社区排行榜,其中没有 RTX 4070。生成速度随带宽变化:两块带宽均为 672 GB/s 的显卡,一块有 12 GB 显存,另一块有 16 GB,生成速度大致相同;带宽为 288 GB/s 的 4060 Ti 则只有它们一半的速度。按比例推算,带宽为 504 GB/s 的 4070 在这个 3.56 GiB 的模型上预计能达到约每秒 99 个 token:这是估算,并非实测。

#超过 12 GB:Qwen 3.8,Mistral Small,gpt-oss

Ollama 库中的 Qwen 3.8 只有 270 亿参数版本,采用 Q4_K_M 量化时占用 18 GB:比 RTX 4070 的显存容量多出 6 GB,因此需要将模型分配到显存和系统内存中。由于它是稠密模型,每生成一个 token 都要重新读取全部权重。若显存中存放 11 GB 权重,带宽为 504 GB/s,系统内存中存放 7 GB 权重,带宽为 60 GB/s(假设使用双通道 DDR5),则每个 token 在 GPU 端需要 22 ms,在系统内存端需要 117 ms:速度上限降至约每秒 7 个 token,而 Qwen 3.5 9B 为每秒 76 个 token。

超过 12 GB 的模型(Ollama 文件)
模型Ollama 文件超额性质可行路径
Mistral Small 24B14 GB2 GBDense不推荐:稠密模型
gpt-oss 20B14 GB2 GBMoE,36亿激活参数专家模块卸载(llama.cpp)
Gemma 4 26B19 GB7 GBMoE (A4B)相同,需自行测量
Qwen 3.8 27B18 GB6 GBDense否:太慢

专家模型更适合将显存放不下的部分卸载到系统内存。根据模型说明,gpt-oss 20B 有 210 亿参数,其中每个 token 激活 36 亿参数。llama.cpp 的 --n-cpu-moe 选项将前 N 层的专家保留在系统内存中,而注意力层和缓存仍留在显卡上。llama.cpp 的 gpt-oss 官方指南给出了一个使用 8 GB RTX 2060 的示例:将 16 层的专家放在 CPU 上运行,上下文长度为 32,000 个 token。如果有 12 GB 显存,逐档降低 N,直到出现内存不足错误,再调高一档。

llama.cpp使用指南示例(8GB显存):调整--n-cpu-moe
llama-server -hf ggml-org/gpt-oss-20b-GGUF --ctx-size 32768 --jinja -ub 2048 -b 2048 --n-cpu-moe 16

我们没有找到这种方法在 RTX 4070 上有明确来源的测量数据:吞吐量取决于您的系统内存和 N,需要您自行测量。2025 年 8 月,一名用户报告称,在 RTX 4070 上通过 Ollama 运行 gpt-oss 20B 时,速度约为每秒 10 个 token,自动分配比例为 CPU 47%、GPU 53%;此后版本和设置可能已经发生变化。

i
12 GB 显存可容纳 QLoRA 微调
根据 Unsloth,采用 4 位 QLoRA 时,80 亿参数模型的绝对最低显存需求为 6 GB,140 亿参数模型为 8.5 GB:在批大小为 1、上下文较短的条件下,仍可考虑在 4070 显卡上使用 14B 模型。

#结论:选择哪款4070,以及何时升级到16GB显存

如何根据你的情况做决定
情况决策数字依据
你已经有一块 4070,Super 或 Ti保留它,用于运行70至140亿参数的模型带宽相同,生成性能差距为 0–16%
聊天、助手、简单编程标准版 4070 就够用生成速度与带宽有关
RAG、大文档、智能体选择 Super,没有的话就选 TiFP16 算力(TFLOPS)提高 22% 和 38%
您希望将一个 24B 模型完全放入显存(14 GB)升级至16 GB(4070 Ti Super)16 GB 和 672 GB/s
您希望在 12 GB 显存下获得更快的运行速度一张 RTX 5070672 GB/s 对比 504,提升33%

RTX 5070 改善的是速度,而非容量:NVIDIA 为其配备了 12 GB GDDR7 显存和 192 位总线,在 28 Gbit/s 的数据速率下带宽达到 672 GB/s,而 4070 为 504 GB/s。要容纳更大的模型,关键在于 16 GB 显存。本站的 5070 和 4070 Ti Super 指南详细说明了各种情况。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

#常见问题

在 RTX 4070 上应安装哪个模型?+
从 Qwen 3.5 9B 开始:其 6.6 GB 的 Ollama 文件为上下文留下了超过 5 GB 的余量,并且支持文本和图像。Gemma 4 12B 为 7.6 GB,增加了音频支持。Qwen3 14B 为 9.3 GB,是仍能较轻松运行的最大模型。在 Q4 量化下,超过 140 亿参数的模型会有一部分因显存不足而转移到系统内存中。
Qwen 3.8 是否能在 RTX 4070 上运行?+
运行起来不够流畅。Qwen 3.8 只有 270 亿参数的版本,在 Ollama 中以 Q4_K_M 格式占用 18 GB,比这张显卡的显存容量多出 6 GB。将模型分配到显存和系统内存中运行时,理论上最高约为每秒 7 个 token。使用 12 GB 显存时,建议优先选择 Qwen 3.5 9B 或 Gemma 4 12B。
RTX 4070、4070 Super 或 4070 Ti:哪种适合本地运行 LLM?+
在文本生成方面,这些显卡几乎相当:显存均为 12 GB,带宽均为 504 GB/s,根据所引用的测量结果,性能差异为 0% 至 16%。如果您输入较长的提示词,Super 型号就值得多花这笔钱,因为它处理提示词更快。Ti 型号的功耗为 285 W,但性能提升很小。
12 GB 显存对于 2026 年的 LLM 仍足够吗?+
对于70亿至140亿参数的模型,够用,这些模型可满足聊天、轻量编程和RAG需求。对于Q4量化的240亿至270亿参数模型,则不够,它们占用14至18 GB:一个完全放入显存的24B模型需要16 GB显存。采用专家卸载的模型仍是一种选择。
RTX 4070 Super需要多大电源?+
NVIDIA 标明,4070 和 4070 Super 所需的电源功率为 650 W,4070 Ti 为 700 W,其中 Super 的图形功耗为 220 W。这些是厂商针对整机给出的数值:550 W 的电源不符合这一建议,不过在功耗较低的 PC 上仍可能够用。
运行 LLM,选 RTX 4070 还是 RTX 3080 10 GB?+
3080 10 GB 拥有 320 位总线宽度和 760 GB/s 的带宽,而 4070 为 504 GB/s:只要模型能装入其 10 GB 显存,前者的生成速度更快。4070 多出 2 GB 显存,这对 Gemma 4 12B 或 Qwen3 14B 很重要。具体取决于目标模型的规模。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。