进阶 11 分钟RTX 40

在RTX 4070 Ti Super(16 GB)上使用哪个LLM? ?

直接回答

RTX 4070 Ti Super 配备 16 GB GDDR6X 显存,带宽为 672 GB/s:它能将 Gemma 4 12B(7.7 至 8 GB)、gpt-oss 20B、Mistral Small 24B(后两者各占 14 GB),以及大小不超过约 14 GB 的任何模型加载到 VRAM 中。它是 4070 系列中唯一一款显存超过 12 GB 的显卡,带宽也是 RTX 4060 Ti 16 GB 的两倍以上。运行大小为 5.3 GB 的模型时,其理论生成速度上限约为 127 tokens/s。

寻找适合在 RTX 4070 上本地运行的 LLM 时,您会遇到四款相似的显卡:4070、4070 Super、4070 Ti 和 4070 Ti Super。其中只有一款提供 16 GB 显存。本指南说明这一容量和 256 位总线能支持什么、哪些仍超出其能力范围,以及这款显卡与 RTX 4080 Super 或 RTX 5070 Ti 相比处于什么位置。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5070 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#用 RTX 4070 Ti Super 运行本地 LLM:16 GB 显存能实现什么?

RTX 4070 Ti Super 可以轻松运行 Q4 量化下的 4B 至 24B 模型。根据 NVIDIA 的资料,它配备 16 GB GDDR6X 显存、256 位总线,带宽为 672 GB/s,并拥有 8 448 个 CUDA 核心。这一组合使其表现优于所有 8 GB 和 12 GB 显存的显卡:Gemma 4 12B 可以装入显存,并为上下文留出充足空间;gpt-oss 20B 和 Mistral Small 24B 各占 14 GB,可以装入显存并留有约 2 GB 余量;而大小为 5 至 8 GB 的模型运行时可以接近其内存带宽所能提供的性能上限。无法装入的是下一个级别:Qwen 3.5 27B 大小为 17 GB,超过了该显卡的显存容量。因此,4070 Ti Super 并不适合 30B 模型,但对于低于这一规模的模型,它是最均衡的选择之一。

架构
Ada Lovelace 架构,采用与 RTX 4080 相同的 AD103 芯片,但启用的单元更少。
内存
16 GB GDDR6X,256位总线,根据维基百科,带宽为672 GB/s。
计算
据NVIDIA产品页面,配备8,448个CUDA核心及第四代Tensor Cores。
功耗
总图形功耗285瓦;NVIDIA 表示整台电脑的最低电源需求为700瓦。

#4070、4070 Super、4070 Ti、4070 Ti Super:哪一款适合运行 LLM?

这四款显卡属于同一系列,但运行 LLM 的能力并不相同。其中三款的显存仅有 12 GB;只有 Ti Super 提升到 16 GB,并采用 256 位总线。对于本地 AI,这些差异比原始算力更重要:它们决定了显卡能容纳哪些模型。

RTX 4070 系列:对 LLM 来说关键的参数(来源 NVIDIA)
显卡内存总线CUDA 核心功耗
RTX 4070 Ti Super16 GB GDDR6X256位8 448285 W
RTX 4070 Ti12 GB GDDR6X192位7 680285 W
RTX 4070 Super12 GB GDDR6X192位7 168220 W
RTX 407012 GB GDDR6 或 GDDR6X192位5 888200 W

根据维基百科,RTX 4070 Ti 的带宽为 504 GB/s,而 Ti Super 为 672 GB/s。如果您搜索的是标准版 RTX 4070,专门介绍它的页面涵盖的是 12 GB 版本。所有型号的共同点是:12B 模型能够装入显存,而占用 14 GB 及以上的模型则需要 16 GB 显存。

#16 GB 能容纳哪些模型

RTX 4070 Ti Super 上的模型(Ollama 文件大小,仅计权重)
模型大小16 GB 容量下的余量结论
Granite 4.2 8B5.3 GB10.7 GB余量非常充足:可使用长上下文
Gemma 4 12B7.7 至 8.0 GB8 GB舒适
gpt-oss 20B14 GB2 GB能装入显存,但需留意上下文长度
Mistral Small 24B14 GB2 GB能装入显存,但需留意上下文长度
Devstral Small 2 24B15 GB1 GB勉强装得下,上下文窗口非常短
Qwen 3.5 27B17 GB负向无法容纳

14GB和15GB的模型在上下文缓存方面空间有限:Ollama 默认使用4096个token,虽可勉强满足,但16000个token则需要对K/V缓存进行量化。Devstral Small 2作为代码模型,处于临界状态:在15GB规模下,上下文缓存几乎被耗尽。对于代码任务,16GB环境下推荐使用Mistral Small 24B,或选择更小规模但上下文更长的模型。

#16 GB显存仍无法胜任的任务

有三类模型超出显存限制。27B至35B参数的Q4版本:Qwen 3.5 27B 重量为17 GB,Qwen 3.5 35B版本为24 GB(根据Ollama、Gemma),4 26B版本尺寸在16至19 GB之间。70B参数模型,仅模型权重就约达40 GB(依据网站参考数据)。以及长上下文模型被推至最大值:一款宣称支持256,000个token上下文的8 GB模型,若启用完整缓存将无法运行。此类情况需升级至24 GB显存,或使用统一内存的Mac设备,或采用专用机器:相关硬件页面对这些选项进行了对比。

#安装并检查模型在显存中的加载情况

  1. 01
    驱动程序
    对于较新的 GeForce 显卡,Ollama 要求使用 NVIDIA 550 或更新版本的驱动程序。请使用 nvidia-smi 检查您的驱动版本。
  2. 02
    安装
    安装适用于您所用系统的 Ollama,无需单独安装 CUDA。
  3. 03
    首次测试
    运行 ollama run mistral-small,先启动一个能利用这 16 GB 显存的模型,再运行 ollama ps。
  4. 04
    控制
    PROCESSOR列应显示100% GPU;否则请减少上下文长度。
在 16 GB 显存上使用长上下文(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

q8_0格式的K/V缓存大约使用f16默认值一半的显存,需启用Flash Attention。正是这一设置使得14GB模型能够在16GB显存下支持16000个token的上下文。

#可预期的速率:性能上限与第三方测试结果

此处没有将任何生成速率称为本站实测值。生成速率上限为带宽除以模型权重大小。第三方公开测试(LLaMA 3 8B在Q4_K_M下使用llama.cpp,2024年5月)显示,在RTX 4080(716.8 GB/s带宽)上达到106 tokens/s,约为生成速率理论上限的68%,在RTX 4070 Ti上约为75%。RTX 4070 Ti Super的带宽接近RTX 4080,因此其数量级也相近。表格中采用70%作为上限比例。

RTX 4070 Ti Super(672 GB/s)的理论上限
模型模型大小上限估算为 70 %
Granite 4.2 8B5.3 GB127 tokens/s约 89 tokens/s
Qwen 3.5 9B6.6 GB102 tokens/s约71 tokens/s
Gemma 4 12B7.7 GB87 tokens/s约61 tokens/s
Mistral Small 24B14 GB48 tokens/s约 34 tokens/s

gpt-oss 20B 是混合专家模型:每生成一个 token,它只读取部分权重,因此吞吐量高于一个大小为 14 GB 的稠密模型。这里没有引用任何有来源支持的数值。主要记住:这张显卡运行 8B 模型时速度很快,运行 24B 模型时速度尚可。

#4070 Ti Super 对比 4080 Super 和 5070 Ti

16GB显卡对比
显卡VRAM带宽备注
RTX 4070 Ti Super16 GB GDDR6X672 GB/s与 4080 相同的 AD103 芯片
RTX 4080 Super16 GB GDDR6X736 GB/s额外约 10% 的带宽
RTX 5070 Ti16 GB GDDR7896 GB/s带宽提升 33 %

三张显卡均配备 16 GB 显存:容量相同,因此可运行的模型列表也相同。只有生成速度不同,其变化与带宽成正比。4080 Super 的速度提升约 10%;5070 Ti 则提升约三分之一。在二手市场,价格差异比这些吞吐量差异更重要:请查看价格追踪进行比较。一张价格合适的二手 4070 Ti Super 仍是极佳选择;全新 5070 Ti 的保修和速度优势则能成为购买它的理由。

#受益于16GB显存的使用场景

16 GB 显存主要改变的是可以同时运行哪些模型。本地 RAG 系统结合了生成模型、嵌入模型,以及足够长、能够容纳检索所得片段的上下文:使用 Gemma 4 12B(7.7 至 8 GB)和一个小型嵌入模型时,整套系统可以装入显存,并留下数 GB 的余量。代码助手只需一个 8B 至 12B 模型和 16,000 个 token 的上下文,就能运行,不受任何限制。像 Mistral Small 24B 这样大小为 14 GB 的模型几乎占满整张显卡的显存:选择它就意味着由它独占显卡,而不是让它成为同时运行的多个模型之一。

16 GB 显存下的三种典型配置
用途配置剩余显存余量
个人 RAGGemma 4 12B 和轻量级嵌入模型约 7 GB 用于上下文
代码助手8B模型,16000个token上下文,q8_0量化缓存约 9 GB
最高质量的聊天仅 Mistral Small 24B约 2 GB,短上下文

共享使用中的一个陷阱:在Ollama中,同一模型上并行的多个请求会相应增加上下文占用空间。因此,当使用14 GB模型同时为三位同事服务时,可能导致显存溢出,而单用户使用则毫无问题。在16 GB显存下,建议限制并行请求数量或选择更轻量的模型以支持多用户使用。

#购买二手 4070 Ti Super:需检查的要点

该显卡于 2024 年 1 月发布:大多数二手显卡的卡龄不到三年,但无法保证它们过去的使用情况。价格每周都会变动:请查看价格追踪信息,而不要依赖本指南中的固定数字。购买前,请确认 nvidia-smi 显示的显存容量确实为 16 GB,运行一个占用 14 GB 的模型,在长时间生成过程中监测温度,并听听风扇的声音。请索取发票,并询问厂商保修还剩多久:发票和剩余保修通常可以随显卡一同转交。

#2026 结论

在以下情况下继续保留
您的模型能装进16GB显存。在您需要24GB显存之前,没有理由更换这块显卡。
在以下情况下购买二手款
价格明显低于全新 5070 Ti。请检查剩余保修期、温度以及风扇噪音。
若目标为24 GB,则
您想运行 Qwen 3.5 27B 或更大的模型:无论怎么调整,都无法在 16 GB 显存中装下 17 GB 的模型并容纳上下文;选择 24 GB 显存的显卡可以避免再次购买显卡。

#常见问题

FAQ
RTX 4070 Ti Super 能否运行 Mistral Small 24B?+
是的:根据 Ollama,模型大小为 14 GB,显卡有 16 GB 显存,因此还剩约 2 GB 可供上下文和系统使用。默认的 4096 token 上下文可以容纳;若要使用 16000 token 的上下文,请启用 Flash Attention 和 q8_0 格式的 K/V 缓存,将缓存所需内存减少约一半。
RTX 4070 Ti 与 4070 Ti Super 在 LLM 应用中有什么区别?+
Ti Super 拥有 16 GB 显存,采用 256 位总线,而 Ti 只有 12 GB 显存,采用 192 位总线。根据维基百科,带宽从 504 GB/s 提升至 672 GB/s。对于 LLM,显存容量最重要:Ti Super 能加载 14 GB 的模型,而 Ti 容纳不下。
RTX 4070 Ti Super 还是 RTX 5070 Ti?+
两者均配备 16 GB 内存,因此支持的模型相同。5070 Ti 的内存读取速度为 896 GB/s,而 4070 Ti Super 为 672 GB/s,快约三分之一。5070 Ti 速度更快,而且是带保修的全新产品;如果 4070 Ti Super 的二手价格明显更低,则它更具性价比。
运行 LLM,该选 RTX 4070 Ti Super 还是 RTX 4080?+
两者均配备 16 GB VRAM。4080 Super 的带宽为 736 GB/s,而另一款为 672 GB/s,高出约 10%;标准版 4080 的带宽则为 716.8 GB/s。对于 LLM 来说,性能差距不大:应根据二手价差做决定,而不是只看规格表。
RTX 4070 Ti Super 需要多大的电源?+
NVIDIA 标明,显卡总功耗为 285 W,整台 PC 至少需要 700 W 的电源。优质的 750 W 电源能留出充足余量。还请检查接头:这张显卡需要两根 8 针 PCIe 电源线,或一根额定功率至少为 300 W 的 PCIe Gen 5 电源线。
Qwen 3.5 27B 能在 RTX 4070 Ti Super 上运行吗?+
无法完全放入显存:根据 Ollama,模型大小为 17 GB,而显卡的显存为 16 GB。一部分将需要从系统内存读取,这会明显拖慢生成速度。对于这个模型,建议选择 24 GB 显存;如果只有 16 GB 显存,请选择大小不超过 14 GB 的模型。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。