进阶 11 分钟RTX 40

在RTX 4080 / 4080 Super(16 GB)上运行哪个LLM? ?

直接回答

RTX 4080 和 RTX 4080 Super 均配备 16 GB GDDR6X 显存(716.8 和 736 GB/s):它们可将所有模型加载至显存,最大支持约 14 GB 的模型,包括 Gemma 4 12B、gpt-oss 20B 和 Mistral Small 24B。第三方公开测试显示,在 RTX 4080 上运行 8B 模型(Q4 量化)时,吞吐量可达 106 tokens/s。两种型号之间的性能差异约为 3% 的带宽差距,这一差距不足以证明较大溢价合理。

RTX 4080 和 RTX 4080 Super 是 Ada 一代中配备 16 GB 显存的高端显卡。对于本地大语言模型而言,两者之间的差异小于它们与相同显存容量的竞争产品之间的差异:RTX 4070 Ti Super、RTX 5070 Ti、RTX 5080。本指南用数字说明两种型号之间的实际差距、16 GB 显存能容纳哪些模型,以及这款显卡现有的唯一一项公开吞吐量测量结果。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5080 16GB (GIGABYTE Gaming OC).

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。

#RTX 4080用于本地LLM:16 GB显存和716 GB/s带宽能带来什么?

RTX 4080 或 RTX 4080 Super 可在 VRAM 中加载 4B 至 24B 模型(Q4 量化):Gemma 4 12B(7.7 至 8 GB)、gpt-oss 20B(14 GB)以及 Mistral Small 24B(14 GB)均可运行,后者在上下文方面约有 2 GB 的余量。下方引用的第三方测试数据显示,RTX 4080 在 Q4 8B 模型生成时的吞吐量为 106 tokens/s,表明该显卡在交互式使用中属于高速级别。但容量是限制因素:Qwen 3.5 27B 根据 Ollama 的数据,体积高达 17 GB,无法容纳。对于此类大模型,需要 24 GB 的 VRAM。因此,RTX 4080 仅适用于中等规模模型的性能需求,而非容量需求。

架构
Ada Lovelace 架构,AD103 芯片。
内存
16 GB GDDR6X 显存,256 位总线:根据维基百科,4080 显卡为 716.8 GB/s,4080 Super 显卡为 736 GB/s。
CUDA 核心
根据 NVIDIA 的数据,4080 为 9 728,4080 Super 为 10 240。
功耗
两款型号的显卡总功耗均为 320 W;NVIDIA 标明,电脑电源功率至少应为 750 W。
首发价格
2022年11月4080显卡售价1199美元,2024年1月4080 Super显卡售价999美元。

#4080或4080 Super:LLM的实际性能差距

Super 版本的 CUDA 核心数增加了 5%(10 240 对比 9 728),带宽增加了 2.7%(736 对比 716.8 GB/s)。在文本生成中,真正重要的只有带宽:因此理论提升低于 3%,实际使用时察觉不到。两款显卡的显存容量同为 16 GB,功耗同为 320 W,因此能加载的模型也相同。只有当 4080 Super 售价相同或几乎相同时,才值得为它多花钱。二手价格每周都在变化:请查看价格跟踪信息,而不要依赖一个固定数值。

RTX 4080 和 RTX 4080 Super:两份技术说明
标准RTX 4080RTX 4080 Super
CUDA 核心9 72810 240
内存16 GB GDDR6X,256 位16 GB GDDR6X,256 位
带宽716.8 GB/s736 GB/s
图形性能320 W320 W
最低电源需求750 W750 W
带宽差异参考约多出2.7%

#16 GB 能容纳哪些模型

RTX 4080 上的模型(Ollama 中的大小,仅计模型权重)
模型大小16 GB 容量下的余量结论
Granite 4.2 8B5.3 GB10.7 GB支持超长上下文
Gemma 4 12B7.7 至 8.0 GB8 GB舒适
gpt-oss 20B14 GB2 GB能装入显存,上下文长度需适中
Mistral Small 24B14 GB2 GB能装入显存,上下文长度需适中
Qwen 3.5 27B17 GB负向无法装入显存

Ollama 默认使用 4,096 个 token 的上下文。若有 2 GB 的剩余空间,一个占用 14 GB 的模型可以支持更长的上下文,前提是对 K/V 缓存进行量化:Ollama 提供 q8_0 格式,配合 Flash Attention 使用时,内存占用约为 f16 的一半。这两项设置是让 gpt-oss 20B 或 Mistral Small 24B 使用 16,000 个 token 上下文的关键。

Ollama 服务器设置(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

#唯一公开的性能数据:关于4080的说明

一个公开的GitHub仓库对比了使用llama.cpp在LLaMA 3上的不同GPU表现(2024年5月快照,Ubuntu系统,RunPod环境)。对于RTX 4080 16GB显卡,使用8B模型Q4_K_M在1024 tokens生成时达到106.22 tokens/s,而使用相同模型但F16精度时为40.29 tokens/s,显存占用高达14.96 GB,几乎耗尽整张显卡。这些数据来自第三方测试,基于比本网站更早的模型版本以及llama.cpp的旧版:仅作大致参考,不构成承诺。

RTX 4080 16 GB:第三方测试数据(LLaMA 3 8B,Q4_K_M,llama.cpp)
步骤512 tokens1024个token8 192 tokens
生成速度(tokens/s)108,15106,2293,71
提示词读取速度(tokens/s)5 389,745 064,992 882,03

可以得出两点结论。首先,上下文越长,生成速度越慢:在这次测量中,将上下文从 512 个 token 增加到 8 192 个 token,会使生成速度下降约 13%,因为生成每个 token 时,除了读取权重,还需要读取 K/V 缓存。其次,可以计算实测速度与理论上限的比值:用 716.8 GB/s 除以 Q4 格式下 8B 模型的 4.58 GB,可得理论上限为 156 tokens/s,实测速度达到这一上限的 68%。在 F16 格式下,理论上限为 48 tokens/s,实测速度达到其 84%。因此,根据格式的不同,这一比值介于 68% 和 84% 之间。

RTX 4080(716.8 GB/s)的理论上限与估算值
模型 (Q4)模型大小上限估算为 70 %
Granite 4.2 8B5.3 GB135 tokens/s约 95 tokens/s
Gemma 4 12B7.7 GB93 tokens/s约65个标记/秒
Mistral Small 24B14 GB51 tokens/s约36 tokens/s

这些估算适用于短上下文。gpt-oss 20B 模型在生成每个 token 时只读取其活跃专家:它的表现超过一个大小为 14 GB 的稠密模型,但此处未引用可靠的实测数值。

#读取提示词比生成内容快得多

同一组测量还记录了提示处理速度,也就是在给出首个回答之前读取您的问题和文档的速度:提示长度为 1 024 个 token 时,速度为 5 065 tokens/s;长度为 8 192 个 token 时,速度为 2 882 tokens/s。因此,一份约 8 000 个 token、十五页左右的文档,大约三秒就能读取完毕,随后才开始生成。这一阶段受限于计算能力,而非带宽;与 4060 Ti 这类带宽为 288 GB/s 的显卡相比,4080 更多的核心在这一阶段体现出优势。

#适合使用4080的场景:智能体、RAG、代码

这种速度的显卡适合需要连续进行大量生成的用途:智能体、代码纠错循环和文档批处理。运行 8B 模型时,生成速度为 100 token/s,每步生成 500 个 token 的智能体只需几秒就能响应。不过,16 GB 显存会限制上下文长度和同时加载的模型数量:只保留一个占用 14 GB 的 12B 模型,再搭配一个小型嵌入模型用于 RAG。像 gpt-oss 20B 这样的推理模型会在回答前生成很长的思考内容,这会占用上下文。

RTX 4080 上的三种典型配置
用途配置注意事项
代码助手8B至12B模型,16000个token的上下文,q8_0格式缓存15 GB 及以上代码模型:上下文几乎为零
基于文档的检索增强生成(RAG)Gemma 4 12B 与轻量级嵌入模型只加载一个生成模型
高质量聊天仅 Mistral Small 24B适中的上下文长度,2 GB 余量

#模型运行变慢:检查显存是否足以容纳模型

在 16 GB 显存下,14 GB 的模型留出的余量很小,随着上下文增长,对话过程中可能会超出显存容量。症状是生成速度突然变慢:模型的一部分已转移到系统内存。这项检查只需一分钟,可避免误以为显卡速度慢,而实际原因是上下文设置。

  1. 01
    查看模型在 CPU/GPU 上的分配情况
    在第二个终端中运行 ollama ps:PROCESSOR 列应显示 100 % GPU。若显示 CPU/GPU 混合运行,则说明模型有一部分已转移到系统内存。
  2. 02
    减少上下文
    将 OLLAMA_CONTEXT_LENGTH 降至 8192,或降至其默认值 4096,然后重启服务器。
  3. 03
    量化缓存
    启用 Flash Attention,并设置 OLLAMA_KV_CACHE_TYPE=q8_0:K/V 缓存的内存占用约为使用 f16 时的一半。
  4. 04
    释放VRAM
    关闭占用显卡的应用程序,例如游戏和启用硬件加速的浏览器,并使用 nvidia-smi 检查。
  5. 05
    切换模型
    如果现有方案均无效,可尝试更轻量的模型,例如使用 Gemma 4 12B 代替 Mistral Small 24B。

#4080对比4070 Ti Super、5070 Ti和5080

16GB显卡:相同的容量,不同的带宽
显卡VRAM带宽与 4080 的差距
RTX 4070 Ti Super16 GB GDDR6X672 GB/s约少6%
RTX 408016 GB GDDR6X716.8 GB/s参考
RTX 4080 Super16 GB GDDR6X736 GB/s约多出3%
RTX 5070 Ti16 GB GDDR7896 GB/s约多出 25 %
RTX 508016 GB GDDR7960 GB/s约多出34%

所有这些显卡加载相同的模型,因为容量相同。只有吞吐量会变化,与带宽成正比。4080 与 4070 Ti Super 仅相差 6%:如果价差较大,Ti Super 是更好的选择。与 50 系列显卡相比,4080 慢 20% 至 25%,但如果二手价格较低,它仍无竞争对手。这一权衡基于价格,而非规格表。

#2026 年结论:保留、购买还是放弃

在以下情况下保留您的 4080 显卡
您的模型能装进 16 GB 显存。它仍然很快,在您需要 24 GB 显存之前,没有理由更换这张显卡。
在以下情况下购买二手款
价格明显低于全新 5070 Ti,后者带宽高出约 25%。
若目标为24 GB,则
如果您想使用参数量为 270 亿或更多的模型:还要容纳上下文时,无论怎样调整设置,都无法将占用 17 GB 的模型装进 16 GB 显存。

2022 或 2023 年的显卡可能曾用于挖矿或高强度游戏:如果有原始发票,请向卖家索取,并优先选择接受退货的卖家。购买二手卡前,请通过 nvidia-smi 确认显卡显示为 16 GB,运行一个 14 GB 的模型,并在长时间生成过程中监控温度。该显卡功耗最高可达 320 W:请检查电源,NVIDIA 建议至少使用 750 W 电源。

#常见问题

FAQ
RTX 4080 与 4080 Super 在 LLM 场景下的区别是什么?+
几乎无差异。Super版多出5%的CUDA核心和2.7%的带宽(736对比716.8 GB/s),显存均为16GB,功耗均为320W。加载的模型相同,速度差距低于3%,实际使用中难以察觉。
在 RTX 4080 上的生成速度是多少?+
2024年5月,第三方公开测试显示,LLaMA 3 8B在Q4_K_M量化下通过llama.cpp运行时达到106.22 tokens/s。此数据非本项目实测,且该模型版本早于本网站所列模型。5.3GB模型的理论上限约为135 tokens/s。
RTX 4080 能运行 Qwen 3.5 27B 吗?+
无法完全放入显存:根据 Ollama 的信息,模型大小为 17 GB,而显卡只有 16 GB 显存。部分权重会留在系统内存中,显著降低生成速度。运行这个模型需要 24 GB 显存。如果只有 16 GB 显存,请选择 Mistral Small 24B 或 gpt-oss 20B,它们的大小均为 14 GB。
运行 LLM,应该选 RTX 4080 Super 还是 RTX 4070 Ti Super?+
两者均配备 16 GB 内存,因此支持的模型相同。4080 Super 的内存读取速度为 736 GB/s,而 4070 Ti Super 为 672 GB/s,快约 10%:这是生成速度的最大提升。如果 4070 Ti Super 的二手价格明显更低,请选择它。
RTX 4080 需要多大电源?+
NVIDIA 标明总图形功耗为 320 W,整台电脑所需电源的最低额定功率为 750 W。请检查您所用显卡型号的连接器。优质的 750 W 电源即可满足需求;如果搭配高性能处理器,更高功率的电源能留出余量。
为了运行 LLM,二手 RTX 4080 值得买吗?+
如果它的价格明显低于全新的 RTX 5070 Ti,就值得考虑;后者的显存容量相同,带宽则高约 25%。购买前,请使用 nvidia-smi 确认显卡显示的显存容量为 16 GB,测试一次长时间生成,并检查温度。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。