进阶 12 分钟RTX 40
RTX 4090(24 GB)上运行哪个 LLM ?
RTX 4090(2022 年 10 月发布)在 2026 年仍是消费级本地 AI 的标杆:24 GB GDDR6X 显存、1008 GB/s 带宽,以及 16 384 个 Ada Lovelace 架构 CUDA 核心。它运行 Qwen 3.5 9B 的速度超过 90 tok/s,能流畅运行 Qwen 3.8 27B Q4,甚至还能通过少量卸载运行 Llama 70B Q4。目前二手价格为 1700–2000 欧元(原 LHR 库存);单纯用于 LLM 时,其性能与价格之比优于全新的 5080。本指南详细介绍所有能运行的模型,以及吞吐量的大致水平。
您正在挑选电脑吗? 按预算推荐 →
推荐硬件
本指南的备选购买方案: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——您无需承担额外费用,但我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM会从符合条件的购买中获益。
#2026年的RTX 4090,依旧称王
- 架构
- 阿达·洛芙莱斯(AD102),TSMC 4N工艺制程,760亿个晶体管。
- VRAM
- 24 GB GDDR6X,传输速率为 21 Gbps,总线宽度为 384 位。带宽为 1008 GB/s。
- CUDA 核心
- 16 384。第四代 Tensor Cores,原生支持 FP8。第三代 RT Cores。
- TDP
- 450 W,建议使用 850 W 电源。
- 2026 年价格
- 二手价格为1700至2000欧元,品相良好。
→
为什么在2026年仍值得考虑
24 GB 是一个关键门槛,让您能够运行 Llama 3.3 70B Q2_K(共需 26 GB,其中 2 GB 卸载到系统内存)、采用 Q8 的 Qwen 3.8 27B,以及 Qwen3-Coder 30B-A3B。5080(16 GB,新卡)做不到,5090(32 GB,新卡,约 5 700 欧元)的价格则约为其 3 倍。单看每欧元能买到的显存容量,二手 4090 占优。
#1. 可在 24 GB 显存上运行的模型
LLM 模型 — RTX 4090 24 GB
| 模型 | Quant | VRAM | Tokens/sec | 用途 |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 GB | 117-143 | 即时聊天 |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 36-44 | 支持法语的聊天与 RAG 功能 |
| Qwen 3.6 27B | Q4_K_M | 16 GB | 29-35 | 专业代码助手 |
| Qwen 3.8 27B | Q4_K_M | 16 GB | 20-24 | 高质量推理 |
| Mistral Small 24B | Q6_K | 20 GB | 32-38 | 兼顾多种用途的最佳平衡点 |
| GLM 4.7 Flash | Q4_K_M | 19 GB | 90-110 | 高级推理 |
| Granite 4.1 30B Instruct | Q4_K_M | 17 GB | 27-33 | 多文件复杂代码 |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 GB | 54-66 | 将 2 GB 模型数据卸载到系统内存,仍可使用 |
| Gemma 4 31B | Q5_K_M | 22 GB | 27-33 | 全部装入显存,但质量下降 |
i
Llama 70B:应选择何种量化方式?
Q4_K_M(42 GB):需要将大量模型数据转移到系统内存,约 6 token/s,使用体验不太舒适。Q2_K(26 GB):需要将 2 GB 转移到系统内存,约 10 token/s,质量尚可。IQ2_XS(21 GB):全部放在显存中,约 20 token/s,但质量明显下降。要在本地舒适地运行 70B 模型,建议选择 RTX 5090(32 GB)或 Mac Studio。
#2. 安装与 CUDA
- 01NVIDIA 550+ 驱动程序CUDA 12.4+。对于全新4090显卡,GeForce Experience可完成驱动安装。Linux:需使用nvidia-driver-565或更高版本。
- 02Ollama来自 ollama.com 的标准安装程序。支持自动检测 CUDA GPU。
- 03首次模型测试:利用 24 GB 显存ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. tokens/sec 基准测试
RTX 4090 24 GB — 每秒令牌数的大致数量级
| 模型 | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Ada优化
- Flash Attention 2
- 默认启用。FA3将出现在未来llama.cpp版本中。
- KV缓存Q8
- OLLAMA_KV_CACHE_TYPE=q8_0。可让 14B 模型使用 32k 上下文,占用约 15 GB 显存,留下 9 GB 供其他进程使用。
- 功耗限制
- nvidia-smi -pl 350(至少350瓦)。LLM:速度下降2%,温度和噪音降低25%。可持续运行24/7。
- FP8 通过 TensorRT-LLM 实现
- Ada原生支持FP8。通过TensorRT-LLM,Qwen 3.5 9B的批量吞吐量提升达+40%。在多用户服务场景中尤为实用。
#5. 4090 vs 5090 vs 3090
NVIDIA 的三款消费级旗舰显卡
| 标准 | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | 24 GB GDDR6X |
| 带宽 | 1792 GB/s | 1008 GB/s | 936 GB/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| 2026 年价格 | ≈ 5 700 € (28/09/2026) | 二手价约 1 800 欧元 | 二手约750欧元 |
→
24 GB 显存方案中性价比最高的选择:二手 3090
价格为 750 欧元,而非 1800 欧元,3090 同样提供 24 GB VRAM,但纯速度约低 30%。如果您优先考虑的是 VRAM(24–32B 模型、14B 及以上模型的 QLoRA),而不是最高速度,那么二手 3090 仍然是 NVIDIA 历史上用于 LLM 时性价比最高的显卡。
#2026 年买二手:明智之选?
- 在以下情况下,选择购买二手 4090
- 预算为 1500–2000 欧元,需要高强度使用 LLM,又不需要最新一代硬件。24 GB 显存是一个很有分量的购买理由。
- 在以下情况下,优先选择 RTX 5090
- 预算 ≥ 5 700 欧元,经常使用 70B 模型,需要原生 FP4 支持,或用作团队服务器。32 GB 显存会带来显著变化。
- 在以下情况下,优先选择 RTX 3090
- 预算 ≤ 1000 欧元,纯 LLM 使用,速度为次要需求。相同 VRAM 下价格仅为一半。
- 在以下情况下优先选择 RTX 5070 Ti
- 预算约 1,400 欧元,使用的模型不超过 14B。全新且带保修,配备 GDDR7,支持 FP4。
#常见问题
RTX 4090 是否可以本地运行 Llama 3.3 70B?+
可以,但需要作出取舍。Q4_K_M(42 GB):大量卸载到系统内存 → 6–8 tok/s(无法实用)。Q2_K(26 GB):2 GB 放在系统内存中 → 10–12 tok/s(可以接受)。IQ2_XS(21 GB):全部放入显存 → 20 tok/s,但质量下降。若想舒适地运行真正的大模型,优先选择 5090(32 GB)——或者继续使用能完全装入显存的 Qwen 3.8 27B。
Qwen 3.5 9B在RTX 4090上每秒能生成多少token?+
采用 Q4_K_M 量化时约为 90 tokens/秒,采用 Q8_0 时为 62 tokens/秒。这一速度完全足以满足任何聊天用途,此外还能享用模型的 256k 上下文和视觉能力。
二手 RTX 4090 还是全新 RTX 5080?+
二手 4090(1 800 欧元):24 GB 显存,运行 7B 模型时比 5080 慢 10%,但可通过将部分模型卸载到系统内存来运行 70B 模型,也可运行 Q6 量化的 32B 模型。全新 5080(约 1 500 至 1 850 欧元):16 GB 显存,运行小模型更快,保修 3 年,支持 FP4。仅用于 LLM 时,4090 凭借显存优势胜出;若看重性能和保修,则选 5080。
RTX 4090 在运行 LLM 时发热量和功耗都很大吗?+
低于游戏场景。推理 Qwen 3.5 9B 支持:250-320 W(对比 450 W TDP),GPU 温度为 65-72 °C。一个良好的风道机箱即可满足。对于 24/7 持续使用,将电压降至 350 W 可有效降低温度和噪音,且不会显著影响 LLM 性能。
在 RTX 4090 上能否进行 LoRA 微调?+
是的,非常出色。在 Qwen 3.5 9B 上使用 LoRA:12 GB,支持 batch 4 和 4096 上下文。在 Mistral Small 24B 上使用 QLoRA:约 18 GB,可行。在 70B 模型上使用 QLoRA:空间紧张,但可通过 unsloth + batch 1 实现。对于 70B 的经典 LoRA 模型,需 2 块 4090 或一块 5090。
RTX 4090 支持 FP8 吗?+
是的,Ada Lovelace 的第四代 Tensor Core 原生支持 FP8。TensorRT-LLM(相比 FP16 提升 30–40%)和 vLLM(0.5 及以上版本)利用了这一特性,llama.cpp 也有部分支持。对于使用 Ollama 的普通用户,仍建议使用 Q4–Q8。对于批量推理服务,FP8 值得使用。
RTX 4090 需要什么电源?+
至少需要一款品质可靠的 850 W 电源(推荐 ATX 3.0,但并非必需)。运行 LLM 时,平均功耗为 250–320 W;运行游戏或基准测试时,功耗为 450 W。若搭配高端 CPU(9950X、14900K),选择 1000 W 电源更稳妥。
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
这份指南对您有帮助吗?
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。