在 RTX 5090 (32 GB) 上运行哪个 LLM ?
RTX 5090 配备 32 GB GDDR7 显存,带宽为 1 792 GB/s:它可将 270 亿至 320 亿参数的稠密模型(Qwen 3.5 27B、Qwen3 32B)和 300 亿至 350 亿参数的专家模型保留在显存中,同时支持长上下文。在 27B 稠密模型上,其生成速度约为每秒 60 个 token。70B 模型(Q4 量化后为 43 GB)无法容纳在单张显卡上。
凭借 32 GB 显存,RTX 5090 能将模型放在显存中运行,并使用长上下文;对于这些模型,24 GB 显存的显卡无法同时满足长上下文的需求。本指南列出真正能装入显存的模型及其准确的权重文件大小、Hardware Corner 测得的吞吐量,以及 FP4 格式带来的变化、上下文预算和供电限制。您还将了解,什么时候值得为 5090 相比 4090 或 3090 的差价买单。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RTX 5090 用于本地 LLM:32 GB 能支持什么
对于本地 LLM,RTX 5090 的价值在于其 32 GB GDDR7 显存和 1 792 GB/s 的带宽:它能将 270 亿至 350 亿参数的模型完整保留在显存中,同时支持长上下文,而 24 GB 显卡无法为这些模型留出足够的余量。根据 Ollama 模型库,Qwen 3.5 27B 大小为 17 GB,Qwen 3.8 27B 为 18 GB,Qwen3 32B 和 Gemma 4 31B 为 20 GB,Qwen 3.5 35B 和 Nemotron 3 Nano 30B 为 24 GB。Hardware Corner 测得,在 4 000 token 的上下文下,270 亿至 320 亿参数的稠密模型速度约为每秒 59 至 61 个 token,而一个 350 亿参数的专家模型则超过每秒 160 个 token。单张显卡仍然容纳不下 70B 模型(Llama 3.3 的 Q4 版本为 43 GB)。
- 内存
- 根据NVIDIA,配备512位总线的GDDR7显存为32GB;根据Hardware Corner数据,显存带宽达1792GB/s。
- 计算
- 21 760 个 CUDA 核心和第五代 Tensor Cores,据 NVIDIA 所述。计算能力 12.0,由 Ollama 支持,需使用 550 或更高版本的驱动程序。
- 功耗
- 根据 NVIDIA 的说明,显卡功耗为 575 W,所需系统电源功率为 1,000 W,并须搭配一根额定功率为 600 W 的 PCIe Gen 5 线缆或随附的转接器。
#能装入 32 GB 显存的模型
模型文件大小取自 Ollama 模型库中的文件,查阅日期为 2026 年 9 月 29 日。余量指的是 32 GB 显存中尚未计入上下文、缓存和引擎缓冲区占用时的剩余空间。
| 模型 | Ollama 文件 | 毛利率 | 备注 |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 18 GB | 128k 上下文,无限制 |
| Qwen 3.5 27B | 17 GB | 15 GB | 稠密型,支持文本和图像 |
| Qwen 3.8 27B | 18 GB | 14 GB | 稠密模型,较新一代 |
| Qwen3 32B / Gemma 4 31B | 20 GB | 12 GB | 可流畅运行的稠密模型规模上限 |
| Qwen 3.5 35B / Nemotron 3 Nano 30B | 24 GB | 8 GB | 计入上下文后,24 GB 显存无法容纳 |
| Llama 3.3 70B | 43 GB | 缺少 11 GB | 无法容纳 |
| gpt-oss 120B | 65 GB | 缺少33 GB | 超出能力范围 |
32 GB 主要增加的是可用余量:加载一个 27B 稠密模型后,仍可为上下文保留 14 至 15 GB,而在 24 GB 显存的显卡上只能保留 6 至 7 GB;权重占用 24 GB 的模型也仍能加载,并留下 8 GB 余量。正是这些余量,使下文给出具体数值的 128k 上下文配置成为可能。
#实测吞吐量:RTX 5090 相比其他显卡带来了什么
以下数据来自Hardware Corner,基于llama.cpp在4k至256k上下文长度上的测试结果。这些数据并非QuelLLM的测试结果。
| 模型(Q4_K,Qwen 3.5 35B 则为 MXFP4) | 上下文长度 4k | 上下文 32k | 128k上下文 |
|---|---|---|---|
| Qwen3 14B | 123,8 | 82,4 | 37,2 |
| gpt-oss 20B | 298,2 | 215,1 | 112,0 |
| Qwen3 30B A3B | 226,1 | 143,1 | 76,8 |
| Qwen 3.5 27B | 58,8 | 53,8 | 44,1 |
| Gemma 4 31B | 61,1 | 55,4 | 43,4 |
| Qwen3 32B | 61,4 | 43,8 | 未测量 |
| Qwen 3.5 35B (MXFP4) | 165,2 | 143,2 | 118,2 |
生成速度受带宽限制:理论上限约等于带宽除以模型所占空间。对于 Qwen 3.5 27B(17 GB),1 792 ÷ 17 得到每秒 105 个 token,而实测值为 58.8,达到理论上限的 56%。对于 Qwen3 32B(20 GB),理论上限为每秒 90 个 token,实测值为 61.4,达到理论上限的 68%。因此,270 至 320 亿参数的稠密模型在 5090 上的生成速度约为每秒 60 个 token。
在 Qwen 3.5 27B 上,5090 的生成速度是 3090 的 1.76 倍(根据 Hardware Corner 的两个页面,分别为 58.8 和 33.5),而带宽高出 1.91 倍(1 792 对 936 GB/s)。在 llama.cpp 的排名中,5090 在 Llama 2 7B Q4_0 上达到约 290 到 300 tokens/秒,而 3090 约为 160 tokens/秒。
#5090 对比 4090 和 3090:实测差距
| 显卡 | 内存 | 相对生成 |
|---|---|---|
| RTX 5090 | 32 GB | 100 % |
| RTX 4090 | 24 GB | 77 % |
| RTX 3090 Ti | 24 GB | 55 % |
| RTX 3090 | 24 GB | 51 % |
#上下文与 KV 缓存:如何规划 32 GB 显存的使用
Ollama 根据显存容量设置默认上下文长度:其文档指出,显存为 24 至 48 GiB 时,默认上下文为 32k tokens,并建议智能体、网页搜索和代码工具使用至少 64,000 tokens。5090 属于默认上下文为 32k 的档位,比显存低于 24 GiB 的显卡所用的 4k 更宽裕。增加上下文长度的代价是占用更多 KV 缓存,该缓存存储每个已读取 token 的注意力键和值。
主要手段是对缓存进行量化:根据 Ollama 的 FAQ,q8_0 的内存占用约为 f16 的一半,精度损失极小,但需要 Flash Attention;显卡和模型都支持时,Ollama 会自动启用该功能。计算规则:加载模型后剩余的空间,再减去 1–2 GB 的缓冲区空间,就是缓存预算。使用 Qwen 3.5 27B(17 GB)时,还剩超过 13 GB 可用于上下文,Hardware Corner 的 128k 实测也证实了这一点。使用 ollama ps 检查结果。
#FP4、NVFP4、MXFP4:Blackwell 实际上带来了什么变化
Blackwell 引入了 NVFP4 格式:根据 NVIDIA,这是一种 4 位浮点格式,每个块的缩放因子为 16,而 MXFP4 为 32,因此更精细。Hardware Corner 指出,RTX 5090 在硬件层面可加速 NVFP4。Q4_K_M 是 llama.cpp 的分块量化格式:两者在技术上并不对立,属于不同的文件格式,一个模型仅在被转换后才会存在于其中一种格式中。
实际表现方面,上方表格中 Qwen 3.5 35B 的 MXFP4 条目展示了这张显卡运行 4 位浮点格式时的表现:权重大小为 24 GB,在 4k 下达到每秒 165 个 token。工具(llama.cpp、Ollama、vLLM)对 NVFP4 的支持变化很快:选择文件前,请检查已安装的版本和模型说明,并继续将 Q4_K_M 作为稳妥选择。
#在 RTX 5090 上安装 Ollama
- 01检查驱动程序在终端中运行 nvidia-smi:驱动版本应为 550 或更高(Windows 下为 551.61),总显存应显示约 32 GB。
- 02安装 Ollama请从官方网站安装 Ollama。本地 API 的监听地址为 http://localhost:11434。
- 03运行模型执行 ollama run qwen3.5:27b:只需下载一次,下载量为 17 GB。若想尝试更大的混合专家模型,可运行 ollama run qwen3.5:35b(24 GB)。
- 04检查分配情况在另一个终端中执行 ollama ps:处理器列应显示 100% GPU。
- 05调整上下文使用 OLLAMA_CONTEXT_LENGTH 设置上下文长度,然后再次运行 ollama ps。如果剩余内存空间不够,请在启动时将 OLLAMA_FLASH_ATTENTION 设为 1,并将 OLLAMA_KV_CACHE_TYPE 设为 q8_0。
#供电、散热与微调
NVIDIA 公布的显卡功耗为 575 W,系统电源要求为 1,000 W,GPU 最高温度为 90 °C,并要求使用额定功率为 600 W 的 PCIe Gen 5 电源线:5090 是本次对比中对配套条件要求最高的显卡。安装前请检查电源线及其插头,并准备通风良好的机箱。限制功率可以降低功耗,而速度损失很小,因为 LLM 主要依赖显存(参见对应指南中将 3090 功率限制为 250 W 时的测量记录)。
在 QLoRA 4 位量化下,Unsloth 指出的 VRAM 最低要求为:270亿参数模型需 22 GB,320亿参数模型需 26 GB,400亿参数模型需 30 GB,700亿参数模型需 41 GB。因此,RTX 5090 可以使用 QLoRA 对最多 400 亿参数的模型进行微调,批大小为 1 且上下文较短,不支持 700 亿参数模型。
#结论:根据使用场景选择 5090、4090 或 3090
| 情况 | 决策 | 数字依据 |
|---|---|---|
| 您希望运行一个具有 270 亿至 320 亿参数的稠密模型,并使用长上下文 | 5090 | 32 GB:有 12 至 15 GB 余量,Qwen 3.5 27B 在 128k 上下文下可达 44 token/秒 |
| 你希望使用一个拥有300亿至350亿参数的专家模型 | 5090 | 模型权重占 24 GB:计入上下文所需显存后,24 GB 显卡无法容纳 |
| 您仍将使用80至140亿参数的模型 | 没有 5090 显卡 | RTX 3090 或 16GB 显存的显卡即可胜任 |
| 您已拥有4090 | 除非需要 32 GB 显存,否则继续使用现有显卡 | 生成速度为 5090 的 77% |
| 您想要 70B 模型 | 两块显卡或一台统一内存机器 | 43 GB 的权重,Q4 量化 |
从 RTX 4090 升级到 RTX 5090,首要理由是显存容量不足:据 Hardware Corner,速度提升约为 30%,而 32GB 显存可以加载 24GB 显存无法容纳的模型和上下文。要查看当天的价格,请参阅我们的价格追踪,其中每周两次记录各款显卡的最低价格。
- 来源:NVIDIA,RTX 5090 规格
- 来源:Hardware Corner,RTX 5090 上的 LLM 性能基准测试
- 来源:NVIDIA,NVFP4 格式介绍
- 来源:Ollama文档,上下文长度
- 来源:Unsloth,微调所需的显存
#常见问题
在RTX 5090上应安装哪个LLM?+
RTX 5090能否运行70B模型?+
RTX 5090 相比 4090 在 LLM 上是否快很多?+
RTX 5090支持FP4和NVFP4吗?+
RTX 5090 需要什么电源?+
能否在 RTX 5090 上对模型进行微调?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。