进阶 11 分钟RTX 50

在 RTX 5090 (32 GB) 上运行哪个 LLM ?

直接回答

RTX 5090 配备 32 GB GDDR7 显存,带宽为 1 792 GB/s:它可将 270 亿至 320 亿参数的稠密模型(Qwen 3.5 27B、Qwen3 32B)和 300 亿至 350 亿参数的专家模型保留在显存中,同时支持长上下文。在 27B 稠密模型上,其生成速度约为每秒 60 个 token。70B 模型(Q4 量化后为 43 GB)无法容纳在单张显卡上。

凭借 32 GB 显存,RTX 5090 能将模型放在显存中运行,并使用长上下文;对于这些模型,24 GB 显存的显卡无法同时满足长上下文的需求。本指南列出真正能装入显存的模型及其准确的权重文件大小、Hardware Corner 测得的吞吐量,以及 FP4 格式带来的变化、上下文预算和供电限制。您还将了解,什么时候值得为 5090 相比 4090 或 3090 的差价买单。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RTX 5090 用于本地 LLM:32 GB 能支持什么

对于本地 LLM,RTX 5090 的价值在于其 32 GB GDDR7 显存和 1 792 GB/s 的带宽:它能将 270 亿至 350 亿参数的模型完整保留在显存中,同时支持长上下文,而 24 GB 显卡无法为这些模型留出足够的余量。根据 Ollama 模型库,Qwen 3.5 27B 大小为 17 GB,Qwen 3.8 27B 为 18 GB,Qwen3 32B 和 Gemma 4 31B 为 20 GB,Qwen 3.5 35B 和 Nemotron 3 Nano 30B 为 24 GB。Hardware Corner 测得,在 4 000 token 的上下文下,270 亿至 320 亿参数的稠密模型速度约为每秒 59 至 61 个 token,而一个 350 亿参数的专家模型则超过每秒 160 个 token。单张显卡仍然容纳不下 70B 模型(Llama 3.3 的 Q4 版本为 43 GB)。

内存
根据NVIDIA,配备512位总线的GDDR7显存为32GB;根据Hardware Corner数据,显存带宽达1792GB/s。
计算
21 760 个 CUDA 核心和第五代 Tensor Cores,据 NVIDIA 所述。计算能力 12.0,由 Ollama 支持,需使用 550 或更高版本的驱动程序。
功耗
根据 NVIDIA 的说明,显卡功耗为 575 W,所需系统电源功率为 1,000 W,并须搭配一根额定功率为 600 W 的 PCIe Gen 5 线缆或随附的转接器。

#能装入 32 GB 显存的模型

模型文件大小取自 Ollama 模型库中的文件,查阅日期为 2026 年 9 月 29 日。余量指的是 32 GB 显存中尚未计入上下文、缓存和引擎缓冲区占用时的剩余空间。

适用于 RTX 5090 的模型(Ollama 文件,除非另有注明,均为 Q4)
模型Ollama 文件毛利率备注
gpt-oss 20B14 GB18 GB128k 上下文,无限制
Qwen 3.5 27B17 GB15 GB稠密型,支持文本和图像
Qwen 3.8 27B18 GB14 GB稠密模型,较新一代
Qwen3 32B / Gemma 4 31B20 GB12 GB可流畅运行的稠密模型规模上限
Qwen 3.5 35B / Nemotron 3 Nano 30B24 GB8 GB计入上下文后,24 GB 显存无法容纳
Llama 3.3 70B43 GB缺少 11 GB无法容纳
gpt-oss 120B65 GB缺少33 GB超出能力范围

32 GB 主要增加的是可用余量:加载一个 27B 稠密模型后,仍可为上下文保留 14 至 15 GB,而在 24 GB 显存的显卡上只能保留 6 至 7 GB;权重占用 24 GB 的模型也仍能加载,并留下 8 GB 余量。正是这些余量,使下文给出具体数值的 128k 上下文配置成为可能。

#实测吞吐量:RTX 5090 相比其他显卡带来了什么

以下数据来自Hardware Corner,基于llama.cpp在4k至256k上下文长度上的测试结果。这些数据并非QuelLLM的测试结果。

RTX 5090 上的生成速度,单位为每秒 token(Hardware Corner)
模型(Q4_K,Qwen 3.5 35B 则为 MXFP4)上下文长度 4k上下文 32k128k上下文
Qwen3 14B123,882,437,2
gpt-oss 20B298,2215,1112,0
Qwen3 30B A3B226,1143,176,8
Qwen 3.5 27B58,853,844,1
Gemma 4 31B61,155,443,4
Qwen3 32B61,443,8未测量
Qwen 3.5 35B (MXFP4)165,2143,2118,2

生成速度受带宽限制:理论上限约等于带宽除以模型所占空间。对于 Qwen 3.5 27B(17 GB),1 792 ÷ 17 得到每秒 105 个 token,而实测值为 58.8,达到理论上限的 56%。对于 Qwen3 32B(20 GB),理论上限为每秒 90 个 token,实测值为 61.4,达到理论上限的 68%。因此,270 至 320 亿参数的稠密模型在 5090 上的生成速度约为每秒 60 个 token。

在 Qwen 3.5 27B 上,5090 的生成速度是 3090 的 1.76 倍(根据 Hardware Corner 的两个页面,分别为 58.8 和 33.5),而带宽高出 1.91 倍(1 792 对 936 GB/s)。在 llama.cpp 的排名中,5090 在 Llama 2 7B Q4_0 上达到约 290 到 300 tokens/秒,而 3090 约为 160 tokens/秒。

#5090 对比 4090 和 3090:实测差距

各显卡的相对生成性能(Hardware Corner,5090 = 100%)
显卡内存相对生成
RTX 509032 GB100 %
RTX 409024 GB77 %
RTX 3090 Ti24 GB55 %
RTX 309024 GB51 %
→
真正的优势:长上下文
5090 显卡在上下文增长时仍能保持吞吐量。Qwen 3.5 27B 从 4k 到 128k token 的上下文下,吞吐量从 58.8 降至 44.1 tokens/秒(-25%),而 Qwen 的 3.5 35B 模型在 MXFP4 量化下,即使在 256,000 token 上下文下仍能保持 97.3 tokens/秒的吞吐量。正是在这种场景下,而非短上下文对话中,32 GB 显存才真正证明了显卡的价值。

#上下文与 KV 缓存:如何规划 32 GB 显存的使用

Ollama 根据显存容量设置默认上下文长度:其文档指出,显存为 24 至 48 GiB 时,默认上下文为 32k tokens,并建议智能体、网页搜索和代码工具使用至少 64,000 tokens。5090 属于默认上下文为 32k 的档位,比显存低于 24 GiB 的显卡所用的 4k 更宽裕。增加上下文长度的代价是占用更多 KV 缓存,该缓存存储每个已读取 token 的注意力键和值。

主要手段是对缓存进行量化:根据 Ollama 的 FAQ,q8_0 的内存占用约为 f16 的一半,精度损失极小,但需要 Flash Attention;显卡和模型都支持时,Ollama 会自动启用该功能。计算规则:加载模型后剩余的空间,再减去 1–2 GB 的缓冲区空间,就是缓存预算。使用 Qwen 3.5 27B(17 GB)时,还剩超过 13 GB 可用于上下文,Hardware Corner 的 128k 实测也证实了这一点。使用 ollama ps 检查结果。

#FP4、NVFP4、MXFP4:Blackwell 实际上带来了什么变化

Blackwell 引入了 NVFP4 格式:根据 NVIDIA,这是一种 4 位浮点格式,每个块的缩放因子为 16,而 MXFP4 为 32,因此更精细。Hardware Corner 指出,RTX 5090 在硬件层面可加速 NVFP4。Q4_K_M 是 llama.cpp 的分块量化格式:两者在技术上并不对立,属于不同的文件格式,一个模型仅在被转换后才会存在于其中一种格式中。

实际表现方面,上方表格中 Qwen 3.5 35B 的 MXFP4 条目展示了这张显卡运行 4 位浮点格式时的表现:权重大小为 24 GB,在 4k 下达到每秒 165 个 token。工具(llama.cpp、Ollama、vLLM)对 NVFP4 的支持变化很快:选择文件前,请检查已安装的版本和模型说明,并继续将 Q4_K_M 作为稳妥选择。

#在 RTX 5090 上安装 Ollama

  1. 01
    检查驱动程序
    在终端中运行 nvidia-smi:驱动版本应为 550 或更高(Windows 下为 551.61),总显存应显示约 32 GB。
  2. 02
    安装 Ollama
    请从官方网站安装 Ollama。本地 API 的监听地址为 http://localhost:11434。
  3. 03
    运行模型
    执行 ollama run qwen3.5:27b:只需下载一次,下载量为 17 GB。若想尝试更大的混合专家模型,可运行 ollama run qwen3.5:35b(24 GB)。
  4. 04
    检查分配情况
    在另一个终端中执行 ollama ps:处理器列应显示 100% GPU。
  5. 05
    调整上下文
    使用 OLLAMA_CONTEXT_LENGTH 设置上下文长度,然后再次运行 ollama ps。如果剩余内存空间不够,请在启动时将 OLLAMA_FLASH_ATTENTION 设为 1,并将 OLLAMA_KV_CACHE_TYPE 设为 q8_0。
基本命令
ollama run qwen3.5:27b
ollama run qwen3.5:35b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#供电、散热与微调

NVIDIA 公布的显卡功耗为 575 W,系统电源要求为 1,000 W,GPU 最高温度为 90 °C,并要求使用额定功率为 600 W 的 PCIe Gen 5 电源线:5090 是本次对比中对配套条件要求最高的显卡。安装前请检查电源线及其插头,并准备通风良好的机箱。限制功率可以降低功耗,而速度损失很小,因为 LLM 主要依赖显存(参见对应指南中将 3090 功率限制为 250 W 时的测量记录)。

在 QLoRA 4 位量化下,Unsloth 指出的 VRAM 最低要求为:270亿参数模型需 22 GB,320亿参数模型需 26 GB,400亿参数模型需 30 GB,700亿参数模型需 41 GB。因此,RTX 5090 可以使用 QLoRA 对最多 400 亿参数的模型进行微调,批大小为 1 且上下文较短,不支持 700 亿参数模型。

#结论:根据使用场景选择 5090、4090 或 3090

如何根据你的情况做决定
情况决策数字依据
您希望运行一个具有 270 亿至 320 亿参数的稠密模型,并使用长上下文509032 GB:有 12 至 15 GB 余量,Qwen 3.5 27B 在 128k 上下文下可达 44 token/秒
你希望使用一个拥有300亿至350亿参数的专家模型5090模型权重占 24 GB:计入上下文所需显存后,24 GB 显卡无法容纳
您仍将使用80至140亿参数的模型没有 5090 显卡RTX 3090 或 16GB 显存的显卡即可胜任
您已拥有4090除非需要 32 GB 显存,否则继续使用现有显卡生成速度为 5090 的 77%
您想要 70B 模型两块显卡或一台统一内存机器43 GB 的权重,Q4 量化

从 RTX 4090 升级到 RTX 5090,首要理由是显存容量不足:据 Hardware Corner,速度提升约为 30%,而 32GB 显存可以加载 24GB 显存无法容纳的模型和上下文。要查看当天的价格,请参阅我们的价格追踪,其中每周两次记录各款显卡的最低价格。

#常见问题

FAQ
在RTX 5090上应安装哪个LLM?+
先从 Qwen 3.5 27B 开始:其 Ollama 文件大小为 17 GB,可留下约 15 GB 的余量;据 Hardware Corner,生成速度约为每秒 59 个 token。若要使用更大的专家模型,Qwen 3.5 35B(24 GB)的生成速度超过每秒 160 个 token。Qwen3 32B 和 Gemma 4 31B(20 GB)是该显卡所能容纳的稠密模型的容量上限。
RTX 5090能否运行70B模型?+
不,无法完全放入显存。Llama 3.3 70B 在 Ollama 中占用 43 GB,比这块显卡的显存容量多出 11 GB,而 gpt-oss 120B 占用 65 GB。如果将模型分散存放在显存和系统内存中,生成速度会下降,因为每生成一个 token 都要重新读取稠密模型的全部权重。要让 70B 模型完全驻留显存,需要两块显卡或一台采用统一内存的机器。
RTX 5090 相比 4090 在 LLM 上是否快很多?+
根据Hardware Corner数据,4090的性能约为5090的77%,两者性能差距约30%,5090略占优势。其主要优势在于32GB显存,可加载更大模型和更长上下文。
RTX 5090支持FP4和NVFP4吗?+
是的:NVFP4 是 Blackwell 引入的 4 位格式,Hardware Corner 指出该卡可实现硬件加速。软件支持正在演进:请确认您使用的 Ollama、llama.cpp 或 vLLM 版本是否支持模型格式。Q4_K_M 仍是稳妥选择,无需使用 FP4。
RTX 5090 需要什么电源?+
NVIDIA 标明,显卡功耗为 575 W 时,应使用 1,000 W 的系统电源,并搭配额定功率为 600 W 的 PCIe Gen 5 线缆或随附的适配器。Hardware Corner 建议至少使用 950 W 的金牌电源。请选择优质电源,并在安装前检查线缆。
能否在 RTX 5090 上对模型进行微调?+
可以,使用 QLoRA 即可。根据 Unsloth 的说明,27B 模型最低需要 22 GB 显存,40B 模型最低需要 30 GB,因此在批量大小为 1 时,都能放入 32 GB 显存。70B 模型需要 41 GB,无法放入。这些是绝对最低要求:上下文长度和批量大小会增加显存需求。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。