进阶 14 分钟GPU

RTX 5090 与本地 LLM:内存、模型, benchmark

RTX 5090 与本地 LLM:了解 32 GB 显存能做什么,选择身份明确的模型,并准备可复现的基准测试。厂商规格和估算值与实测数据分开呈现。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-12·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#已验证与未验证的内容

!
2026年9月12日修正
本指南此前列出的吞吐速度、插座端功耗测量和对比结果已被移除,因为相关测量文件无法提供以供核查。因此,本页不展示任何针对 RTX 5090 的自测基准结果,并将厂商规格、内存估算和待执行的测试方案分开呈现。

NVIDIA 的规格页面标明 RTX 5090 配备 32 GB GDDR7,而 RTX 4090 为 24 GB。这一差异增加了可用显存容量;它并不能证明吞吐速度或回答质量。制造商来源:https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/

#模型权重、上下文缓存和运行时余量

量化文件、KV 缓存和运行时缓冲区必须能同时装入内存。在保留可用上下文的情况下,一个 32 GB 的文件无法完整装入 32 GB 显存。缩短上下文、选择更紧凑的量化格式,或接受将部分模型卸载到 CPU,都是不同的取舍。

仅估算权重大小的理论公式:总参数量 × 每个权重的比特数 / 8,不计元数据和量化额外开销。这个计算结果既不是实际显存使用量的测量值,也不保证模型能够加载。在估算需要存储的权重大小时,绝不能用 MoE 的活跃参数量代替总参数量。

#Llama 4 Scout:关键修正

官方标识为 meta-llama/Llama-4-Scout-17B-16E-Instruct:170 亿个活跃参数,总计 1090 亿个参数,16 个专家。此前的「17B-A2B」名称以及所谓占用 17 GB 的说法都是错误的。在四比特量化下,1090 亿个权重本身就约占 54.5 GB(十进制),还未计入额外开销。在这种量化方式下,该模型无法完全放入单块配备 32 GB 显存的 RTX 5090 中运行。

一手来源:https://huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct 。将部分模型卸载到系统内存或多张显卡上,会改变测试流程和吞吐量。对于这种未经测量的配置,我们不提供任何速度结果。

#一个可识别的初始模型

入门时,可以选择 Qwen/Qwen3-8B 和 Qwen/Qwen3-14B,这是 Qwen 发布的两个可明确识别的模型。先采用 Q4 量化,将上下文长度设为 4096 个 token,然后检查模型实际加载在哪些硬件上。8B 留有更多余量;14B 则是一个可用您自己的任务进行比较的备选模型。这一入门选择并不是在 RTX 5090 上经过测试得出的模型质量排名。

来源:https://huggingface.co/Qwen/Qwen3-8B 和 https://huggingface.co/Qwen/Qwen3-14B;发行版 Ollama:https://ollama.com/library/qwen3:8b 和 https://ollama.com/library/qwen3:14b。标签可能发生变化:请查阅其摘要和量化情况,并使用 ollama show avant 进行结果对比。

安装 Ollama 后的首次试用
ollama run qwen3:8b
# Dans la session interactive :
/set parameter num_ctx 4096
# Posez une question courte, puis contrôlez le placement dans un autre terminal :
ollama ps
ollama show qwen3:8b

#RTX 5090 与 RTX 4090:不借助虚假基准测试进行比较

RTX 4090 不支持 NVLink。两块 RTX 4090 不会自动合并成一个能像单张显卡一样使用的 48 GB 显存池。运行时可以通过 PCIe 分配部分工作负载,但会产生通信开销,并受到模型自身的限制。NVIDIA 来源:https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/

仅比较带宽,无法可靠地推算每秒生成 token 数能提高多少倍。提示词处理、生成、量化、上下文、计算内核和 offload 都必须保持一致。在没有可比测量结果的情况下,本文不会声称 5090、4090 或 3090 具有任何以具体数值表示的优势。

#应采用的可复现测试流程

通过 nvidia-smi 记录 GPU 的确切型号和显存容量,并记录 CPU、内存、操作系统、驱动、运行时版本、模型标识和哈希值、量化方式、上下文、批处理及 offload 配置。测试期间仅保留一个用户,且不得有其他 GPU 负载。进行预热并记录预热过程,然后使用相同输入重复测试五次。

在 Ollama 的 JSON 响应中,分别保留 prompt_eval_count / prompt_eval_duration 和 eval_count / eval_duration。时长单位为纳秒。公布每次重复测试的结果、中位数和离散程度,并注明提示词缓存情况。来源:https://docs.ollama.com/api/generate。生成吞吐量无法衡量全部感知延迟,也无法衡量质量。

#能耗与价格:此处未进行测量

制造商标注的功率并不是插座端测得的功耗。比较能耗需要使用功率计、采用相同的系统,并记录运行时长和生成的输出。由于缺乏可追溯的测量数据,原先的价格/token比值和带有具体数值的功率上限建议已被撤下。请先明确自己的显存需求,再比较当前价格。

#根据实际所需内存来选择

当您的量化模型及其上下文所需的显存超过 24 GB 显卡的容量、但仍低于 32 GB 显卡的容量时,32 GB 显卡可能会有用。对于小模型,请先检查它在您当前硬件上的运行效果。对于 Scout,模型权重的总大小仍是决定性因素:活跃参数并不能让这个模型适配 32 GB 显存。

#继续进行免费安装

配置工具提供兼容性预估。随后,您可以借助模型详情页和 Ollama 指南,在任何购买之前核实安装情况,以及模型在 CPU/GPU 上的分配情况。Benchmarks 页面上发布的硬件测试结果必须结合相应的测试方法和确切的测试机器来解读。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。