在 RTX 3090 / 3090 Ti (24 GB) 上选择哪个 LLM ?
一块 RTX 3090 配备 24 GB 显存和 936 GB/s 的带宽:足以运行采用 Q4 量化的 270 亿至 320 亿参数的稠密模型(Qwen 3.5 27B、Qwen3 32B、Gemma 4 31B),以及 gpt-oss 20B 这样的专家模型。3090 Ti 的速度仅提升 6% 至 8%。单张显卡的显存无法完整容纳一个 700 亿参数的模型。
RTX 3090 和 3090 Ti 配备 24 GB 显存,能将 270 亿至 320 亿参数的稠密模型保留在显存中,而 12 GB 和 16 GB 显存的显卡做不到。本指南列出了真正能装入显存的模型,并提供其准确文件大小、Hardware Corner 测得的吞吐量、上下文的影响、可降低功耗的功率限制设置,以及购买前需要检查的事项。您还将了解何时更适合选择 4090 或 5090。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RTX 3090 用于本地 LLM:24GB 显存能实现什么?
对于本地大语言模型,RTX 3090 的主要价值在于其 24 GB GDDR6X 显存和 936 GB/s 带宽:它能将 Q4 量化的 270 亿至 320 亿参数模型完整保留在显存中,而 12 GB 和 16 GB 显存的显卡无法容纳这些模型。根据 Ollama 模型库,Qwen 3.5 27B 的大小为 17 GB,Qwen 3.8 27B 为 18 GB,Qwen3 32B 和 Gemma 4 31B 均为 20 GB。Hardware Corner 在上下文长度为 4000 token 时,测得这些稠密模型的速度约为每秒 33 至 35 token,而 gpt-oss 20B 等专家模型的速度超过每秒 100 token。单张显卡仍无法容纳 Q4 量化的 70B 模型(Llama 3.3 为 43 GB)。3090 Ti 的带宽仅增加 8%。
- 内存
- 24 GB GDDR6X 基于 384 位总线;3090 型显卡为 936 GB/s,3090 Ti 型显卡为 1008 GB/s,数据来自维基百科表格。
- 功耗
- 根据 NVIDIA 的说明,3090 的显卡功耗为 350 W,Ti 为 450 W;3090 所需的系统电源功率为 750 W,Ti 为 850 W。
- 软件
- Ollama 将 RTX 3090 列为计算能力为 8.6 的显卡之一,使用 550 或更新版本的驱动程序即可获得支持。
#能装入 24 GB 显存的模型
以下大小对应 Ollama 模型库中的文件,查阅日期为 2026 年 9 月 29 日。余量是指在 24 GB 显存中装入模型后、尚未计入上下文、缓存和推理引擎缓冲区时剩余的空间:如果显卡还负责驱动显示器,也请为系统预留空间。
| 模型 | Ollama 文件 | 毛利率 | 它带来的优势 |
|---|---|---|---|
| gpt-oss 20B | 14 GB | 10 GB | 快速推理,支持长上下文 |
| Devstral Small 2 24B | 15 GB | 9 GB | 代码与智能体 |
| Qwen 3.5 27B | 17 GB | 7 GB | 多用途稠密模型,支持文本和图像 |
| Qwen 3.8 27B | 18 GB | 6 GB | 较新一代的 27B 稠密模型 |
| Qwen3-Coder 30B | 19 GB | 5 GB | 编程,专家混合模型 |
| Gemma 4 26B | 19 GB | 5 GB | 混合专家模型,吞吐量高 |
| Qwen3 32B / Gemma 4 31B | 20 GB | 4 GB | 稠密模型的上限 |
| Qwen 3.5 35B | 24 GB | 0 GB | 即使采用 Q4 量化也放不下:无法容纳上下文 |
| Llama 3.3 70B | 43 GB | 缺少 19 GB | 单张显卡无法承载 |
先从一个 270 亿参数的稠密模型开始:Qwen 3.5 27B 会为上下文留出 7 GB 空间。超过 20 GB 后,剩余空间就太小,难以容纳有实际用途的上下文。专家模型(Qwen3-Coder 30B、Gemma 4 26B、gpt-oss 20B)比稠密模型快得多,因为每个 token 只会激活一部分权重。
#上下文和 KV 缓存:24 GB 的优势
Ollama 根据显存容量设置默认上下文长度:其文档注明,显存低于 24 GiB 时为 4k token,介于 24 和 48 GiB 之间时为 32k token。RTX 3090 正好处于分界点:根据显卡向引擎报告的容量,您得到的默认值可能是 32k,也可能是 4k;使用默认设置启动的智能体可能在没有任何提示的情况下丢失历史记录。请使用 ollama ps 检查实际值,并为智能体手动设置上下文长度;文档建议智能体至少使用 64,000 个 token。
KV 缓存会占用内存:每个上下文 token 都需要存储注意力机制的键和值。主要的优化手段是量化缓存:根据 Ollama 的常见问题解答,q8_0 使用的内存约为 f16 的一半,精度损失很小。上下文增大也会降低速度:Hardware Corner 在 Qwen3 14B 上测得,上下文长度从 4k 增至 16k、再增至 32k 时,速度从每秒 70 个 token 降至 52 个,再降至 39 个。
| 模型(Q4_K;gpt-oss 则采用 MXFP4) | 4k生成 | 16k 生成 | 32k 上下文下的生成速度 | 读取 4k 提示词 | 32k 提示词读取 |
|---|---|---|---|---|---|
| Qwen3 8B | 115,3 | 87,5 | 67,9 | 4 049,6 | 1 714,6 |
| Qwen3 14B | 70,0 | 52,1 | 38,6 | 2 459,0 | 1 175,7 |
| gpt-oss 20B | 147,5 | 128,5 | 112,6 | 4 400,3 | 2 547,2 |
| Qwen3 30B A3B | 153,6 | 113,8 | 87,2 | 2 988,6 | 1 336,8 |
| Qwen 3.5 27B | 33,5 | 32,3 | 31,0 | 1 104,2 | 848,2 |
| Gemma 4 31B | 34,7 | 33,5 | 31,4 | 1 155,8 | 723,7 |
存在两种表现。像Qwen3 14B这类传统模型在4k到32k之间吞吐量会下降近一半。而Qwen 3.5 27B在相同区间内的下降仅为7%(从33.5降至31.0)。原始资料未说明原因,但对于长文档场景,这种行为比模型大小更为关键。这些数据来自Hardware Corner,而非QuelLLM的测量结果。
#安装 Ollama 并检查显存是否容得下模型
3090 是一款 Ampere 架构显卡,计算能力为 8.6;使用 NVIDIA 550 或更新版本驱动时,Ollama 支持该显卡;在 Windows 上,文档要求驱动版本为 551.61 或更新版本。根据 Flash Attention 的官方代码仓库,可减少上下文内存占用的 Flash Attention 2 能在 Ampere 上运行;版本 3 仅适用于 Hopper(H100),无法在 3090 上使用。
- 01检查驱动程序在终端中运行 nvidia-smi:驱动版本必须为 550 或以上(Windows 下为 551.61),显存总量应显示约 24GB。
- 02安装 Ollama请从官方网站安装 Ollama。本地 API 的监听地址为 http://localhost:11434。
- 03启动一个270亿参数的模型执行 ollama run qwen3.5:27b:17 GB 的下载仅需一次。若追求更快的响应,可尝试 ollama run gpt-oss:20b(14 GB)。
- 04检查内存分配在第二个终端中执行 ollama ps:处理器列应显示 100 % GPU。若显示 CPU/GPU 混合分配,则说明模型或其上下文有一部分从显存溢出到了系统内存。
- 05调整上下文通过 OLLAMA_CONTEXT_LENGTH 设置固定的上下文长度,然后再次运行 ollama ps。如果显存余量不足,请在启动服务器时将 OLLAMA_FLASH_ATTENTION 设为 1,并将 OLLAMA_KV_CACHE_TYPE 设为 q8_0。
#吞吐量:带宽实际能带来怎样的表现
生成受带宽限制:GPU 需为每个 token 重新加载所有活跃权重,因此理论上限约为带宽除以模型权重。以 936 GB/s 的带宽,Qwen3 14B(9.3 GB)的上限约为每秒 100 个 token,Hardware Corner 实测 70.0 至 4k,即 70%。Qwen 3.5 27B(17 GB)上限为 55,实测 33.5,即 61%。Qwen3 32B(20 GB)上限为 47,实测 35.1,即 75%。因此,27B 或 32B 的密集模型运行在 60 至 75% 的上限,即每秒 33 至 35 个 token,阅读体验非常舒适。
llama.cpp 社区排行榜证实了这两款显卡的相近之处。在 Llama 2 7B Q4_0(3.56 GiB)上,3090 不启用 Flash Attention 时的生成速度为每秒 158.16 个 token,启用后为 161.89 个;3090 Ti 则分别为每秒 171.19 和 172.26 个 token,即分别提升 8% 和 6%,与带宽增加 8% 相吻合。这两组测量数据来自不同的贡献者,因此实际差距取决于具体机器。
#散热、功耗限制及二手购买
3090 的功耗为 350 W,Ti 为 450 W;根据 NVIDIA 的数据,两者的 GPU 最高温度分别为 93 °C 和 92 °C。在持续的 LLM 负载下,机箱的噪音和发热都需要考虑:请准备通风良好的机箱,以及符合 NVIDIA 要求的电源——3090 需要 750 W,Ti 需要 850 W。LLM 主要依赖显存,因此限制功耗只会带来少量速度损失。
llama.cpp 的性能排行榜提供了一个大致参考:一名贡献者将其 3090 的功耗限制为 250 W,在 Llama 2 7B Q4_0 上测得每秒 137.72 tokens,而默认设置下的那组测试为每秒 158.16 tokens。这相当于速度降低约 13%,功耗降低 29%。这两次测量来自不同的机器:请将它们作为参考,然后在自己的机器上测量。
nvidia-smi 的 -pl 参数可设置最大功耗(单位:瓦特)。在 Windows 系统中,以管理员身份打开终端;该设置在重启后会失效,除非已配置为自动生效。对于二手显卡,还需使用类似 HWiNFO 的工具监控显存温度:若显存温度明显高于核心温度,则应考虑更换散热垫。
#购买二手 3090:需要检查的事项
3090 是一款采用 Ampere 架构的显卡,目前主要在二手市场上能找到。要了解当前价格,请查看我们的价格跟踪:每周两次记录每款显卡的最低价格,并列出每 GB 显存的价格。
- 身份标识
- 使用 nvidia-smi 检查显卡是否显示 24 GB 显存,以及型号是否正确(3090 或 3090 Ti),而不是其他型号。
- 稳定性
- 让一个 270 亿参数的模型循环运行约三十分钟:崩溃、伪影或过热降频都是警示信号。
- 内存温度
- 比较显存温度与 GPU 核心温度:两者差距较大,说明导热垫已经老化。
- 保修
- 要求卖家提供退货保障或保修:更换导热垫或导热膏是一项需要预先考虑的成本。
- 电源
- 峰值功耗为 350 W 或 450 W:购买前请检查电源和显卡的供电接口。
#3090、4090、5090:多花钱能获得什么好处?
RTX 4090 同样配备 24 GB 显存,计算能力更强:相比文本生成,其优势更多体现在提示词处理上,而生成速度仍受带宽限制。RTX 5090 则提升至 32 GB 显存;在这一容量档位,32B 稠密模型仍有余量支持长上下文。这两款显卡的指南分别详细介绍了各种情况。
#vLLM、双卡与在3090上进行微调
3090 常见的用途有三种。vLLM 可以在这款显卡上运行:根据其文档,它要求计算能力版本为 7.5 或更高,而 3090 的计算能力版本为 8.6。要在 llama.cpp 和 vLLM 之间做出选择,请参阅推理引擎对比。两块 3090 可以通过适用于 30 系列显卡的 NVLink 桥接器组合使用:多 GPU 指南详细介绍了如何分配模型层。
进行微调时,Unsloth在QLoRA 4位量化下指出的VRAM最低要求为:80亿参数模型需6GB,140亿参数模型需8.5GB,270亿参数模型需22GB,320亿参数模型需26GB。因此,3090显卡可支持最多27B模型的QLoRA微调,仅在批大小为1且上下文较短的情况下实现,但无法支持32B模型。在LoRA 16位模式下,90亿参数模型已需24GB,相当于整张显卡的内存。
#结论:哪些情况下 3090 仍是合适的选择
| 情况 | 决策 | 数字依据 |
|---|---|---|
| 您希望在本地运行 27B 或 32B 的稠密模型 | 3090(或4090) | 24 GB:17 到 20 GB 为模型权重,4 到 7 GB 为余量 |
| 您主要关注的是70至140亿参数的模型 | 一张配备 12 GB 或 16 GB 显存的显卡就够了 | 3090 只带来速度提升:936 GB/s |
| 你想要 70B 模型或超长上下文 | 5090 或两块显卡 | 70B 模型的 Q4 权重大小为 43 GB |
| 静默运行和低功耗优先 | 一张较新的 16 GB 显存显卡 | 3090 需要 750 W 的电源 |
| 您在 3090 和 3090 Ti 之间犹豫 | 选择两者中价格更低的选项 | 生成速度仅提升 6%–8% |
RTX 3090 仍然是在本地运行 27B 模型最常见的入门选择:这是 Hardware Corner 的结论,该网站认为,对有较高使用要求的用户而言,它是二手显卡中最佳的入门选择。如果预算允许,可以用 RTX 4090 替代它;如果想要 32 GB 显存,则可以选择 RTX 5090。
- 来源:NVIDIA,RTX 3090 和 RTX 3090 Ti 规格
- 来源:Hardware Corner,基于RTX 3090的LLM基准测试
- 来源:llama.cpp 在 CUDA 平台上的社区排名
- 来源:Ollama文档,上下文长度
- 来源:Unsloth,微调所需的显存
#常见问题
在 RTX 3090 上运行哪个 LLM?+
RTX 3090 能否运行 70B 模型?+
本地运行 LLM,该选 RTX 3090 还是 3090 Ti?+
RTX 3090 需要什么电源?+
RTX 3090支持vLLM和Flash Attention吗?+
能否在 RTX 3090 上对模型进行微调?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。