进阶 13 分钟RTX 30

在 RTX 3090 / 3090 Ti (24 GB) 上选择哪个 LLM ?

直接回答

一块 RTX 3090 配备 24 GB 显存和 936 GB/s 的带宽:足以运行采用 Q4 量化的 270 亿至 320 亿参数的稠密模型(Qwen 3.5 27B、Qwen3 32B、Gemma 4 31B),以及 gpt-oss 20B 这样的专家模型。3090 Ti 的速度仅提升 6% 至 8%。单张显卡的显存无法完整容纳一个 700 亿参数的模型。

RTX 3090 和 3090 Ti 配备 24 GB 显存,能将 270 亿至 320 亿参数的稠密模型保留在显存中,而 12 GB 和 16 GB 显存的显卡做不到。本指南列出了真正能装入显存的模型,并提供其准确文件大小、Hardware Corner 测得的吞吐量、上下文的影响、可降低功耗的功率限制设置,以及购买前需要检查的事项。您还将了解何时更适合选择 4090 或 5090。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RTX 3090 用于本地 LLM:24GB 显存能实现什么?

对于本地大语言模型,RTX 3090 的主要价值在于其 24 GB GDDR6X 显存和 936 GB/s 带宽:它能将 Q4 量化的 270 亿至 320 亿参数模型完整保留在显存中,而 12 GB 和 16 GB 显存的显卡无法容纳这些模型。根据 Ollama 模型库,Qwen 3.5 27B 的大小为 17 GB,Qwen 3.8 27B 为 18 GB,Qwen3 32B 和 Gemma 4 31B 均为 20 GB。Hardware Corner 在上下文长度为 4000 token 时,测得这些稠密模型的速度约为每秒 33 至 35 token,而 gpt-oss 20B 等专家模型的速度超过每秒 100 token。单张显卡仍无法容纳 Q4 量化的 70B 模型(Llama 3.3 为 43 GB)。3090 Ti 的带宽仅增加 8%。

内存
24 GB GDDR6X 基于 384 位总线;3090 型显卡为 936 GB/s,3090 Ti 型显卡为 1008 GB/s,数据来自维基百科表格。
功耗
根据 NVIDIA 的说明,3090 的显卡功耗为 350 W,Ti 为 450 W;3090 所需的系统电源功率为 750 W,Ti 为 850 W。
软件
Ollama 将 RTX 3090 列为计算能力为 8.6 的显卡之一,使用 550 或更新版本的驱动程序即可获得支持。
i
网上流传着带宽为 986 GB/s 的说法
有些基准测试页面将 3090 的带宽写为 986 GB/s。根据 384 位总线和 19.5 Gbit/s 的显存速率计算,得出的值是 936 GB/s(384 × 19.5 ÷ 8),也就是维基百科表格中的数值。本指南使用这一数值。

#能装入 24 GB 显存的模型

以下大小对应 Ollama 模型库中的文件,查阅日期为 2026 年 9 月 29 日。余量是指在 24 GB 显存中装入模型后、尚未计入上下文、缓存和推理引擎缓冲区时剩余的空间:如果显卡还负责驱动显示器,也请为系统预留空间。

适用于 RTX 3090 / 3090 Ti 的模型(Ollama 文件,除另有说明外均为 Q4 量化)
模型Ollama 文件毛利率它带来的优势
gpt-oss 20B14 GB10 GB快速推理,支持长上下文
Devstral Small 2 24B15 GB9 GB代码与智能体
Qwen 3.5 27B17 GB7 GB多用途稠密模型,支持文本和图像
Qwen 3.8 27B18 GB6 GB较新一代的 27B 稠密模型
Qwen3-Coder 30B19 GB5 GB编程,专家混合模型
Gemma 4 26B19 GB5 GB混合专家模型,吞吐量高
Qwen3 32B / Gemma 4 31B20 GB4 GB稠密模型的上限
Qwen 3.5 35B24 GB0 GB即使采用 Q4 量化也放不下:无法容纳上下文
Llama 3.3 70B43 GB缺少 19 GB单张显卡无法承载

先从一个 270 亿参数的稠密模型开始:Qwen 3.5 27B 会为上下文留出 7 GB 空间。超过 20 GB 后,剩余空间就太小,难以容纳有实际用途的上下文。专家模型(Qwen3-Coder 30B、Gemma 4 26B、gpt-oss 20B)比稠密模型快得多,因为每个 token 只会激活一部分权重。

#上下文和 KV 缓存:24 GB 的优势

Ollama 根据显存容量设置默认上下文长度:其文档注明,显存低于 24 GiB 时为 4k token,介于 24 和 48 GiB 之间时为 32k token。RTX 3090 正好处于分界点:根据显卡向引擎报告的容量,您得到的默认值可能是 32k,也可能是 4k;使用默认设置启动的智能体可能在没有任何提示的情况下丢失历史记录。请使用 ollama ps 检查实际值,并为智能体手动设置上下文长度;文档建议智能体至少使用 64,000 个 token。

KV 缓存会占用内存:每个上下文 token 都需要存储注意力机制的键和值。主要的优化手段是量化缓存:根据 Ollama 的常见问题解答,q8_0 使用的内存约为 f16 的一半,精度损失很小。上下文增大也会降低速度:Hardware Corner 在 Qwen3 14B 上测得,上下文长度从 4k 增至 16k、再增至 32k 时,速度从每秒 70 个 token 降至 52 个,再降至 39 个。

RTX 3090的提示词处理与生成速度,单位为token/秒(Hardware Corner第三方测量数据)
模型(Q4_K;gpt-oss 则采用 MXFP4)4k生成16k 生成32k 上下文下的生成速度读取 4k 提示词32k 提示词读取
Qwen3 8B115,387,567,94 049,61 714,6
Qwen3 14B70,052,138,62 459,01 175,7
gpt-oss 20B147,5128,5112,64 400,32 547,2
Qwen3 30B A3B153,6113,887,22 988,61 336,8
Qwen 3.5 27B33,532,331,01 104,2848,2
Gemma 4 31B34,733,531,41 155,8723,7

存在两种表现。像Qwen3 14B这类传统模型在4k到32k之间吞吐量会下降近一半。而Qwen 3.5 27B在相同区间内的下降仅为7%(从33.5降至31.0)。原始资料未说明原因,但对于长文档场景,这种行为比模型大小更为关键。这些数据来自Hardware Corner,而非QuelLLM的测量结果。

#安装 Ollama 并检查显存是否容得下模型

3090 是一款 Ampere 架构显卡,计算能力为 8.6;使用 NVIDIA 550 或更新版本驱动时,Ollama 支持该显卡;在 Windows 上,文档要求驱动版本为 551.61 或更新版本。根据 Flash Attention 的官方代码仓库,可减少上下文内存占用的 Flash Attention 2 能在 Ampere 上运行;版本 3 仅适用于 Hopper(H100),无法在 3090 上使用。

  1. 01
    检查驱动程序
    在终端中运行 nvidia-smi:驱动版本必须为 550 或以上(Windows 下为 551.61),显存总量应显示约 24GB。
  2. 02
    安装 Ollama
    请从官方网站安装 Ollama。本地 API 的监听地址为 http://localhost:11434。
  3. 03
    启动一个270亿参数的模型
    执行 ollama run qwen3.5:27b:17 GB 的下载仅需一次。若追求更快的响应,可尝试 ollama run gpt-oss:20b(14 GB)。
  4. 04
    检查内存分配
    在第二个终端中执行 ollama ps:处理器列应显示 100 % GPU。若显示 CPU/GPU 混合分配,则说明模型或其上下文有一部分从显存溢出到了系统内存。
  5. 05
    调整上下文
    通过 OLLAMA_CONTEXT_LENGTH 设置固定的上下文长度,然后再次运行 ollama ps。如果显存余量不足,请在启动服务器时将 OLLAMA_FLASH_ATTENTION 设为 1,并将 OLLAMA_KV_CACHE_TYPE 设为 q8_0。
基本命令
ollama run qwen3.5:27b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#吞吐量:带宽实际能带来怎样的表现

生成受带宽限制:GPU 需为每个 token 重新加载所有活跃权重,因此理论上限约为带宽除以模型权重。以 936 GB/s 的带宽,Qwen3 14B(9.3 GB)的上限约为每秒 100 个 token,Hardware Corner 实测 70.0 至 4k,即 70%。Qwen 3.5 27B(17 GB)上限为 55,实测 33.5,即 61%。Qwen3 32B(20 GB)上限为 47,实测 35.1,即 75%。因此,27B 或 32B 的密集模型运行在 60 至 75% 的上限,即每秒 33 至 35 个 token,阅读体验非常舒适。

llama.cpp 社区排行榜证实了这两款显卡的相近之处。在 Llama 2 7B Q4_0(3.56 GiB)上,3090 不启用 Flash Attention 时的生成速度为每秒 158.16 个 token,启用后为 161.89 个;3090 Ti 则分别为每秒 171.19 和 172.26 个 token,即分别提升 8% 和 6%,与带宽增加 8% 相吻合。这两组测量数据来自不同的贡献者,因此实际差距取决于具体机器。

→
提示词处理与回答生成同样重要
提示的解析依赖于计算能力,而非带宽。在 Qwen 3.5 27B 上,Hardware Corner 测得 4k 分辨率下每秒处理 1104 个 token,32k 分辨率下为 848 个 token:一个包含 32000 个 token 的文档可在四十秒内完成解析。对于每次回复都需返回大量上下文的智能体而言,这一延迟比生成速度更为关键。

#散热、功耗限制及二手购买

3090 的功耗为 350 W,Ti 为 450 W;根据 NVIDIA 的数据,两者的 GPU 最高温度分别为 93 °C 和 92 °C。在持续的 LLM 负载下,机箱的噪音和发热都需要考虑:请准备通风良好的机箱,以及符合 NVIDIA 要求的电源——3090 需要 750 W,Ti 需要 850 W。LLM 主要依赖显存,因此限制功耗只会带来少量速度损失。

llama.cpp 的性能排行榜提供了一个大致参考:一名贡献者将其 3090 的功耗限制为 250 W,在 Llama 2 7B Q4_0 上测得每秒 137.72 tokens,而默认设置下的那组测试为每秒 158.16 tokens。这相当于速度降低约 13%,功耗降低 29%。这两次测量来自不同的机器:请将它们作为参考,然后在自己的机器上测量。

限制功率(需管理员权限)
sudo nvidia-smi -pl 250

nvidia-smi 的 -pl 参数可设置最大功耗(单位:瓦特)。在 Windows 系统中,以管理员身份打开终端;该设置在重启后会失效,除非已配置为自动生效。对于二手显卡,还需使用类似 HWiNFO 的工具监控显存温度:若显存温度明显高于核心温度,则应考虑更换散热垫。

#购买二手 3090:需要检查的事项

3090 是一款采用 Ampere 架构的显卡,目前主要在二手市场上能找到。要了解当前价格,请查看我们的价格跟踪:每周两次记录每款显卡的最低价格,并列出每 GB 显存的价格。

身份标识
使用 nvidia-smi 检查显卡是否显示 24 GB 显存,以及型号是否正确(3090 或 3090 Ti),而不是其他型号。
稳定性
让一个 270 亿参数的模型循环运行约三十分钟:崩溃、伪影或过热降频都是警示信号。
内存温度
比较显存温度与 GPU 核心温度:两者差距较大,说明导热垫已经老化。
保修
要求卖家提供退货保障或保修:更换导热垫或导热膏是一项需要预先考虑的成本。
电源
峰值功耗为 350 W 或 450 W:购买前请检查电源和显卡的供电接口。

#3090、4090、5090:多花钱能获得什么好处?

RTX 4090 同样配备 24 GB 显存,计算能力更强:相比文本生成,其优势更多体现在提示词处理上,而生成速度仍受带宽限制。RTX 5090 则提升至 32 GB 显存;在这一容量档位,32B 稠密模型仍有余量支持长上下文。这两款显卡的指南分别详细介绍了各种情况。

#vLLM、双卡与在3090上进行微调

3090 常见的用途有三种。vLLM 可以在这款显卡上运行:根据其文档,它要求计算能力版本为 7.5 或更高,而 3090 的计算能力版本为 8.6。要在 llama.cpp 和 vLLM 之间做出选择,请参阅推理引擎对比。两块 3090 可以通过适用于 30 系列显卡的 NVLink 桥接器组合使用:多 GPU 指南详细介绍了如何分配模型层。

进行微调时,Unsloth在QLoRA 4位量化下指出的VRAM最低要求为:80亿参数模型需6GB,140亿参数模型需8.5GB,270亿参数模型需22GB,320亿参数模型需26GB。因此,3090显卡可支持最多27B模型的QLoRA微调,仅在批大小为1且上下文较短的情况下实现,但无法支持32B模型。在LoRA 16位模式下,90亿参数模型已需24GB,相当于整张显卡的内存。

#结论:哪些情况下 3090 仍是合适的选择

如何根据你的情况做决定
情况决策数字依据
您希望在本地运行 27B 或 32B 的稠密模型3090(或4090)24 GB:17 到 20 GB 为模型权重,4 到 7 GB 为余量
您主要关注的是70至140亿参数的模型一张配备 12 GB 或 16 GB 显存的显卡就够了3090 只带来速度提升:936 GB/s
你想要 70B 模型或超长上下文5090 或两块显卡70B 模型的 Q4 权重大小为 43 GB
静默运行和低功耗优先一张较新的 16 GB 显存显卡3090 需要 750 W 的电源
您在 3090 和 3090 Ti 之间犹豫选择两者中价格更低的选项生成速度仅提升 6%–8%

RTX 3090 仍然是在本地运行 27B 模型最常见的入门选择:这是 Hardware Corner 的结论,该网站认为,对有较高使用要求的用户而言,它是二手显卡中最佳的入门选择。如果预算允许,可以用 RTX 4090 替代它;如果想要 32 GB 显存,则可以选择 RTX 5090。

#常见问题

FAQ
在 RTX 3090 上运行哪个 LLM?+
先从 Qwen 3.5 27B 开始:其 Ollama 文件大小为 17 GB,可为上下文留出约 7 GB 的余量;据 Hardware Corner,生成速度约为每秒 33 个 token。若想获得更高速度,gpt-oss 20B(14 GB)可超过每秒 100 个 token。Qwen3 32B 和 Gemma 4 31B(20 GB)已接近可容纳模型的规模上限。
RTX 3090 能否运行 70B 模型?+
不,无法完全放入显存。在 Ollama 中,Llama 3.3 70B 占用 43 GB,比这张显卡的显存容量多出 19 GB。如果让显存和系统内存共同承载模型,运行会变得非常缓慢,因为每生成一个 token 都要重新读取所有权重。要将 70B 模型完全放入显存,需要两张各有 24 GB 显存的显卡,或一张显存超过 43 GB 的显卡。
本地运行 LLM,该选 RTX 3090 还是 3090 Ti?+
它们几乎相当:相同的24GB内存,带宽分别为936和1008 GB/s,llama.cpp排名中生成速度提升6%至8%。Ti功耗为450W,而另一款为350W。除价格微小差异外,3090是最佳选择。
RTX 3090 需要什么电源?+
NVIDIA 标明,3090 所需的整机电源为 750 W(显卡功耗为 350 W),3090 Ti 则为 850 W(显卡功耗为 450 W)。这些电源数值适用于完整的 PC。根据一项社区测量,将功耗上限设为 250 W 可降低显卡耗电量,代价是速度下降约 13%。
RTX 3090支持vLLM和Flash Attention吗?+
两者都支持。vLLM要求计算能力为7.5或更高,而3090的计算能力为8.6。根据Flash Attention 2官方仓库的说明,它可在包括3090在内的Ampere架构GPU上运行。Flash Attention 3则仅适用于Hopper架构:不要尝试在消费级Ampere显卡上使用它。
能否在 RTX 3090 上对模型进行微调?+
可以,使用 QLoRA 即可。根据 Unsloth 的数据,27B 模型最低需要 22 GB,14B 模型最低需要 8.5 GB,因此 27B 模型在批大小为 1 时勉强可行。32B 模型需要 26 GB,显存装不下。在 16 位 LoRA 模式下,实际参数量上限约为 90 亿。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。