24 GB 显存适合哪个 LLM ?
配备 24 GB 显存时,可加载采用 Q4 量化的 270 亿参数稠密模型,如 Qwen 3.8 27B(权重占 16 GB,剩余 8 GB),或 300 至 350 亿参数的 MoE 模型(19 至 21 GB)。采用 Q4 量化的 700 亿参数稠密模型(约 40 GB)无法装入:需要两块显卡或统一内存。
24 GB VRAM 是 270 亿至 350 亿参数模型的门槛。本指南说明了哪些内容能装下,哪些显卡真正拥有 24 GB,其带宽允许的速度上限是多少,以及微调能进行到什么程度。
您正在挑选电脑吗? 按预算推荐 →
本地 AI 的高性价比之选: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#24 GB显存:可运行270至350亿参数模型的档位
拥有 24 GB 显存时,您可以将一个采用 Q4 量化、拥有 270 亿参数的稠密模型完整加载到显存中(根据 QuelLLM 目录,权重占用 16 GB),并为上下文预留 8 GB 空间;也可以加载一个拥有 300 亿至 350 亿参数、其中 30 亿参数处于激活状态的 MoE 模型(占用 19 至 21 GB),但上下文会更短。采用 Q4 量化的 70B 稠密模型约占用 40 GB,无法装入这块显卡的显存,需要两块显卡或统一内存。24 GB 这一档位,让您从 90 亿至 140 亿参数的模型迈向能与以往的大型模型相媲美的模型。
| 模型 | Q4 权重 | 24 GB 显存的剩余空间 | 备注 |
|---|---|---|---|
| gpt-oss 20B (MoE) | 13 GB | 11 GB | 上下文非常长 |
| Devstral Small 2 24B | 14 GB | 10 GB | 编程智能体 |
| Qwen 3.8 27B | 16 GB | 8 GB | 稠密架构、通用型,宣称的上下文长度为 262,144 个 token |
| Gemma 4 31B | 18 GB | 6 GB | 稠密模型,Q5 量化占用 22 GB,内存余量过于紧张 |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | 代码,30亿激活参数 |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | 上下文较短,勉强能装入显存 |
| Qwen 3.8 27B的Q8量化版本 | 29 GB | 否 | 超出容量 |
对此指南先前版本的一处更正:它有时将 Qwen 3.8 27B 标为 18 GB,有时标为 16 GB,并将 Qwen 3.6 35B-A3B 标为 23 GB。目录显示为 16 GB 和 21 GB。这些数字是 Q4 量化后的四舍五入权重;请务必加上 KV 缓存和约一 GB 的余量。
#哪些显卡有 24 GB,差异是什么
三张消费级显卡主导了这一级别。NVIDIA 描述了配备 24 GB GDDR6X 的 RTX 3090,以及配备 24 GB GDDR6X 的 RTX 4090。AMD 表示 RX 7900 XTX 配备 24 GB GDDR6,带宽高达 960 GB/s。根据 NVIDIA,配备 512 位总线 32 GB GDDR7 的 RTX 5090 属于更高级别。不要将其与 RX 7900 XT 混淆,后者拥有 20 GB:llama.cpp 的性能表将其列为配备 20 GB GDDR6。
| 显卡 | 软件 | 推荐在以下场景使用 | Guide |
|---|---|---|---|
| RTX 3090 / 3090 Ti | CUDA | 您希望获得 CUDA 支持,并以适中的价格购买二手入门显卡 | 在RTX 3090上运行的LLM |
| RTX 4090 | CUDA | 您希望在更现代的架构上使用CUDA | 在RTX 4090上运行LLM |
| RX 7900 XTX | ROCm 7 或 Vulkan | 您使用Linux且接受ROCm | RX 7900 XTX 上的 LLM |
选择取决于三个因素:软件生态、显卡的新旧程度(状况、保修)以及当天的价格,我们不会将价格固定下来。本站的价格追踪功能提供每 GB 显存的成本,每周更新两次;这是在 24 GB 二手显卡和 16 GB 全新显卡之间做取舍时的合适指标。
#24 GB 显存下,根据使用场景选择模型
| 用途 | 模型 | 为什么 |
|---|---|---|
| 通用多任务型 | Qwen 3.8 27B Q4 | 稠密模型,为上下文留有8 GB余量 |
| 速度与推理能力 | gpt-oss 20B | 轻量 MoE,剩余 11 GB 内存空间 |
| 编程与开发智能体 | Devstral Small 2 24B 或 Qwen3-Coder 30B-A3B | 14或19 GB,上下文长度取决于余量 |
| 最大的MoE模型 | Qwen 3.6 35B-A3B Q4 | 21 GB,30 亿个活跃参数,短上下文 |
| 智能体与工具调用 | GLM 4.7 Flash Q4 | 19 GB,据目录记载采用MIT许可证 |
在这一规模档位,真正需要权衡的是稠密模型与混合专家模型(MoE)。一个 270 亿参数的稠密模型会在处理每个 token 时读取全部权重:它比 MoE 模型慢,但能为上下文留下更多 VRAM。一个 350 亿参数的 MoE 模型只读取其激活的参数,因此生成速度更快,但其全部权重几乎占满整张显卡的显存。关于 MoE 的指南解释了这一机制。
#那 70B 模型呢?24 GB 显存究竟能做到什么
根据本站的参考数值,一个 70B 稠密模型在 Q4 量化下的权重约占 40 GB,比 24 GB 至少多出 16 GB。需要将这部分权重卸载到系统内存中,此时生成速度将受系统内存和 PCIe 总线速度限制,而不是取决于显卡的速度。由于缺少可核实的来源,我们不提供这种情况下的生成速率:只需记住,它太慢,难以提供流畅的交互体验。在质量相当的情况下,拥有 300 亿至 350 亿参数的 MoE 模型是应对这一限制的实用选择。
- 仅配备一张 24 GB 显存显卡
- Q4 量化的 30–35B MoE 模型,或 Q4、Q5 量化的 27–31B 稠密模型,并为上下文留出 3 至 8 GB 空间。
- 两张24GB显卡(共48GB)
- 将模型层分配到多张显卡上,可运行 Q4 量化的 70B 模型(约 40 GB),并留出少量上下文空间。
- 一张 32 GB 显存的显卡
- RTX 5090:单卡仍装不下Q4量化的70B模型,但能较宽裕地容纳270至320亿参数的稠密模型。
在 llama.cpp 中,默认的分配模式会按层将模型拆分到多张显卡上,以流水线方式运行,并可调整各张显卡的分配比例。提升的是容量,而非每个 token 的处理速度,因为各张显卡依次工作。
#速度:由带宽设定的上限
每生成一个 token,都需要读取稠密模型的大部分权重:理论速度上限等于带宽除以权重大小。AMD 的规格表给出的 RX 7900 XTX 带宽为 960 GB/s;对于 NVIDIA 显卡,请查阅具体型号的规格表以获取带宽数据。表格给出了稠密模型每 100 GB/s 带宽对应的理论速度上限;MoE 模型每生成一个 token 读取的权重更少,因此速度更快。
| Q4 量化模型 | 读取的权重 | 每 100 GB/s | 示例 960 GB/s (7900 XTX) |
|---|---|---|---|
| Devstral Small 2 24B | 14 GB | ≈ 7 tokens/s | ≈ 69 tokens/s |
| Qwen 3.8 27B | 16 GB | ≈ 6 tokens/s | 60 tokens/s |
| Gemma 4 31B | 18 GB | ≈ 5.6 tokens/s | ≈ 53 tokens/s |
这些数值是上限,绝不是实测结果:实际速度更低,并会随驱动程序、软件和上下文而变化。由于缺乏针对这些模型的公开、可比测试平台,我们不公布各显卡每秒生成的 token 数。要测量您自己的安装环境,请运行 ollama run,并加上 --verbose 选项。
#上下文:24 GB 显存下的真正限制
在 24 GB 显存上,KV 缓存决定了可用的上下文长度。Q4 量化的 Qwen 3.8 27B 会留下 8 GB 空间,而 Qwen 3.6 35B-A3B 只留下 3 GB。根据 Ollama 的文档,其默认上下文长度为 4096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 修改。为节省空间,请对缓存进行量化:OLLAMA_KV_CACHE_TYPE=q8_0 的内存占用约为默认 f16 的一半,前提是已启用 Flash Attention。
#三行算出余量
要判断模型及其上下文是否放得下,请相加三项:模型权重、KV 缓存以及约一吉字节的余量。我们以模型权重为例。一个 Q5 格式的 Qwen 3.8 27B 重 19 GB:剩余 24 减 19 减 1,即 4 GB 用于 KV 缓存。一个 Q4 格式的 Qwen 3.6 35B-A3B 重 21 GB:剩余 24 减 21 减 1,仅 2 GB,因此上下文较短,除非您对缓存进行量化。同样的 27B 模型在 Q4 格式下(16 GB)可释放 7 GB,从而允许更长的上下文。
这一计算解释了一种常见选择:当上下文是首要考虑时,优先选择 Q4 量化而非 Q5;当您处理短文本且重视模型保真度时,则优先选择 Q5 而非 Q4。量化选择指南详细介绍了质量差异,KV 缓存指南则说明了能节省多少空间。
#购买配备 24 GB 显存的二手显卡:需要进行哪些检查
最常见的 24 GB 显卡来自 2020 至 2022 年:二手市场上有很多,其中一些曾长期连续运行。购买前,请索要负载测试截图,检查测试期间的显存温度,并检查风扇噪音。确认驱动程序中显示的容量确实为 24 GB,您现有的电源能满足显卡的功耗需求,且机箱内还有足够的空间。这些显卡的价格每周都可能变化:本站的价格追踪功能可用于比较全新与二手显卡每 GB 显存的成本。
#24 GB 微调:哪些可行,哪些不可行
Unsloth 文档提供了一张表,按模型规模和方法列出最低显存需求,并明确指出这些都是绝对最低值。使用 QLoRA(4位)时,7B 模型需要5 GB,14B 需要8.5 GB,27B 需要22 GB。使用16位 LoRA 时,8B 模型需要22 GB,14B 需要33 GB。因此,在24 GB显存上,对不超过140亿参数的模型进行 QLoRA 微调比较宽裕;27B 模型则只能勉强容纳,几乎没有余量;对14B 模型进行16位 LoRA 微调则不可行。
| 模型 | QLoRA (4 位) | LoRA(16位) | 在 24 GB 显存下 |
|---|---|---|---|
| 7B | 5 GB | 19 GB | QLoRA 和 LoRA |
| 9B | 6.5 GB | 24 GB | 可用 QLoRA;LoRA 几乎没有显存余量 |
| 14B | 8.5 GB | 33 GB | 只能使用 QLoRA |
| 27B | 22 GB | 64 GB | QLoRA 勉强可行 |
| 32B | 26 GB | 76 GB | 否 |
| 70B | 41 GB | 164 GB | 否 |
- 32 GB 显存适合运行哪款 LLM
- 拥有 16 GB VRAM 时选哪个 LLM
- LLM 在 RTX 3090 / 3090 Ti(24 GB)上运行
- RX 7900 XTX (24 GB) 上的 LLM
- MoE原理说明:为何30B-A3B模型运行得像小型模型
- 本地 AI 显卡价格
#常见问题
24 GB VRAM 下最适合的 LLM 是哪个?+
有 24 GB 显存,还应该以运行 70B 模型为目标吗?+
想要24GB显存,该选RTX 3090、RTX 4090还是RX 7900 XTX?+
使用 24 GB 显存,每秒能生成多少个 token?+
24 GB 足够进行微调吗?+
可以同时使用两张 24 GB 显存的显卡吗?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。