进阶 11 分钟按 VRAM 分类

24 GB 显存适合哪个 LLM ?

直接回答

配备 24 GB 显存时,可加载采用 Q4 量化的 270 亿参数稠密模型,如 Qwen 3.8 27B(权重占 16 GB,剩余 8 GB),或 300 至 350 亿参数的 MoE 模型(19 至 21 GB)。采用 Q4 量化的 700 亿参数稠密模型(约 40 GB)无法装入:需要两块显卡或统一内存。

24 GB VRAM 是 270 亿至 350 亿参数模型的门槛。本指南说明了哪些内容能装下,哪些显卡真正拥有 24 GB,其带宽允许的速度上限是多少,以及微调能进行到什么程度。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本地 AI 的高性价比之选: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

为什么选择它?我们的完整资料: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#24 GB显存:可运行270至350亿参数模型的档位

拥有 24 GB 显存时,您可以将一个采用 Q4 量化、拥有 270 亿参数的稠密模型完整加载到显存中(根据 QuelLLM 目录,权重占用 16 GB),并为上下文预留 8 GB 空间;也可以加载一个拥有 300 亿至 350 亿参数、其中 30 亿参数处于激活状态的 MoE 模型(占用 19 至 21 GB),但上下文会更短。采用 Q4 量化的 70B 稠密模型约占用 40 GB,无法装入这块显卡的显存,需要两块显卡或统一内存。24 GB 这一档位,让您从 90 亿至 140 亿参数的模型迈向能与以往的大型模型相媲美的模型。

24 GB 显存能容纳哪些模型(大小取自 QuelLLM 模型目录,除非另有说明,否则均为 Q4 量化)
模型Q4 权重24 GB 显存的剩余空间备注
gpt-oss 20B (MoE)13 GB11 GB上下文非常长
Devstral Small 2 24B14 GB10 GB编程智能体
Qwen 3.8 27B16 GB8 GB稠密架构、通用型,宣称的上下文长度为 262,144 个 token
Gemma 4 31B18 GB6 GB稠密模型,Q5 量化占用 22 GB,内存余量过于紧张
Qwen3-Coder 30B-A3B (MoE)19 GB5 GB代码,30亿激活参数
Qwen 3.6 35B-A3B (MoE)21 GB3 GB上下文较短,勉强能装入显存
Qwen 3.8 27B的Q8量化版本29 GB否超出容量

对此指南先前版本的一处更正:它有时将 Qwen 3.8 27B 标为 18 GB,有时标为 16 GB,并将 Qwen 3.6 35B-A3B 标为 23 GB。目录显示为 16 GB 和 21 GB。这些数字是 Q4 量化后的四舍五入权重;请务必加上 KV 缓存和约一 GB 的余量。

#哪些显卡有 24 GB,差异是什么

三张消费级显卡主导了这一级别。NVIDIA 描述了配备 24 GB GDDR6X 的 RTX 3090,以及配备 24 GB GDDR6X 的 RTX 4090。AMD 表示 RX 7900 XTX 配备 24 GB GDDR6,带宽高达 960 GB/s。根据 NVIDIA,配备 512 位总线 32 GB GDDR7 的 RTX 5090 属于更高级别。不要将其与 RX 7900 XT 混淆,后者拥有 20 GB:llama.cpp 的性能表将其列为配备 20 GB GDDR6。

获取24GB的三种方式
显卡软件推荐在以下场景使用Guide
RTX 3090 / 3090 TiCUDA您希望获得 CUDA 支持,并以适中的价格购买二手入门显卡在RTX 3090上运行的LLM
RTX 4090CUDA您希望在更现代的架构上使用CUDA在RTX 4090上运行LLM
RX 7900 XTXROCm 7 或 Vulkan您使用Linux且接受ROCmRX 7900 XTX 上的 LLM

选择取决于三个因素:软件生态、显卡的新旧程度(状况、保修)以及当天的价格,我们不会将价格固定下来。本站的价格追踪功能提供每 GB 显存的成本,每周更新两次;这是在 24 GB 二手显卡和 16 GB 全新显卡之间做取舍时的合适指标。

#24 GB 显存下,根据使用场景选择模型

各使用场景的起步选择
用途模型为什么
通用多任务型Qwen 3.8 27B Q4稠密模型,为上下文留有8 GB余量
速度与推理能力gpt-oss 20B轻量 MoE,剩余 11 GB 内存空间
编程与开发智能体Devstral Small 2 24B 或 Qwen3-Coder 30B-A3B14或19 GB,上下文长度取决于余量
最大的MoE模型Qwen 3.6 35B-A3B Q421 GB,30 亿个活跃参数,短上下文
智能体与工具调用GLM 4.7 Flash Q419 GB,据目录记载采用MIT许可证

在这一规模档位,真正需要权衡的是稠密模型与混合专家模型(MoE)。一个 270 亿参数的稠密模型会在处理每个 token 时读取全部权重:它比 MoE 模型慢,但能为上下文留下更多 VRAM。一个 350 亿参数的 MoE 模型只读取其激活的参数,因此生成速度更快,但其全部权重几乎占满整张显卡的显存。关于 MoE 的指南解释了这一机制。

#那 70B 模型呢?24 GB 显存究竟能做到什么

根据本站的参考数值,一个 70B 稠密模型在 Q4 量化下的权重约占 40 GB,比 24 GB 至少多出 16 GB。需要将这部分权重卸载到系统内存中,此时生成速度将受系统内存和 PCIe 总线速度限制,而不是取决于显卡的速度。由于缺少可核实的来源,我们不提供这种情况下的生成速率:只需记住,它太慢,难以提供流畅的交互体验。在质量相当的情况下,拥有 300 亿至 350 亿参数的 MoE 模型是应对这一限制的实用选择。

仅配备一张 24 GB 显存显卡
Q4 量化的 30–35B MoE 模型,或 Q4、Q5 量化的 27–31B 稠密模型,并为上下文留出 3 至 8 GB 空间。
两张24GB显卡(共48GB)
将模型层分配到多张显卡上,可运行 Q4 量化的 70B 模型(约 40 GB),并留出少量上下文空间。
一张 32 GB 显存的显卡
RTX 5090:单卡仍装不下Q4量化的70B模型,但能较宽裕地容纳270至320亿参数的稠密模型。

在 llama.cpp 中,默认的分配模式会按层将模型拆分到多张显卡上,以流水线方式运行,并可调整各张显卡的分配比例。提升的是容量,而非每个 token 的处理速度,因为各张显卡依次工作。

#速度:由带宽设定的上限

每生成一个 token,都需要读取稠密模型的大部分权重:理论速度上限等于带宽除以权重大小。AMD 的规格表给出的 RX 7900 XTX 带宽为 960 GB/s;对于 NVIDIA 显卡,请查阅具体型号的规格表以获取带宽数据。表格给出了稠密模型每 100 GB/s 带宽对应的理论速度上限;MoE 模型每生成一个 token 读取的权重更少,因此速度更快。

稠密模型在每 100 GB/s 带宽下的理论上限
Q4 量化模型读取的权重每 100 GB/s示例 960 GB/s (7900 XTX)
Devstral Small 2 24B14 GB≈ 7 tokens/s≈ 69 tokens/s
Qwen 3.8 27B16 GB≈ 6 tokens/s60 tokens/s
Gemma 4 31B18 GB≈ 5.6 tokens/s≈ 53 tokens/s

这些数值是上限,绝不是实测结果:实际速度更低,并会随驱动程序、软件和上下文而变化。由于缺乏针对这些模型的公开、可比测试平台,我们不公布各显卡每秒生成的 token 数。要测量您自己的安装环境,请运行 ollama run,并加上 --verbose 选项。

#上下文:24 GB 显存下的真正限制

在 24 GB 显存上,KV 缓存决定了可用的上下文长度。Q4 量化的 Qwen 3.8 27B 会留下 8 GB 空间,而 Qwen 3.6 35B-A3B 只留下 3 GB。根据 Ollama 的文档,其默认上下文长度为 4096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 修改。为节省空间,请对缓存进行量化:OLLAMA_KV_CACHE_TYPE=q8_0 的内存占用约为默认 f16 的一半,前提是已启用 Flash Attention。

32k上下文,使用q8_0格式的KV缓存
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=32768 ollama serve
ollama ps

#三行算出余量

要判断模型及其上下文是否放得下,请相加三项:模型权重、KV 缓存以及约一吉字节的余量。我们以模型权重为例。一个 Q5 格式的 Qwen 3.8 27B 重 19 GB:剩余 24 减 19 减 1,即 4 GB 用于 KV 缓存。一个 Q4 格式的 Qwen 3.6 35B-A3B 重 21 GB:剩余 24 减 21 减 1,仅 2 GB,因此上下文较短,除非您对缓存进行量化。同样的 27B 模型在 Q4 格式下(16 GB)可释放 7 GB,从而允许更长的上下文。

这一计算解释了一种常见选择:当上下文是首要考虑时,优先选择 Q4 量化而非 Q5;当您处理短文本且重视模型保真度时,则优先选择 Q5 而非 Q4。量化选择指南详细介绍了质量差异,KV 缓存指南则说明了能节省多少空间。

#购买配备 24 GB 显存的二手显卡:需要进行哪些检查

最常见的 24 GB 显卡来自 2020 至 2022 年:二手市场上有很多,其中一些曾长期连续运行。购买前,请索要负载测试截图,检查测试期间的显存温度,并检查风扇噪音。确认驱动程序中显示的容量确实为 24 GB,您现有的电源能满足显卡的功耗需求,且机箱内还有足够的空间。这些显卡的价格每周都可能变化:本站的价格追踪功能可用于比较全新与二手显卡每 GB 显存的成本。

#24 GB 微调:哪些可行,哪些不可行

Unsloth 文档提供了一张表,按模型规模和方法列出最低显存需求,并明确指出这些都是绝对最低值。使用 QLoRA(4位)时,7B 模型需要5 GB,14B 需要8.5 GB,27B 需要22 GB。使用16位 LoRA 时,8B 模型需要22 GB,14B 需要33 GB。因此,在24 GB显存上,对不超过140亿参数的模型进行 QLoRA 微调比较宽裕;27B 模型则只能勉强容纳,几乎没有余量;对14B 模型进行16位 LoRA 微调则不可行。

Unsloth 给出的微调最低 VRAM 要求
模型QLoRA (4 位)LoRA(16位)在 24 GB 显存下
7B5 GB19 GBQLoRA 和 LoRA
9B6.5 GB24 GB可用 QLoRA;LoRA 几乎没有显存余量
14B8.5 GB33 GB只能使用 QLoRA
27B22 GB64 GBQLoRA 勉强可行
32B26 GB76 GB否
70B41 GB164 GB否
!
已纠正的一处错误:70B 模型的 QLoRA 微调无法装入 24 GB 显存
本指南的早期版本曾声称,对 70B 模型进行 QLoRA 微调所需的显存“勉强”在 22–23 GB 左右。Unsloth 指出,70B 模型进行 QLoRA 微调至少需要 41 GB 显存,27B 模型则需要 22 GB。因此,70B 模型至少需要两块 24 GB 显存的显卡,或一块显存容量更大的显卡。

#常见问题

常见问题
24 GB VRAM 下最适合的 LLM 是哪个?+
如果需要通用模型,可选 Q4 量化的 Qwen 3.8 27B:根据 QuelLLM 目录,模型权重占用 16 GB,因此还剩 8 GB 余量用于上下文。如果追求速度,可选 gpt-oss 20B(13 GB)。如果用于代码任务,可选 Devstral Small 2 24B(14 GB)或 Qwen3-Coder 30B-A3B(19 GB)。如果需要大型 MoE 模型,可选 Qwen 3.6 35B-A3B(21 GB),但要使用较短的上下文。
有 24 GB 显存,还应该以运行 70B 模型为目标吗?+
不。Q4 量化的 70B 稠密模型占用约 40 GB:至少有 16 GB 需要放到系统内存中,速度会低到无法满足交互使用。拥有 300 亿至 350 亿参数的 MoE 模型可以完全装入这张显卡的显存。运行 70B 模型,应准备两张 24 GB 显卡,总计 48 GB。
想要24GB显存,该选RTX 3090、RTX 4090还是RX 7900 XTX?+
三款显卡均配备 24 GB 显存。选择既取决于生态系统——两款 RTX 使用 CUDA,RX 7900 XTX 使用 ROCm 7 或 Vulkan——也取决于当天的价格;我们不会将价格固定下来。请查看本站的价格追踪页面,其中会计算每 GB 显存的成本。
使用 24 GB 显存,每秒能生成多少个 token?+
这取决于模型和显卡。对于稠密模型,理论上限是带宽除以模型权重的大小:一个权重占用 16 GB 的 27B 模型,在 960 GB/s 的带宽下约为 60 tokens/s,但实际无法精确达到这一上限。我们不发布各显卡的实测数据;运行 ollama run 并加上 --verbose,即可查看您自己的测量结果。
24 GB 足够进行微调吗?+
对于最多140亿参数的模型,QLoRA支持良好:Unsloth显示14B模型至少需要8.5 GB。27B模型需要22 GB,处于临界状态。14B模型的16位LoRA(33 GB)以及70B模型的QLoRA(41 GB)在24 GB显存下无法运行。
可以同时使用两张 24 GB 显存的显卡吗?+
可以,使用llama.cpp即可,其默认模式会将模型层和KV缓存分配到多个GPU上。这样可获得48 GB显存,足以运行Q4量化的70B模型,但每个token的生成速度不会翻倍,因为两块显卡以流水线方式工作。请为两块显卡配备足够的供电和散热。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。