2026 年在 24 GB VRAM 上表现最佳的 LLM
找到 适用于 24 GB 显存的最佳 LLM 主要取决于上下文长度、许可证和目标用途之间的平衡。这种配置常见于 RTX 3090 或 RTX 4090,可运行采用 Q4 量化的 300 至 400 亿参数模型,与配备 12 或 16 GB 显存的 GPU 相比,本地可用的推理能力因此发生根本性变化。本文将介绍真正能装入这一显存容量范围的模型、其许可证,以及选择前需要了解的取舍。
哪些模型在Q4量化下能放入24 GB显存
在 24 GB VRAM 的情况下,模型权重的可用空间在扣除 KV 缓存后介于 17 到 22 GB 之间。多个模型刚好位于或接近这一阈值:
- Seed-OSS 36B Instruct :Q4 下约 22 GB,采用 Apache 2.0 许可证,上下文长度高达 524,288 token。
- Qwen 3.6 35B-A3B :Q4 下约需 21 GB,采用 MoE 架构,活跃参数量为 3B,上下文长度为 262 000 个 token。
- Salamandra 40B Instruct :Q4 下约需 24 GB 显存,接近显存容量上限,采用 Apache 2.0 许可证。
- Command R 35B v01 et Aya 23 35B : 每个模型在 Q4 量化下约 20 GB,采用 CC-BY-NC 4.0 许可(非商业用途)
- Yi 1.5 34B Chat :Q4 量化下约需 20 GB,上下文长度限制为 4,096 个 token。
Le Mixtral 8x7B 来自 Mistral AI,总参数量达 47B(MoE 架构),在 Q4 量化下约需 26 GB,略高于 24 GB,通常需要更激进的量化(如 Q3)或部分卸载至 CPU 以适应单张显卡。各发行商的详细规格仍可查阅 Hugging Face 上的 Mistral AI et Hugging Face 上的 BSC (对应 Salamandra)。
RTX 3090 对比 RTX 4090:预期实际吞吐量
两块显卡均配备 24 GB GDDR6X 显存,但 RTX 4090 的显存带宽和计算能力更高。运行 Q4 量化的 32–35B 级别模型时:
- RTX 3090 : 根据模型和所用推理引擎,预计吞吐量在 12 到 20 个 token/秒之间
- RTX 4090 : 在相同条件下,预计吞吐量为18至30 tokens/秒
这些数值会因引擎不同而有显著差异—— llama.cpp(官方 GitHub) et Ollama(官方 GitHub) 仍是运行量化 GGUF 模型最简单的选择,而 vLLM (文档) 则更侧重于同时处理多个请求的高吞吐量推理服务。对于 MoE 模型,例如 Qwen 3 30B-A3B 或 Nemotron Nano 3 30B-A3B,吞吐量通常高于同等规模的稠密模型,因为每处理一个 token 都只激活一部分参数。
许可:Apache 2.0、CC-BY-NC 及专有许可
许可证的选择决定了商业使用的范围:
- Apache 2.0 (可自由用于商业用途):Mixtral 8x7B、Salamandra 40B、Seed-OSS 36B、Qwen 3.6 35B-A3B、Qwen 2.5/3 系列中几乎所有模型、Gemma 4 31B、OLMo 3 32B、Granite 4.0 H-Small。
- CC-BY-NC 4.0 (非商业用途):Command R 35B v01、Aya 23 35B、 Aya Expanse 32B, 由Cohere发布——详见 Hugging Face 上的 Cohere.
- MIT : DeepSeek R1 Distill 32B et DeepSeek R2 32B, 同时也极为宽松。
- 特定的专有许可证 : EXAONE 4.5 33B (EXAONE AI Model License,使用受限) 和 Nemotron 3 33B (NVIDIA Open Model License)。
对于计划投入商业生产环境的项目,优先选择 Apache 2.0 或 MIT 许可,可以避免非商业条款带来的法律灰色地带。
应用场景:推理、编程和通用能力
在 24 GB VRAM 下可划分为三种使用场景:
- 长链推理 : QwQ 32B 且 DeepSeek R1 Distill 32B 针对复杂的逻辑链式任务,在公开基准测试中,其在 AIME 和 MMLU 上的得分通常报告为 Open LLM排行榜(Hugging Face).
- 代码 : Qwen 2.5 Coder 32B 在这一规模的模型中,其 HumanEval 表现仍具有标杆意义; Qwen3-Coder 30B-A3B 提供扩展至 262,144 个 token 的上下文窗口,用于分析大型代码仓库。
- 多语言与通用用途 :Aya 23 35B 和 Aya Expanse 32B 明确以多语言覆盖为目标,而 Jais 30B Chat v3 专注于阿拉伯语。
若要直接比较这一档位中两个常见的候选模型,对比页面 Aya Expanse 32B 对比 Qwen 2.5 32B et DeepSeek R1 32B 对比 QwQ 32B 详细对比了各项基准测试的性能差异。
通过KV缓存优化可用上下文
一个32-35B模型在Q4量化下仅权重部分就已占用17至22 GB的VRAM。KV缓存的剩余空间限制了实际可使用的上下文长度,即使技术规格宣称支持最多128,000或262,000个token。要了解缓存量化(Q8、Q4)如何在不更换模型的情况下节省数GB,请参阅 量化与 KV 缓存指南 以及 量化方案Q4/Q5/Q8选择指南.
FAQ
Q:在24GB显存下,为商业用途应优先选择哪个Apache 2.0模型?
Seed-OSS 36B、Qwen 3.6 35B-A3B 和 Qwen 2.5 32B Coder 是三种采用 Apache 2.0 许可证的选择,Q4 量化后都能装入24 GB显存。具体选择取决于需求:需要长上下文可选 Seed-OSS,需要处理代码可选 Qwen 2.5 Coder,需要 MoE 架构的通用能力可选 Qwen 3.6。
Q:Mixtral 8x7B 真的能在 24 GB 内运行吗?
其在 Q4 量化下的估计大小约为 ~26 GB,略超 24 GB 的限制。采用更低的量化级别(如 Q3)或缩小上下文长度通常可以使其符合要求,但会带来质量损失,需个案验证。
Q:这些模型应使用RTX 3090还是RTX 4090?
两者均提供 24 GB VRAM,因此模型加载能力相同。RTX 4090 由于更高的内存带宽,提供更高的每秒 token 处理速度(估算值),适用于批量处理或长上下文场景。
Q:Command R 35B 和 Aya 23 35B 能否在企业中使用?
其CC-BY-NC 4.0许可条款限制了未经Cohere单独授权的商业使用。对于企业部署,建议选用同等规模的Apache 2.0或MIT许可模型。
问:用什么工具在本地运行这些模型?
llama.cpp(官方 GitHub) et Ollama(官方 GitHub) 支持在单张显卡上对 GGUF 量化模型进行推理。若要使用自托管的网页界面, Open WebUI(官方GitHub) 可叠加在其中任一工具之上。
Q:是否应选择 32 GB,而不是 24 GB?
升级至 32 GB 可支持更长的上下文,并为 35–40B 模型提供更多余量,无需在量化方面作出妥协。 32 GB显存指南 详细介绍在这一显存容量档位下还可运行的其他模型。
结论
Le 适用于 24 GB 显存的最佳 LLM 并非只有一个:选择取决于您希望采用的许可证(Seed-OSS 36B 或 Qwen 3.6 35B-A3B 的 Apache 2.0,Command R 和 Aya 的 CC-BY-NC)、使用场景(编程、推理、多语言),以及计入 KV 缓存后实际需要的上下文长度。 配置工具 可自动综合考虑这些标准,而 完整目录 详细列出249个模型及其按量化方式划分的VRAM规格
本地运行 LLM 所需的硬件
要在本地流畅运行这些模型,一张 RTX 5090 提供出色的性价比。比较价格:
联盟推广链接——QuelLLM 可能会从购买中获得佣金,您无需支付额外费用。作为亚马逊联盟合作伙伴,QuelLLM 会从符合条件的购买中获得收益。