首页 › 目录 › 2026 年适合 RTX 4090(24 GB)的最佳 LLM

2026 年适合 RTX 4090(24 GB)的最佳 LLM

◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

排名更新于 2026年9月22日

RTX 4090(24 GB 显存,Ada Lovelace 架构)是 2026 年消费级 LLM 推理的标杆。以下模型能充分发挥其性能:Q4/Q5 量化版本质量出色,可装入 24 GB 显存,吞吐量充裕(30+ token/秒)。

本地 AI 的优惠和替代方案

RTX 4090 :可选购的本地 AI 替代方案 — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

迷你PC是一台完整机器:请检查所需内存和软件兼容性。它不能替代macOS/MLX或CUDA。

为什么选择它?查看我们对 GMKtec EVO-X2 64 GB / 1 TB(Ryzen AI Max+ 395)的完整介绍 →

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。

排名

1

🇺🇸 Laguna XS.2

Poolside · 33B 参数 · Apache 2.0 · 131 072 tokens ctx

MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。

排名原因 采用 Q5_K_M 量化时可容纳(占用约 23 GB,可用容量为 24 GB)。330 亿参数,上下文长度为 131,072 个 token。
ollama run laguna-xs.2
在 RTX 4090 上
Q5_K_M
23 GB · 100 tok/s
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B 参数 · Apache 2.0 · 128 000 tokens ctx

Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。

排名原因 采用 Q5_K_M 量化后可装入显存(约占可用 24 GB 中的 19 GB)。260 亿参数,上下文窗口为 128 000 token。
ollama run gemma4:26b
在 RTX 4090 上
Q5_K_M
19GB · 60个token/秒
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B 参数 · Apache 2.0 · 8192 token 上下文

首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。

排名原因 采用 Q5_K_M 量化时可容纳(占用约 22 GB,可用容量为 24 GB)。160 亿参数,上下文长度为 8,192 个 token。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
在 RTX 4090 上
Q5_K_M
22 GB · 130 tok/s
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。

排名原因 采用 Q5_K_M 量化后可装入显存(约需 19 GB,可用显存为 24 GB)。270 亿参数,上下文长度为 262,144 个 token。
ollama run qwen3.6:27b
在 RTX 4090 上
Q5_K_M
19 GB · 32个token/秒
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。

排名原因 采用 Q5_K_M 量化后可装入显存(约需 19 GB,可用显存为 24 GB)。270 亿参数,上下文长度为 262,144 个 token。
ollama run qwen3.8:27b
在 RTX 4090 上
Q5_K_M
19 GB · 22 tok/s
6

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B 参数 · MIT · 128 000 tokens ctx

GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。

排名原因 Q5_K_M 量化下可装入显存(约占用 23 GB,可用容量为 24 GB)。参数量为 31B,上下文长度为 128 000 个 token。
ollama run glm-4.7-flash
在 RTX 4090 上
Q5_K_M
23 GB · 100 tok/s
7

🇺🇸 Gemma 4 31B

Google · 31B 参数 · Apache 2.0 · 上下文:256,000 个 token

稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。

排名原因 采用 Q5_K_M 量化后可装入显存(24 GB 可用显存中占用约 22 GB)。310 亿参数,上下文长度为 256,000 个 token。
ollama run gemma4:31b
在 RTX 4090 上
Q5_K_M
22 GB · 30 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 RTX 4090 上
#1 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 tok/s · Q5_K_M
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 60 tok/s · Q5_K_M
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 130 tok/s · Q5_K_M
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 32 tok/s · Q5_K_M
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 22 tok/s · Q5_K_M
#6 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 tok/s · Q5_K_M
#7 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 30 tok/s · Q5_K_M
本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

保留能够在 Q4_K_M 模式下容纳在 24 GB 内且至少使用 40% VRAM 的模型(否则 7B 模型即可满足)。VRAM 利用率在 60% 至 95% 之间的模型获得额外加分——这是质量与吞吐量的最佳平衡点。

考虑的标准:

  • 采用Q4_K_M量化后可装入24 GB显存
  • 充分利用 VRAM(>60%)
  • 吞吐量 ≥ 30 tokens/秒
  • 质量优于 7B 模型

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

能否在 RTX 4090 上运行 70B 模型?

采用 Q4_K_M 量化时,70B 模型需要约 40 GB 显存——单张 4090 放不下。您需要降低到 Q2/Q3(会损失质量),或将部分模型转移到由 CPU 使用的系统内存中运行(非常慢),或增加第二张显卡。要运行真正的 70B 模型,建议选择 2× RTX 4090,或一张 5090 搭配 DDR5 内存。

在 RTX 4090 上应选择何种量化级别?

Q5_K_M 是最佳平衡点(根据基准测试,相比 FP16 的损失不到 1%)。Q8 明显优于 Q5,但显存占用增加 50%。只有在想运行较大的模型、而 Q5 量化后无法装入显存时,才使用 Q4。

在 4090 上选 Mistral Small 3.1 24B 还是 Qwen 2.5 32B?

查看对比. Mistral Small 3.1 速度更快(24B < 32B),且在法语表现更优。Qwen 2.5 32B 在通用任务和代码任务上能力更强。

在RTX 4090上使用何种推理引擎?

用于交互式聊天: Ollama (简单) 或 llama.cpp (控制程度最高)。对于注重服务器吞吐量的场景: vLLM 或 ExLlamaV2。使用 vLLM 进行批处理时,性能可达到原来的 2–3 倍。

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €