首页 › 目录 › 2026 年最适合 RTX 5090(32 GB)的 LLM

2026 年最适合 RTX 5090(32 GB)的 LLM

◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

排名更新于 2026年9月22日

RTX 5090(Blackwell,32 GB GDDR7,1792 GB/s)是首个显存超过 24 GB 的消费级 GPU。Llama 70B Q4_K_M 能装入显存,并为上下文留出 12 GB 的余量。2026 年本地运行的绝对标杆。

本地 AI 的优惠和替代方案

RTX 5090 :可选购的本地 AI 替代方案 — GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) :

迷你PC是一台完整机器:请检查所需内存和软件兼容性。它不能替代macOS/MLX或CUDA。

为什么选择它?查看我们对 GMKtec EVO-X2 64 GB / 1 TB(Ryzen AI Max+ 395)的完整介绍 →

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟推广链接 — QuelLLM 可能会从购买中获得佣金,你无需支付额外费用。这不会影响排名,排名由我们独立制定。作为 Amazon 合作伙伴,QuelLLM 会从符合条件的购买中获得收益。

排名

1

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B 参数 · MIT · 128 000 tokens ctx

GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。

排名原因 GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
在 RTX 5090 上
Q5_K_M
23 GB · 100 tok/s
2

🇺🇸 Laguna XS.2

Poolside · 33B 参数 · Apache 2.0 · 131 072 tokens ctx

MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。

排名原因 MoE 架构,总参数 33B、激活参数 3B,采用 Apache 2.0 许可,专精智能体编程。SWE-Bench Verified 得分 68.2%,128k 上下文。可在 36 GB 内存的 Mac 上运行。发布于 2026 年 4 月 28 日。
ollama run laguna-xs.2
在 RTX 5090 上
Q5_K_M
23 GB · 100 tok/s
3

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B 参数 · NVIDIA 开放模型许可证 · 128 000 tokens ctx

MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。

排名原因 MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
在 RTX 5090 上
Q8
32 GB · 80 tok/s
4

🇺🇸 Granite 4.0 H-Small 32B-A9B

IBM · 32B 参数 · Apache 2.0 · 128 000 tokens ctx

Mamba-2 混合架构 + MoE,总参数量 32B,激活参数量 9B。长上下文下 RAM 用量减少约 70%。Apache 2.0。

排名原因 Mamba-2 混合架构 + MoE,总参数量 32B,激活参数量 9B。长上下文下 RAM 用量减少约 70%。Apache 2.0。
ollama run granite4:small-h
在 RTX 5090 上
Q5_K_M
23 GB · 75 tok/s
5

🇨🇳 Qwen 3 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 131 072 tokens ctx

MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。

排名原因 MoE,总参数量 30B,激活参数量 3B,采用混合思考模式。MMLU 81.4,AIME24 80.4。支持 100+ 种语言。
ollama run qwen3:30b-a3b
在 RTX 5090 上
Q5_K_M
23 GB · 100 tok/s
6

🇺🇸 Nemotron 3 Nano 30B-A3B

NVIDIA · 30B 参数 · NVIDIA 开放模型许可证 · 128 000 tokens ctx

NVIDIA 的 MoE 模型:总参数量 30B,激活参数量 3.5B,用于聊天、编程和推理。128k 上下文,具备 3.5B 模型的速度和 30B 模型的能力。2026 年 4 月发布。

排名原因 NVIDIA 的 MoE 模型:总参数量 30B,激活参数量 3.5B,用于聊天、编程和推理。128k 上下文,具备 3.5B 模型的速度和 30B 模型的能力。2026 年 4 月发布。
ollama run nemotron-3-nano
在 RTX 5090 上
Q8
32 GB · 80 tok/s
7

🇨🇳 Qwen3-Coder 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 262 144 tokens ctx

MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。

排名原因 MoE 30B(3.3B 激活参数),专攻智能体编程。本地运行速度极快,原生 256k 上下文,是通过 Ollama 在 16–24 GB 内存下的标杆选择。
ollama run qwen3-coder:30b
在 RTX 5090 上
Q5_K_M
23 GB · 100 tok/s
8

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B 参数 · Apache 2.0 · 262 144 tokens ctx

视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。

排名原因 视觉 MoE,总参数量 30B,激活参数量 3B。Qwen 3 视觉模型中的最佳平衡点。256k 上下文。
ollama run qwen3-vl:30b
在 RTX 5090 上
Q5_K_M
23 GB · 100 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 RTX 5090 上
#1 GLM 4.7 Flash 31B 19 GB 128 000 MIT 100 tok/s · Q5_K_M
#2 Laguna XS.2 33B 19 GB 131 072 Apache 2.0 100 tok/s · Q5_K_M
#3 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA 开放模型许可证 80 tok/s · Q8
#4 Granite 4.0 H-Small 32B-A9B 32B 19 GB 128 000 Apache 2.0 75 tok/s · Q5_K_M
#5 Qwen 3 30B-A3B 30B 19 GB 131 072 Apache 2.0 100 tok/s · Q5_K_M
#6 Nemotron 3 Nano 30B-A3B 30B 17 GB 128 000 NVIDIA 开放模型许可证 80 tok/s · Q8
#7 Qwen3-Coder 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 tok/s · Q5_K_M
#8 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0 100 tok/s · Q5_K_M
本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选:量化为Q4_K_M且模型大小低于30 GB的模型(保留2 GB上下文)。额外推荐30-70B(峰值5090)和MoE 100B(32 GB可解封DBRX、Mixtral 8x22B)。1792 GB/s = 消费端吞吐量纪录。

考虑的标准:

  • Q4_K_M ≤ 30 GB
  • 利用1792 GB/s的带宽
  • 70B Q4/Q5 流畅运行
  • MoE 100B 可访问

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

RTX 5090 32 GB:Llama 70B 流畅吗?

是的——Llama 3.3 70B Q4_K_M(约 40 GB)无法完全装入单卡显存;Q3_K_M(约 30 GB)则可以,速度为每秒 35–45 个 token。Q5_K_M(约 48 GB)需要将部分模型卸载到 CPU。要毫不妥协地运行 70B Q4,应考虑 2 块 RTX 4090/5090,或配备至少 96 GB 内存的 Mac Studio。

RTX 5090 对比 2× RTX 4090 ?

5090 = 单卡 32 GB 显存 + 1792 GB/s。2×4090 = 48 GB 显存(分布在两张卡上)+ 每张卡 1008 GB/s。对于 70B Q4(约 40 GB)模型,2×4090 更有优势。对于 30–32B Q5 模型加长上下文,5090 更简单(没有跨卡拆分的额外开销)。参见 RTX 4090.

在5090上最优的量化级别是什么?

30B 模型可选 Q5_K_M(约 22 GB),70B 模型可选 Q4(约 40 GB,需部分卸载)。13–14B 模型可选 Q8,以获得最高质量(Qwen 3 14B 约 15 GB)。32B 模型采用 Q6_K 是很好的折中方案(约 25 GB)。

在RTX 5090上运行MoE模型?

优秀:Mixtral 8x22B Q4(约80 GB)无法容纳,但8x7B Q4(约28 GB)可达到80+ token/s。Qwen 3 30B-A3B Q8(约32 GB)运行也流畅。详见 智能体/混合专家模型排行榜.

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €