首页 › 目录 › 2026 年适合在 Radeon RX 7900 XTX (24 GB) 上运行的最佳 LLM

2026 年适合在 Radeon RX 7900 XTX (24 GB) 上运行的最佳 LLM

◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

排名更新于 09/10/2026

Radeon RX 7900 XTX(24 GB GDDR6,960 GB/s)是RTX 4090的AMD替代选择。24 GB显存加上相近的带宽,意味着相同的显存承载能力。兼容ROCm 6 + llama.cpp/Ollama。

本地 AI 的优惠和替代方案

Radeon RX 7900 XTX :可选购的本地 AI 替代方案 — Radeon RX 9070 XT 16 GB :

为什么这样选择?我们关于 Radeon RX 9070 XT 16 GB 的完整介绍 →

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟链接 — 哪个LLM 可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

排名

1

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B 参数 · Apache 2.0 · 128 000 tokens ctx

Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。

排名原因 Gemma 4 的 MoE 变体。总参数量 26B,激活参数量 4B。完整多模态(文本+图像+音频)。
ollama run gemma4:26b
在 Radeon RX 7900 XTX 上
Q5_K_M
19 GB · 22 tok/s
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B 参数 · Apache 2.0 · 8192 token 上下文

首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。

排名原因 首个采用 Apache 2.0 许可证的开源 dLLM:MoE 16B/1B + 6.2B 扩散解码器。文本与视觉统一。2026 年 4 月 22 日发布。
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
在 Radeon RX 7900 XTX 上
Q5_K_M
22 GB · 60 tok/s
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。

排名原因 27B 稠密多模态模型,2026 年 4 月 22 日发布。262k 上下文(1M YaRN)。SWE-bench Verified 77.2%。
ollama run qwen3.6:27b
在 Radeon RX 7900 XTX 上
Q5_K_M
19 GB · 13 tok/s
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B 参数 · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。

排名原因 Qwen 3.8 27B:稠密多模态模型(文本 + 视觉),262k 上下文,Q4 约需 16 GB 显存(Ollama 权重为 18 GB)。Apache 2.0,支持智能体式编程和视觉。
ollama run qwen3.8:27b
在 Radeon RX 7900 XTX 上
Q5_K_M
19 GB · 14 tok/s
5

🇨🇳 GLM 4.7 Flash

Zhipu AI · 31B 参数 · MIT · 128 000 tokens ctx

GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。

排名原因 GLM-4.7-Flash(MoE 31B,约 3B 激活参数):在 30B 级别中,编程能力与显存占用之比最佳。MIT 许可证,128k 上下文,在 3090/4090 上速度非常快。
ollama run glm-4.7-flash
在 Radeon RX 7900 XTX 上
Q5_K_M
23 GB · 40 tok/s
6

🇺🇸 Gemma 4 31B

Google · 31B 参数 · Apache 2.0 · 上下文:256,000 个 token

稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。

排名原因 稠密架构,31B 参数,支持多模态(文本+图像+音频)。支持 140+ 种语言,256k 上下文。Chatbot Arena 开源模型排名第 3。
ollama run gemma4:31b
在 Radeon RX 7900 XTX 上
Q5_K_M
22 GB · 12 tok/s
7

🇺🇸 Granite 4.1 30B Instruct

IBM · 30B 参数 · Apache 2.0 · 131 072 tokens ctx

300 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。支持兼容 OpenAI 的工具调用。发布于 2026 年 4 月 29 日。

排名原因 300 亿参数的稠密模型,采用 Apache 2.0 许可证,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。支持兼容 OpenAI 的工具调用。发布于 2026 年 4 月 29 日。
ollama run granite4.1:30b
在 Radeon RX 7900 XTX 上
Q5_K_M
21 GB · 12 tok/s
8

🇺🇸 Nemotron Cascade 2 30B-A3B

NVIDIA · 30B 参数 · NVIDIA 开放模型许可证 · 128 000 tokens ctx

MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。

排名原因 MoE,总参数量 30B,激活参数量 3B:思考模式 + 指令微调。荣获 IMO 2025 和 IOI 2025 金牌。得益于 3B 激活参数,推理速度快,具备 30B 级别的推理能力。2026 年 4 月发布。
ollama run nemotron-cascade-2
在 Radeon RX 7900 XTX 上
Q5_K_M
21 GB · 30 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在 Radeon RX 7900 XTX 上
#1 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0 22 tok/s · Q5_K_M
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0 60 tok/s · Q5_K_M
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0 13 tok/s · Q5_K_M
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0 14 tok/s · Q5_K_M
#5 GLM 4.7 Flash 31B 19 GB 128 000 MIT 40 tok/s · Q5_K_M
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0 12 tok/s · Q5_K_M
#7 Granite 4.1 30B Instruct 30B 17 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 Nemotron Cascade 2 30B-A3B 30B 17 GB 128 000 NVIDIA 开放模型许可证 30 tok/s · Q5_K_M
本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地编程副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选条件:Q4_K_M ≤ 22 GB。13–32B 模型有加分(峰值 24 GB)。960 GB/s GDDR6 + 成熟的 ROCm 6。

考虑的标准:

  • Q4_K_M ≤ 22 GB
  • 支持ROCm 6
  • Qwen 3 32B Q5 流畅
  • 24 GB,价格相当于 4070 Ti Super

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

RX 7900 XTX 与 RTX 4090 哪个更好?

同样为 24 GB。7900 XTX 的带宽为 960 GB/s,4090 为 1008 GB/s,两者几乎相同。但 CUDA 仍获得更好的支持(Ollama、vLLM、ExLlamaV2)。4090 在实际使用中约快 30–50%。参见 RTX 4090.

ROCm在2026年是否可靠?

是的,ROCm 6 稳定版 + Ollama 原生支持 AMD。llama.cpp + ROCm 运行良好。vLLM 在 AMD 上进展明显,但成熟度仍低于 CUDA。对于 Ollama/chat,运行效果良好。详见 guide.

2026 年 RX 7900 XTX 的价格是多少?

全新约 750–900 欧元,二手约 600–700 欧元。与全新 RTX 4090(约 1500 欧元)或二手 RTX 3090(约 650 欧元)相比,每 GB 显存的价格非常划算。

7900 XTX 能运行 Llama 70B 吗?

Q4(~40 GB)无法满足。Q3(~32 GB)无法满足。Q2(~24 GB)勉强可用但质量下降。对于70B模型流畅运行,建议使用2× 7900 XTX 或 Mac Studio。详见 Mac Studio.

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €