Radeon RX 7900 XTX(24 GB)上能运行哪些 LLM ?
RX 7900 XTX(24 GB GDDR6,据 AMD 称,带宽最高可达 960 GB/s)非常适合通过 Ollama 或 llama.cpp 在本地运行 LLM:凡是 Q4 量化后权重大小低于约 20 GB 的模型都能装得下,例如 27B 稠密模型或 30–35B MoE 模型。ROCm 7 支持这张显卡;超过 24 GB 时,模型中显存容纳不下的部分会转移到系统内存中。
7900 XTX 发布于 2022 年,但凭借 24 GB 显存,它至今仍是 AMD 阵营的一款标杆显卡。本指南介绍它能运行哪些模型、使用哪些软件、公开基准测试显示的运行速度,以及何时选择 RTX 或更新的显卡更合适。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: Radeon RX 9070 XT 16 GB.
为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RX 7900 XTX 用于大语言模型:24 GB 显存带来的变化
只要模型能装入其 24 GB VRAM,Radeon RX 7900 XTX 就能轻松运行本地 LLM:7B 至 9B 的 Q4 模型运行很轻松,27B 的 Q4 模型(权重约占 16 GB)还能为上下文留出空间,而总参数量为 300 亿至 350 亿、其中 30 亿参数活跃的 MoE 模型也仍能勉强装下。有两个条件:使用 Ollama、LM Studio 或 llama.cpp,这些工具都与其驱动兼容;并且显存占用保持在 24 GB 以下,因为超过这个容量后,部分模型会转移到系统 RAM,速度会骤降。这张显卡拥有 AMD RDNA 3 消费级产品系列中最大的显存容量。
制造商给出了对本地 AI 至关重要的参数:24 GB GDDR6 显存,以及最高可达 960 GB/s 的显存带宽。这里最有参考价值的指标是带宽,因为生成文本时,每生成一个 token 都需要读取模型的大部分权重:带宽越高,每秒生成 token 数量的上限就越高。
| 特性 | 数值 |
|---|---|
| 内存 | 24 GB GDDR6 |
| 带宽 | 最高可达960 GB/s |
| 流处理器 / 计算单元 | 6 144 / 96 |
| AI加速器 | 192 |
| 显卡典型功耗 | 355 W |
| 推荐的最低电源要求 | 800 W |
| 已列出的矩阵格式 | FP16(123 TFLOPs),INT8,INT4;不支持 FP8 |
#驱动程序和软件:2026 年兼容情况
对于 AMD 显卡,首先要考虑的是软件栈。在 AMD Radeon 文档的 ROCm 7.2.1 兼容性矩阵中,7900 XTX 被列为支持 Ubuntu 22.04、24.04 和 25.10 的显卡。Ollama 则表示,在 Linux 上需要 AMD ROCm v7 驱动,并将 7900 XTX 列入 Linux 和 Windows 的支持列表。这意味着在实际安装时:Linux 上需要通过 amdgpu-install 工具安装;Windows 上无需特殊操作即可识别该显卡。
如果 ROCm 给您带来问题,还有另一条路径。Ollama 说明,在 Windows 和 Linux 上,对更多 GPU 的支持通过 Vulkan 实现;安装了相应后端后,Vulkan 默认启用。Vulkan 也是 llama.cpp 的备用后端:使用 Vulkan 的 llama.cpp 指南介绍了编译方法。对于 vLLM,当前文档列出了搭配 ROCm 6.3 或更高版本使用的 Radeon RX 7900(gfx1100 和 gfx1101),并提供了适用于 ROCm 7.0 和 7.2.1、搭配 Python 3.12 的预构建软件包。
#在7900 XTX(Linux)上安装Ollama
- 01安装 ROCm 驱动程序遵循 AMD ROCm 文档说明,使用 amdgpu-install 工具(如 Ollama 所要求),然后将用户添加至 render 和 video 组,并重启系统。
- 02确认显卡是否被识别先运行 rocminfo,再运行 rocm-smi:应能看到 7900 XTX,显存容量为 24 GB。如果没有显示任何显卡,Ollama 就会改用 CPU。
- 03安装 Ollama使用官方脚本或 Linux 下的 Ollama 安装指南,然后下载一个能放入 24 GB 显存的模型。
- 04检查模型加载位置首次回答后,ollama ps 会显示模型中有多少比例位于 GPU 上。它应显示 100 % GPU;否则,模型或上下文就太大了。
#哪些模型能装入 24 GB 显存,运行速度如何
按内存容量档位分类的完整模型列表,可在《24 GB 显存适合运行哪些 LLM》指南中查看;这里列出的是针对这张显卡的要点。下列权重大小来自 QuelLLM 目录,采用 Q4 量化,不计入上下文。理论速度上限等于带宽除以生成每个 token 时读取的权重大小:这个上限无法超越,实际运行中也达不到。
| 模型 | Q4 权重 | 24 GB 显存的剩余空间 | 理论上限 |
|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 18 GB | 160 tokens/s |
| gpt-oss 20B (MoE) | 13 GB | 11 GB | 取决于当前激活的权重 |
| Devstral Small 2 24B | 14 GB | 10 GB | ≈ 68 tokens/s |
| Qwen 3.8 27B | 16 GB | 8 GB | 60 tokens/s |
| Granite 4.1 30B | 17 GB | 7 GB | ≈ 56 tokens/s |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | 取决于当前激活的权重 |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | 取决于当前激活的权重 |
这张表可以从两个方面来看。首先是剩余空间:在 24 GB 显存中,一个 21 GB 的模型只留下 3 GB 给 KV 缓存和系统,因此只能使用较短的上下文。Qwen 3.8 27B 留有 8 GB 的余量,使用长上下文时更宽裕。其次是 MoE:35B-A3B 模型在处理每个 token 时,只读取其 30 亿个活跃参数,因此生成速度比 270 亿参数的稠密模型快得多,但整个模型仍然必须装入显存。
#这张显卡的公开基准测试测量了什么
llama.cpp 社区的参考表在 ROCm 环境下,使用同一个模型(Llama 2 7B,Q4_0 量化)测量提示词读取速度(pp512)和生成速度(tg128)。在 7900 XTX 上,一名参与者在未启用 Flash Attention 时测得提示词处理速度为 3552 tokens/s,生成速度为 167 tokens/s;启用 Flash Attention 后,两项速度分别为 3874 和 170 tokens/s。该表作者提醒,结果会因驱动程序、系统和显卡制造商的不同而有所差异,即使使用的是相同芯片。
| 显卡 | AMD 带宽 | 提示词处理 pp512 | tg128 生成 |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
这张表说明了两点。生成速度随内存带宽变化:7900 XTX(960 GB/s)的生成速度约为 9070 XT(640 GB/s)的 1.65 倍、9060 XT(320 GB/s)的 2.5 倍。相比之下,提示词处理速度更依赖矩阵计算能力,而采用更新一代架构的 9070 XT 在这一点上领先于 7900 XTX。对于需要长篇回复的聊天用途,带宽和 24 GB 显存更重要;对于以大型文档作为输入的 RAG 用途,提示词处理速度则更重要。
#70B、30B MoE及双卡:能走多远
按照本站的参考值,一个 70B 稠密模型在 Q4 量化下的权重约为 40 GB,接近显存容量的两倍:需要将超过 16 GB 的权重放到系统内存中,此时速度会受限于 RAM 和 PCIe 总线,而不是显卡。由于缺乏可验证的来源,我们不提供这种情况下的吞吐量数据;只需记住,这种配置使用起来并不舒适。对于相同的整体质量,拥有 300 亿至 350 亿参数的 MoE 模型是应对这项 24 GB 限制的实用方案。
两块 7900 XTX 显卡会显著提升可容纳模型的容量。在 llama.cpp 中,默认的分配模式会将模型按层拆分到各张显卡上,以流水线方式运行,并提供一个选项来指定每张显卡的分配比例。这样就能合计获得 48 GB 显存,足以容纳 Q4 量化的 70B 模型,并留出少量上下文空间。收益体现在能容纳多大的模型,而不是每个 token 的生成速度:每个 token 都会依次经过两块显卡。在硬件方面,两块 355 W 显卡的功耗合计为 710 W,这还不包括电脑其他部件的功耗,因此需要功率配置合理的电源、两个合适的 PCIe 插槽,以及通风良好的机箱。
#上下文与KV缓存:24 GB显存的真正限制
模型权重只占所用内存的一部分:KV 缓存会随着上下文长度增加而增大。根据 Ollama 的文档,其默认上下文窗口为 4 096 个 token,可通过变量 OLLAMA_CONTEXT_LENGTH 修改;近期模型标称支持 128 000 至 262 000 个 token,但使用这些上下文长度需要额外内存。有两种优化手段:启用 Flash Attention,Ollama 会在后端和显卡支持的情况下自动使用它;以及通过 OLLAMA_KV_CACHE_TYPE 量化 KV 缓存(默认值为 f16,q8_0 可减少内存占用)。KV 缓存量化指南详细介绍了这些设置。
#7900 XTX、RTX 3090 或 4090:如何选择
从规格上看,RTX 3090 同样提供 24 GB 显存,据 NVIDIA 介绍,采用的是 GDDR6X。因此,选择取决于软件栈、运行环境和当时的价格;我们不在这里把价格写死:购买前,请先查看用于本地 AI 的显卡价格跟踪。
| 您的情况 | 推荐的显卡 | 为什么 |
|---|---|---|
| Linux,Ollama 或 llama.cpp,预算紧张 | RX 7900 XTX | 24 GB 显存,受 ROCm 7 和 Vulkan 支持 |
| Windows 系统,需要 CUDA 的工具(部分微调项目) | RTX 3090 或 4090 | CUDA 仍是大多数项目的默认目标 |
| 您想在生产环境中使用vLLM | 检查您的模型 | vLLM 将 7900 系列列为可通过 ROCm 使用的显卡;具体支持情况取决于版本 |
| 长上下文和大规模 MoE | 所有配备 24 GB 显存的显卡 | VRAM 的优先级高于品牌 |
| 需要超过24 GB的显存 | RTX 5090(32 GB)或双卡配置 | 任何配备 24 GB 显存的显卡都装不下 Q4 量化的 70B 模型 |
如果您在全新显卡和二手显卡之间犹豫,需注意7900 XTX发布于2022年12月:二手显卡的制造商保修通常已过期,且曾用于矿机或持续运行的显卡在购买前需检查温度状况。
- 24 GB VRAM 下适合的 LLM 模型完整列表
- Ollama 与 AMD GPU(ROCm)搭配:详细配置
- 在RX 7900 XT(20 GB)上运行LLM
- 在 RTX 3090(24 GB)上运行 LLM
- 量化 KV 缓存以节省 VRAM
- 本地 AI 显卡价格
#常见问题
RX 7900 XTX 是否适合本地运行 LLM?+
在 RX 7900 XTX 上应选择哪个模型?+
能否同时使用两块RX 7900 XTX显卡?+
RX 7900 XTX支持FP8吗?+
RX 7900 XTX 上使用 ROCm 还是 Vulkan?+
7900 XTX是否支持vLLM?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。