进阶 11 分钟Radeon RX 7000

Radeon RX 7900 XTX(24 GB)上能运行哪些 LLM ?

直接回答

RX 7900 XTX(24 GB GDDR6,据 AMD 称,带宽最高可达 960 GB/s)非常适合通过 Ollama 或 llama.cpp 在本地运行 LLM:凡是 Q4 量化后权重大小低于约 20 GB 的模型都能装得下,例如 27B 稠密模型或 30–35B MoE 模型。ROCm 7 支持这张显卡;超过 24 GB 时,模型中显存容纳不下的部分会转移到系统内存中。

7900 XTX 发布于 2022 年,但凭借 24 GB 显存,它至今仍是 AMD 阵营的一款标杆显卡。本指南介绍它能运行哪些模型、使用哪些软件、公开基准测试显示的运行速度,以及何时选择 RTX 或更新的显卡更合适。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: Radeon RX 9070 XT 16 GB.

为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RX 7900 XTX 用于大语言模型:24 GB 显存带来的变化

只要模型能装入其 24 GB VRAM,Radeon RX 7900 XTX 就能轻松运行本地 LLM:7B 至 9B 的 Q4 模型运行很轻松,27B 的 Q4 模型(权重约占 16 GB)还能为上下文留出空间,而总参数量为 300 亿至 350 亿、其中 30 亿参数活跃的 MoE 模型也仍能勉强装下。有两个条件:使用 Ollama、LM Studio 或 llama.cpp,这些工具都与其驱动兼容;并且显存占用保持在 24 GB 以下,因为超过这个容量后,部分模型会转移到系统 RAM,速度会骤降。这张显卡拥有 AMD RDNA 3 消费级产品系列中最大的显存容量。

制造商给出了对本地 AI 至关重要的参数:24 GB GDDR6 显存,以及最高可达 960 GB/s 的显存带宽。这里最有参考价值的指标是带宽,因为生成文本时,每生成一个 token 都需要读取模型的大部分权重:带宽越高,每秒生成 token 数量的上限就越高。

RX 7900 XTX 技术规格(来源:AMD)
特性数值
内存24 GB GDDR6
带宽最高可达960 GB/s
流处理器 / 计算单元6 144 / 96
AI加速器192
显卡典型功耗355 W
推荐的最低电源要求800 W
已列出的矩阵格式FP16(123 TFLOPs),INT8,INT4;不支持 FP8
i
电源:800 W,非850 W
AMD 为这张显卡推荐的最低电源额定功率是 800 W。部分合作显卡厂商建议使用功率更高的电源:请遵循您所购买的具体型号的规格说明;如果处理器功耗较高,还应预留余量。

#驱动程序和软件:2026 年兼容情况

对于 AMD 显卡,首先要考虑的是软件栈。在 AMD Radeon 文档的 ROCm 7.2.1 兼容性矩阵中,7900 XTX 被列为支持 Ubuntu 22.04、24.04 和 25.10 的显卡。Ollama 则表示,在 Linux 上需要 AMD ROCm v7 驱动,并将 7900 XTX 列入 Linux 和 Windows 的支持列表。这意味着在实际安装时:Linux 上需要通过 amdgpu-install 工具安装;Windows 上无需特殊操作即可识别该显卡。

如果 ROCm 给您带来问题,还有另一条路径。Ollama 说明,在 Windows 和 Linux 上,对更多 GPU 的支持通过 Vulkan 实现;安装了相应后端后,Vulkan 默认启用。Vulkan 也是 llama.cpp 的备用后端:使用 Vulkan 的 llama.cpp 指南介绍了编译方法。对于 vLLM,当前文档列出了搭配 ROCm 6.3 或更高版本使用的 Radeon RX 7900(gfx1100 和 gfx1101),并提供了适用于 ROCm 7.0 和 7.2.1、搭配 Python 3.12 的预构建软件包。

#在7900 XTX(Linux)上安装Ollama

  1. 01
    安装 ROCm 驱动程序
    遵循 AMD ROCm 文档说明,使用 amdgpu-install 工具(如 Ollama 所要求),然后将用户添加至 render 和 video 组,并重启系统。
  2. 02
    确认显卡是否被识别
    先运行 rocminfo,再运行 rocm-smi:应能看到 7900 XTX,显存容量为 24 GB。如果没有显示任何显卡,Ollama 就会改用 CPU。
  3. 03
    安装 Ollama
    使用官方脚本或 Linux 下的 Ollama 安装指南,然后下载一个能放入 24 GB 显存的模型。
  4. 04
    检查模型加载位置
    首次回答后,ollama ps 会显示模型中有多少比例位于 GPU 上。它应显示 100 % GPU;否则,模型或上下文就太大了。
验证
rocminfo | head -30
rocm-smi
ollama run gpt-oss:20b
ollama ps

#哪些模型能装入 24 GB 显存,运行速度如何

按内存容量档位分类的完整模型列表,可在《24 GB 显存适合运行哪些 LLM》指南中查看;这里列出的是针对这张显卡的要点。下列权重大小来自 QuelLLM 目录,采用 Q4 量化,不计入上下文。理论速度上限等于带宽除以生成每个 token 时读取的权重大小:这个上限无法超越,实际运行中也达不到。

Q4 权重大小(QuelLLM 目录)及基于 960 GB/s 带宽计算的理论上限
模型Q4 权重24 GB 显存的剩余空间理论上限
Qwen 3.5 9B6 GB18 GB160 tokens/s
gpt-oss 20B (MoE)13 GB11 GB取决于当前激活的权重
Devstral Small 2 24B14 GB10 GB≈ 68 tokens/s
Qwen 3.8 27B16 GB8 GB60 tokens/s
Granite 4.1 30B17 GB7 GB≈ 56 tokens/s
Qwen3-Coder 30B-A3B (MoE)19 GB5 GB取决于当前激活的权重
Qwen 3.6 35B-A3B (MoE)21 GB3 GB取决于当前激活的权重

这张表可以从两个方面来看。首先是剩余空间:在 24 GB 显存中,一个 21 GB 的模型只留下 3 GB 给 KV 缓存和系统,因此只能使用较短的上下文。Qwen 3.8 27B 留有 8 GB 的余量,使用长上下文时更宽裕。其次是 MoE:35B-A3B 模型在处理每个 token 时,只读取其 30 亿个活跃参数,因此生成速度比 270 亿参数的稠密模型快得多,但整个模型仍然必须装入显存。

!
不编造 tokens/s 数据
网上公布的吞吐量取决于模型、量化方式、上下文和软件版本。我们引用的唯一可供比较的公开参考,是下方 llama.cpp 社区针对一个小模型给出的表格。对于您自己的模型,请使用 llama-bench 或 Ollama 返回的统计信息进行测量。

#这张显卡的公开基准测试测量了什么

llama.cpp 社区的参考表在 ROCm 环境下,使用同一个模型(Llama 2 7B,Q4_0 量化)测量提示词读取速度(pp512)和生成速度(tg128)。在 7900 XTX 上,一名参与者在未启用 Flash Attention 时测得提示词处理速度为 3552 tokens/s,生成速度为 167 tokens/s;启用 Flash Attention 后,两项速度分别为 3874 和 170 tokens/s。该表作者提醒,结果会因驱动程序、系统和显卡制造商的不同而有所差异,即使使用的是相同芯片。

Llama 2 7B Q4_0,llama.cpp ROCm(社区表格,未使用 Flash Attention)
显卡AMD 带宽提示词处理 pp512tg128 生成
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

这张表说明了两点。生成速度随内存带宽变化:7900 XTX(960 GB/s)的生成速度约为 9070 XT(640 GB/s)的 1.65 倍、9060 XT(320 GB/s)的 2.5 倍。相比之下,提示词处理速度更依赖矩阵计算能力,而采用更新一代架构的 9070 XT 在这一点上领先于 7900 XTX。对于需要长篇回复的聊天用途,带宽和 24 GB 显存更重要;对于以大型文档作为输入的 RAG 用途,提示词处理速度则更重要。

i
小模型,与现实存在巨大偏差
Q4_0 量化的 7B 模型所占空间远小于上一节中那些大小为 24 GB 的模型。不要根据这些数字推断 27B 模型的速度:在相同带宽下,其速度会降至前者的几分之一。

#70B、30B MoE及双卡:能走多远

按照本站的参考值,一个 70B 稠密模型在 Q4 量化下的权重约为 40 GB,接近显存容量的两倍:需要将超过 16 GB 的权重放到系统内存中,此时速度会受限于 RAM 和 PCIe 总线,而不是显卡。由于缺乏可验证的来源,我们不提供这种情况下的吞吐量数据;只需记住,这种配置使用起来并不舒适。对于相同的整体质量,拥有 300 亿至 350 亿参数的 MoE 模型是应对这项 24 GB 限制的实用方案。

两块 7900 XTX 显卡会显著提升可容纳模型的容量。在 llama.cpp 中,默认的分配模式会将模型按层拆分到各张显卡上,以流水线方式运行,并提供一个选项来指定每张显卡的分配比例。这样就能合计获得 48 GB 显存,足以容纳 Q4 量化的 70B 模型,并留出少量上下文空间。收益体现在能容纳多大的模型,而不是每个 token 的生成速度:每个 token 都会依次经过两块显卡。在硬件方面,两块 355 W 显卡的功耗合计为 710 W,这还不包括电脑其他部件的功耗,因此需要功率配置合理的电源、两个合适的 PCIe 插槽,以及通风良好的机箱。

#上下文与KV缓存:24 GB显存的真正限制

模型权重只占所用内存的一部分:KV 缓存会随着上下文长度增加而增大。根据 Ollama 的文档,其默认上下文窗口为 4 096 个 token,可通过变量 OLLAMA_CONTEXT_LENGTH 修改;近期模型标称支持 128 000 至 262 000 个 token,但使用这些上下文长度需要额外内存。有两种优化手段:启用 Flash Attention,Ollama 会在后端和显卡支持的情况下自动使用它;以及通过 OLLAMA_KV_CACHE_TYPE 量化 KV 缓存(默认值为 f16,q8_0 可减少内存占用)。KV 缓存量化指南详细介绍了这些设置。

上下文和 KV 缓存缩减
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#7900 XTX、RTX 3090 或 4090:如何选择

从规格上看,RTX 3090 同样提供 24 GB 显存,据 NVIDIA 介绍,采用的是 GDDR6X。因此,选择取决于软件栈、运行环境和当时的价格;我们不在这里把价格写死:购买前,请先查看用于本地 AI 的显卡价格跟踪。

24 GB 的决策标准
您的情况推荐的显卡为什么
Linux,Ollama 或 llama.cpp,预算紧张RX 7900 XTX24 GB 显存,受 ROCm 7 和 Vulkan 支持
Windows 系统,需要 CUDA 的工具(部分微调项目)RTX 3090 或 4090CUDA 仍是大多数项目的默认目标
您想在生产环境中使用vLLM检查您的模型vLLM 将 7900 系列列为可通过 ROCm 使用的显卡;具体支持情况取决于版本
长上下文和大规模 MoE所有配备 24 GB 显存的显卡VRAM 的优先级高于品牌
需要超过24 GB的显存RTX 5090(32 GB)或双卡配置任何配备 24 GB 显存的显卡都装不下 Q4 量化的 70B 模型

如果您在全新显卡和二手显卡之间犹豫,需注意7900 XTX发布于2022年12月:二手显卡的制造商保修通常已过期,且曾用于矿机或持续运行的显卡在购买前需检查温度状况。

→
20GB和16GB的替代方案
如果预算超过24 GB,可参考RX 7900 XT(20 GB)和RX 9070 XT(16 GB)的相应指南。RX 9070 XT更新更晚,AMD已列出FP8支持,但显存少8 GB。

#常见问题

常见问题
RX 7900 XTX 是否适合本地运行 LLM?+
是的,主要得益于其 24 GB 显存,以及 AMD 所述的 960 GB/s 带宽。它可以运行 Q4 量化下最高约 270 亿参数的模型,以及 300 至 350 亿参数的 MoE 模型,而无需将超出显存容量的部分卸载到系统内存。它兼容 Ollama、llama.cpp 和 LM Studio,可通过 ROCm 7 或 Vulkan 运行。
在 RX 7900 XTX 上应选择哪个模型?+
对于通用用途,像 Qwen 3.8 27B 这样的 270 亿参数稠密模型,采用 Q4 量化后权重约占 16 GB,可留出 8 GB 用于上下文。若追求速度,可选择 gpt-oss 20B 或 Qwen 3.6 35B-A3B 这样的 MoE 模型。若用于编程,可选择 Devstral Small 2 24B 或 Qwen3-Coder 30B-A3B。请始终使用 ollama ps 确认模型全部加载在 GPU 上。
能否同时使用两块RX 7900 XTX显卡?+
可以,使用 llama.cpp 即可,其默认模式会将模型层和 KV 缓存分配到多张显卡上。这样可获得 48 GB 显存,足以容纳 Q4 量化的 70B 模型,但每个 token 的处理速度不会提高,因为显卡以流水线方式工作。两张显卡需预留超过 710 W 的功率,因此电源的额定功率应明显高于 1,000 W。
RX 7900 XTX支持FP8吗?+
根据 AMD 的规格表,不支持:该显卡列出的矩阵计算格式包括 FP16、INT8 和 INT4,没有 FP8。RDNA 4 一代的 Radeon RX 9000 则列出了 FP8。对于大多数使用 Q4 或 Q5 量化 GGUF 模型的场景,这一点没有直接影响。
RX 7900 XTX 上使用 ROCm 还是 Vulkan?+
先使用 ROCm,这是 Ollama 在 Linux 下配合 ROCm v7 驱动的官方运行方式。如果安装遇到问题,Ollama 默认启用的 Vulkan 可以让您无需 ROCm 即可开始运行,不过性能通常会因驱动而异。在做决定前,请用 llama-bench 在您自己的模型上比较两者。
7900 XTX是否支持vLLM?+
是,根据vLLM文档显示,支持Radeon RX 7900(gfx1100和gfx1101)显卡,需搭配ROCm 6.3或更高版本,并提供ROCm 7.0和7.2.1的预构建包。但安装过程比Ollama更复杂,尤其适用于同时服务多个用户的情况。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。