进阶 11 分钟Radeon RX 7000

在 Radeon RX 7800 XT (16 GB) 上运行哪个 LLM ?

直接回答

Radeon RX 7800 XT 是本地 AI 的高性价比选择,主要得益于其 16 GB 显存和 624 GB/s 的带宽:它能加载 Q4 量化的 200 亿至 240 亿参数模型,而 12 GB 显存的显卡做不到。一项针对 Llama 2 7B Q4_0 的公开测量显示,它在 Vulkan 下的生成速度为每秒 118 个 token。相比显卡总价,每 GB 显存的成本更重要,可在 /prix-gpu-ia 上进行比较。

判断一张显卡是否值得买,关键在于它能否容纳您想用的模型,而不是标价。RX 7800 XT 是 RDNA 3 这一代配备 16 GB 显存的显卡中,少数同时获得 ROCm 和 Ollama 官方支持的型号之一。本指南介绍它能运行哪些模型、根据已公布的测量结果能达到怎样的速度,以及如何评估一项购买报价,而不依赖每周都会变化的价格。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: Radeon RX 9070 XT 16 GB.

为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#为什么 RX 7800 XT 是运行本地大语言模型的划算之选

RX 7800 XT 在这一档次拥有三项罕见优势。其 16 GB GDDR6 显存搭配 256 位总线,提供 624 GB/s 的带宽,这是限制 LLM 生成速度的因素。AMD 在 ROCm 中正式列出了该型号(RDNA 3,目标 gfx1101),Ollama 也在 Linux 和 Windows 的支持列表中列出了它。最后,公开测试显示,在 Vulkan 下运行 Q4_0 量化的 7B 模型时,其生成速度为每秒 118.27 token,高于同一测试系列中的 RX 7900 GRE。其相对于 NVIDIA 的劣势不在于生成速度,而在于提示词处理速度:只有 RTX 4070 Ti Super 的三分之一。

架构
采用 RDNA 3 架构,Navi 32 使用小芯片(chiplet)设计:一个 GCD 和四个 MCD,于 2023 年 9 月 6 日推出。因此,它并非单片式设计。
计算
3840个流处理器,60个计算单元
内存
16 GB GDDR6,256位总线,624 GB/s。
功耗
263 瓦的显卡功耗。
价格
此处未指定:请参见 /prix-gpu-ia,该页面每周一和周四更新最低价格。

#评估价格尚未确定的报价

是否划算取决于价格,而显卡价格每周都可能变化。与其引用一个十天后就可能不准确的价格,不如按以下方法判断。计算每GB显存的成本:7800 XT的价格除以16,12 GB显卡的价格除以12。本站的价格追踪页面会公布每张显卡的这一数值。然后问自己唯一重要的问题:增加的显存容量能否让您运行真正想用的模型?从12 GB增加到16 GB,就能运行20B至24B模型;从16 GB增加到24 GB,就能运行30B及以上模型。

评估报价的参考依据(计算示例,并非实际价格)
情况待计算结论
7800 XT 的报价价格 ÷ 16 GB对比12GB和24GB显存GPU的每GB成本,参见 /prix-gpu-ia
与 12 GB 显存显卡的价差差额 ÷ 额外的 4 GB 容量每 GB 成本低于平均水平时,16 GB 版本很划算
与 16 GB RTX 显卡的差距CUDA 对您有多大价值只有在某个工具要求使用它,或提示词处理速度很重要时,才值得为它付费。
二手显卡购买前建议先用12至14GB的模型进行测试未经实际加载测试,不要接受

以下只是一个判断思路的示例,不提供具体价格:如果一张 12 GB 显卡与 7800 XT 的价差,相当于您为了使用 24B 模型本来就会支出的一笔费用,那么该如何选择就很明确了。反过来,如果您只使用 8–12B 模型,多出的这 4 GB 就派不上用场,RX 7700 XT 或 RX 6700 XT 已经足够。

#16GB VRAM能容纳什么

对于 16 GB 显存的显卡,如果显卡不负责屏幕显示,可按约 15 GB 的可用空间来安排模型及其 KV 缓存。下方 QuelLLM 目录列出的是 Q4 量化后的模型权重大小;上下文还会额外占用空间,因此对于大模型,可用余量很快就会成为限制因素。

7800 XT 能容纳哪些模型(仅计权重)
模型模型大小上下文余量结论
Gemma 4 12B(Q8)≈ 13 GB≈ 2 GB可装入显存(短上下文)
Q4 量化的 gpt-oss 20B≈ 13 GB≈ 2 GB可装载,上下文长度为短至中等
Devstral Small 2 24B (Q4)≈ 14 GB≈ 1 GB勉强容纳,上下文非常短
Gemma 4 26B-A4B(Q4 量化)≈ 16 GB无过于吃紧
Granite 4.1 30B 量化为Q4≈ 17 GB无无法容纳

表格中的关键词是余量:一个 24B 的 Q4 量化模型可以装入,但上下文仅有数千个 token。对于涉及长文件的代码使用场景,量化 KV 缓存可释放一到两个 GB,而像 RX 7900 XT 这样的 20 GB 显卡能解决这一问题。该网站上关于 16 GB 显卡的表格独立于显卡品牌,详细列出了量化方面的权衡。

简单说说 gpt-oss 20B 这类混合专家模型(MoE):每生成一个 token,只有部分参数参与计算,因此生成速度更快,但所有权重仍须驻留在内存中。决定模型能否装入 16 GB 显存的是总规模,而非活跃参数的规模。这也解释了为什么上表中的 20B MoE 模型与 12B 稠密模型并列:两者的权重大小都约为 13 GB。

#测得的吞吐量:Vulkan 或 ROCm

以下数据并非本站的实测结果,而是来自 llama.cpp 仓库中的两篇公开讨论,一篇针对 Vulkan,另一篇针对 ROCm;两者都使用 llama-bench 测试 Q4_0 量化的 Llama 2 7B。两组测试使用的 llama.cpp 提交版本、系统和驱动各不相同,因此两组结果之间的差距仅供参考,不能据此作出最终排名。

RX 7800 XT 运行 Llama 2 7B Q4_0 的表现(llama.cpp 公开测量数据)
BackendFlash Attention提示词处理(pp512)tg128 生成
Vulkan否2 017,33 t/s118,27 t/s
Vulkan是2 197,05 t/s124,86 t/s
ROCm否2 151,81 t/s100,94 t/s
ROCm是2 304,63 t/s95,99 t/s

可以得出两点结论。首先,在这些测试系列中,Vulkan 在这张显卡上的生成速度比 ROCm 更快(不启用 Flash Attention 时,分别为每秒 118 和 101 个 token),而 ROCm 处理提示词的速度略快。其次,Flash Attention 会加速 Vulkan,却会略微降低 ROCm 的生成速度。如果您优先考虑对话中的响应速度,请用自己的模型分别试试这两个后端,而不要假定 ROCm 一定更快。

对照理论上限来看实际效率,有助于打消顾虑:624 GB/s 除以 3.82 GB 的模型权重,得到每秒 163 个 token;这张显卡在 Vulkan 下能达到这一理论上限的 72%。将这一比例用于更大的模型,可以估算大致的速度范围,但仍需在您自己的设备上验证。

估算值为624 GB/s上限的72%(计算值,非实测)
模型 (Q4)模型大小理论上限大致量级
Llama 3.1 8B≈ 6 GB≈ 104 tokens/s≈ 75 tokens/s
Gemma 4 12B≈ 7 GB≈ 89 tokens/s≈ 64 tokens/s
Phi-4 14B≈ 9 GB≈ 69 tokens/s≈ 50 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 45 tokens/s≈ 32 tokens/s

#面对 16 GB 的 NVIDIA 显卡:提示词处理速度见分晓

与配备 16 GB 显存的 RTX 显卡比较时,需要看两项指标。在生成阶段,RX 7800 XT 的表现与使用 Vulkan 测得的 NVIDIA 显卡处于同一区间。在提示词处理阶段,差距非常大:其速度仅为 RTX 4070 Ti Super 的三分之一。第二项指标在处理长文档或较长的对话历史时影响很大,因为此时需要等待第一个词输出。对于短对话或上下文较短的代码助手,它的影响则很小。

Vulkan 下的 RX 7800 XT 与 16 GB RTX 显卡(Llama 2 7B Q4_0,未使用 Flash Attention)
显卡VRAM提示词处理(pp512)tg128 生成
RX 7800 XT16 GB2 017,33 t/s118,27 t/s
RTX 4070 Ti Super16 GB6 099,18 t/s129,45 t/s
RTX 5070 Ti16 GB6 213,63 t/s135,63 t/s

#让 24B 模型装进 16 GB 显存:实用的优化手段

一个 24B 参数的 Q4 模型大约占用 14 GB,这仅剩下约 1 GB 供 KV 缓存和系统使用。有四个手段可以避免溢出到处理器,否则速度会大幅下降。第一是限制上下文窗口至实际所需,因为缓存会随每个 token 增长。第二是量化 KV 缓存,这可释放 1 至 2 GB。第三是关闭占用 VRAM 的应用程序,例如启用硬件加速的浏览器或游戏。第四是在存在集成显卡时,将显示器连接到处理器的集成显卡上,从而将显示所占用的内存归还给 AMD 显卡。

上下文
根据实际需要调整窗口大小:4000至8000个token对大多数对话已足够。
KV缓存
将其量化为8位以节省VRAM,同时监控各项任务的质量表现。
显示
当存在集成显卡时,请使用其视频输出。
验证
加载完成后,ollama ps 应显示 100 % GPU,表示模型完全在 GPU 上运行;任何其他比例都表明部分模型已因显存不足而卸载到系统内存。

关于上下文窗口的指南解释了为何在显存较小的显卡上,较长的历史记录会消耗与模型本身相当的内存。

#快速入门

  1. 01
    选择系统
    在 Linux 系统中,AMD 仅在 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 和 RHEL 9.7 上支持 Radeon RX 7000。在 Windows 系统中,Ollama 依赖于 ROCm v7 或 HIP7 栈。
  2. 02
    安装 Ollama
    请参考 Ollama 的文档:Linux 系统下需安装 ROCm v7 驱动程序。Vulkan 会默认启用,作为备用方案。
  3. 03
    加载一个大小合适、能放得下的模型
    在尝试 24B 模型之前,先选择 Q8 量化的 12B 模型或 Q4 量化的 20B 模型。使用 ollama ps 检查模型是否完全在 GPU 上运行。
  4. 04
    比较Vulkan与ROCm
    针对您的模型,分别使用两个后端运行 llama-bench,并分别测试开启和关闭 Flash Attention 的情况,然后选择最适合您的使用场景、速度最快的后端。
终端
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#2026 结论

值得选择的条件
您打算运行 20–24B 模型,且 /prix-gpu-ia 上的每 GB 显存价格低于同类 12 GB 显存显卡的每 GB 显存价格。
不推荐的情况是
如果您只使用 8B 到 12B 的模型:一张 12 GB 显卡就足够了,您会为用不到的显存容量付费。
需避免
购买二手显卡时,未先测试加载一个 12 至 14 GB 的模型就直接购买。

#常见问题

FAQ
RX 7800 XT:用来运行 LLM 划算吗?+
如果您想运行参数量为 200 亿至 240 亿的模型,那么是的:它的 16 GB 显存能容纳这些模型的 Q4 量化版本,而 12 GB 显存的显卡则无法容纳。请根据网站价格页面公布的每 GB 显存成本来评估这款显卡是否划算,而不只是看标价。
RX 7800 XT在2026年是否适合运行LLM?+
根据一项公开测量,它在 Vulkan 下运行 Q4_0 量化的 7B 模型时,每秒生成 118 个 token,其 16 GB 显存可加载 Q4 量化的 24B 模型。相较于 NVIDIA,它的短板是提示词处理:在这些测量中,速度约为 RTX 4070 Ti Super 的三分之一。
RX 7800 XT 上应选 Vulkan 还是 ROCm?+
在 llama.cpp 仓库的两篇公开讨论中,Vulkan 的生成速度更快(未启用 Flash Attention 时为 118 token/秒,对比 101 token/秒),而 ROCm 处理提示词的速度略快。两者的配置不同,因此请用您的模型分别测试,并选择更快的那个。
运行本地 AI,该选 RX 7800 XT 还是 RX 7700 XT?+
7800 XT 多出 4 GB 显存,因此可以运行 20B 至 24B 的模型,带宽为 624 GB/s,而另一款为 432 GB/s。如果只使用 8B 至 14B 的模型,7700 XT 就足够了;否则,多花这笔钱通常是值得的。
哪些模型能装入 RX 7800 XT 的 16 GB 显存?+
在上下文较短的情况下,Q8 版本的 Gemma 4 12B 和 Q4 版本的 gpt-oss 20B 各占约 13 GB,Q4 版本的 Devstral Small 2 24B 占约 14 GB。参数规模为 26B 至 30B 的模型,即使采用 Q4,权重也超过 16 GB,无法全部装入显存。
Ollama 是否支持 RX 7800 XT?+
是的,根据 Ollama 的文档,Linux 和 Windows 均支持这张显卡;Linux 下需使用 ROCm v7 驱动。AMD 也在 ROCm 支持列表中列出了它,目标架构为 gfx1101,但仅限 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 或 RHEL 9.7。Ollama 默认启用 Vulkan,作为备用方案。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。