在 Radeon RX 7800 XT (16 GB) 上运行哪个 LLM ?
Radeon RX 7800 XT 是本地 AI 的高性价比选择,主要得益于其 16 GB 显存和 624 GB/s 的带宽:它能加载 Q4 量化的 200 亿至 240 亿参数模型,而 12 GB 显存的显卡做不到。一项针对 Llama 2 7B Q4_0 的公开测量显示,它在 Vulkan 下的生成速度为每秒 118 个 token。相比显卡总价,每 GB 显存的成本更重要,可在 /prix-gpu-ia 上进行比较。
判断一张显卡是否值得买,关键在于它能否容纳您想用的模型,而不是标价。RX 7800 XT 是 RDNA 3 这一代配备 16 GB 显存的显卡中,少数同时获得 ROCm 和 Ollama 官方支持的型号之一。本指南介绍它能运行哪些模型、根据已公布的测量结果能达到怎样的速度,以及如何评估一项购买报价,而不依赖每周都会变化的价格。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: Radeon RX 9070 XT 16 GB.
为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#为什么 RX 7800 XT 是运行本地大语言模型的划算之选
RX 7800 XT 在这一档次拥有三项罕见优势。其 16 GB GDDR6 显存搭配 256 位总线,提供 624 GB/s 的带宽,这是限制 LLM 生成速度的因素。AMD 在 ROCm 中正式列出了该型号(RDNA 3,目标 gfx1101),Ollama 也在 Linux 和 Windows 的支持列表中列出了它。最后,公开测试显示,在 Vulkan 下运行 Q4_0 量化的 7B 模型时,其生成速度为每秒 118.27 token,高于同一测试系列中的 RX 7900 GRE。其相对于 NVIDIA 的劣势不在于生成速度,而在于提示词处理速度:只有 RTX 4070 Ti Super 的三分之一。
- 架构
- 采用 RDNA 3 架构,Navi 32 使用小芯片(chiplet)设计:一个 GCD 和四个 MCD,于 2023 年 9 月 6 日推出。因此,它并非单片式设计。
- 计算
- 3840个流处理器,60个计算单元
- 内存
- 16 GB GDDR6,256位总线,624 GB/s。
- 功耗
- 263 瓦的显卡功耗。
- 价格
- 此处未指定:请参见 /prix-gpu-ia,该页面每周一和周四更新最低价格。
#评估价格尚未确定的报价
是否划算取决于价格,而显卡价格每周都可能变化。与其引用一个十天后就可能不准确的价格,不如按以下方法判断。计算每GB显存的成本:7800 XT的价格除以16,12 GB显卡的价格除以12。本站的价格追踪页面会公布每张显卡的这一数值。然后问自己唯一重要的问题:增加的显存容量能否让您运行真正想用的模型?从12 GB增加到16 GB,就能运行20B至24B模型;从16 GB增加到24 GB,就能运行30B及以上模型。
| 情况 | 待计算 | 结论 |
|---|---|---|
| 7800 XT 的报价 | 价格 ÷ 16 GB | 对比12GB和24GB显存GPU的每GB成本,参见 /prix-gpu-ia |
| 与 12 GB 显存显卡的价差 | 差额 ÷ 额外的 4 GB 容量 | 每 GB 成本低于平均水平时,16 GB 版本很划算 |
| 与 16 GB RTX 显卡的差距 | CUDA 对您有多大价值 | 只有在某个工具要求使用它,或提示词处理速度很重要时,才值得为它付费。 |
| 二手显卡 | 购买前建议先用12至14GB的模型进行测试 | 未经实际加载测试,不要接受 |
以下只是一个判断思路的示例,不提供具体价格:如果一张 12 GB 显卡与 7800 XT 的价差,相当于您为了使用 24B 模型本来就会支出的一笔费用,那么该如何选择就很明确了。反过来,如果您只使用 8–12B 模型,多出的这 4 GB 就派不上用场,RX 7700 XT 或 RX 6700 XT 已经足够。
#16GB VRAM能容纳什么
对于 16 GB 显存的显卡,如果显卡不负责屏幕显示,可按约 15 GB 的可用空间来安排模型及其 KV 缓存。下方 QuelLLM 目录列出的是 Q4 量化后的模型权重大小;上下文还会额外占用空间,因此对于大模型,可用余量很快就会成为限制因素。
| 模型 | 模型大小 | 上下文余量 | 结论 |
|---|---|---|---|
| Gemma 4 12B(Q8) | ≈ 13 GB | ≈ 2 GB | 可装入显存(短上下文) |
| Q4 量化的 gpt-oss 20B | ≈ 13 GB | ≈ 2 GB | 可装载,上下文长度为短至中等 |
| Devstral Small 2 24B (Q4) | ≈ 14 GB | ≈ 1 GB | 勉强容纳,上下文非常短 |
| Gemma 4 26B-A4B(Q4 量化) | ≈ 16 GB | 无 | 过于吃紧 |
| Granite 4.1 30B 量化为Q4 | ≈ 17 GB | 无 | 无法容纳 |
表格中的关键词是余量:一个 24B 的 Q4 量化模型可以装入,但上下文仅有数千个 token。对于涉及长文件的代码使用场景,量化 KV 缓存可释放一到两个 GB,而像 RX 7900 XT 这样的 20 GB 显卡能解决这一问题。该网站上关于 16 GB 显卡的表格独立于显卡品牌,详细列出了量化方面的权衡。
简单说说 gpt-oss 20B 这类混合专家模型(MoE):每生成一个 token,只有部分参数参与计算,因此生成速度更快,但所有权重仍须驻留在内存中。决定模型能否装入 16 GB 显存的是总规模,而非活跃参数的规模。这也解释了为什么上表中的 20B MoE 模型与 12B 稠密模型并列:两者的权重大小都约为 13 GB。
#测得的吞吐量:Vulkan 或 ROCm
以下数据并非本站的实测结果,而是来自 llama.cpp 仓库中的两篇公开讨论,一篇针对 Vulkan,另一篇针对 ROCm;两者都使用 llama-bench 测试 Q4_0 量化的 Llama 2 7B。两组测试使用的 llama.cpp 提交版本、系统和驱动各不相同,因此两组结果之间的差距仅供参考,不能据此作出最终排名。
| Backend | Flash Attention | 提示词处理(pp512) | tg128 生成 |
|---|---|---|---|
| Vulkan | 否 | 2 017,33 t/s | 118,27 t/s |
| Vulkan | 是 | 2 197,05 t/s | 124,86 t/s |
| ROCm | 否 | 2 151,81 t/s | 100,94 t/s |
| ROCm | 是 | 2 304,63 t/s | 95,99 t/s |
可以得出两点结论。首先,在这些测试系列中,Vulkan 在这张显卡上的生成速度比 ROCm 更快(不启用 Flash Attention 时,分别为每秒 118 和 101 个 token),而 ROCm 处理提示词的速度略快。其次,Flash Attention 会加速 Vulkan,却会略微降低 ROCm 的生成速度。如果您优先考虑对话中的响应速度,请用自己的模型分别试试这两个后端,而不要假定 ROCm 一定更快。
对照理论上限来看实际效率,有助于打消顾虑:624 GB/s 除以 3.82 GB 的模型权重,得到每秒 163 个 token;这张显卡在 Vulkan 下能达到这一理论上限的 72%。将这一比例用于更大的模型,可以估算大致的速度范围,但仍需在您自己的设备上验证。
| 模型 (Q4) | 模型大小 | 理论上限 | 大致量级 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 104 tokens/s | ≈ 75 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 89 tokens/s | ≈ 64 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 69 tokens/s | ≈ 50 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 45 tokens/s | ≈ 32 tokens/s |
#面对 16 GB 的 NVIDIA 显卡:提示词处理速度见分晓
与配备 16 GB 显存的 RTX 显卡比较时,需要看两项指标。在生成阶段,RX 7800 XT 的表现与使用 Vulkan 测得的 NVIDIA 显卡处于同一区间。在提示词处理阶段,差距非常大:其速度仅为 RTX 4070 Ti Super 的三分之一。第二项指标在处理长文档或较长的对话历史时影响很大,因为此时需要等待第一个词输出。对于短对话或上下文较短的代码助手,它的影响则很小。
| 显卡 | VRAM | 提示词处理(pp512) | tg128 生成 |
|---|---|---|---|
| RX 7800 XT | 16 GB | 2 017,33 t/s | 118,27 t/s |
| RTX 4070 Ti Super | 16 GB | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 16 GB | 6 213,63 t/s | 135,63 t/s |
#让 24B 模型装进 16 GB 显存:实用的优化手段
一个 24B 参数的 Q4 模型大约占用 14 GB,这仅剩下约 1 GB 供 KV 缓存和系统使用。有四个手段可以避免溢出到处理器,否则速度会大幅下降。第一是限制上下文窗口至实际所需,因为缓存会随每个 token 增长。第二是量化 KV 缓存,这可释放 1 至 2 GB。第三是关闭占用 VRAM 的应用程序,例如启用硬件加速的浏览器或游戏。第四是在存在集成显卡时,将显示器连接到处理器的集成显卡上,从而将显示所占用的内存归还给 AMD 显卡。
- 上下文
- 根据实际需要调整窗口大小:4000至8000个token对大多数对话已足够。
- KV缓存
- 将其量化为8位以节省VRAM,同时监控各项任务的质量表现。
- 显示
- 当存在集成显卡时,请使用其视频输出。
- 验证
- 加载完成后,ollama ps 应显示 100 % GPU,表示模型完全在 GPU 上运行;任何其他比例都表明部分模型已因显存不足而卸载到系统内存。
关于上下文窗口的指南解释了为何在显存较小的显卡上,较长的历史记录会消耗与模型本身相当的内存。
#快速入门
- 01选择系统在 Linux 系统中,AMD 仅在 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 和 RHEL 9.7 上支持 Radeon RX 7000。在 Windows 系统中,Ollama 依赖于 ROCm v7 或 HIP7 栈。
- 02安装 Ollama请参考 Ollama 的文档:Linux 系统下需安装 ROCm v7 驱动程序。Vulkan 会默认启用,作为备用方案。
- 03加载一个大小合适、能放得下的模型在尝试 24B 模型之前,先选择 Q8 量化的 12B 模型或 Q4 量化的 20B 模型。使用 ollama ps 检查模型是否完全在 GPU 上运行。
- 04比较Vulkan与ROCm针对您的模型,分别使用两个后端运行 llama-bench,并分别测试开启和关闭 Flash Attention 的情况,然后选择最适合您的使用场景、速度最快的后端。
#2026 结论
- 值得选择的条件
- 您打算运行 20–24B 模型,且 /prix-gpu-ia 上的每 GB 显存价格低于同类 12 GB 显存显卡的每 GB 显存价格。
- 不推荐的情况是
- 如果您只使用 8B 到 12B 的模型:一张 12 GB 显卡就足够了,您会为用不到的显存容量付费。
- 需避免
- 购买二手显卡时,未先测试加载一个 12 至 14 GB 的模型就直接购买。
#常见问题
RX 7800 XT:用来运行 LLM 划算吗?+
RX 7800 XT在2026年是否适合运行LLM?+
RX 7800 XT 上应选 Vulkan 还是 ROCm?+
运行本地 AI,该选 RX 7800 XT 还是 RX 7700 XT?+
哪些模型能装入 RX 7800 XT 的 16 GB 显存?+
Ollama 是否支持 RX 7800 XT?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。