Radeon RX 9070(16 GB)适合运行哪个LLM ?
Radeon RX 9070(RDNA 4,16 GB GDDR6,640 GB/s,220 W)可以运行 20B 至 24B 参数的 Q4 量化模型,根据公开测量,在 Vulkan 下运行 Llama 2 7B 的 Q4_0 量化版本时,生成速度约为每秒 120 个 token。在 Linux 下,Ollama 通过 ROCm v7 支持该显卡;在 Windows 下,它不在 Ollama 的 ROCm 支持列表中,因此通过 Vulkan 运行,而 Vulkan 已经取得了不错的成绩。
RX 9070 是 AMD 在这一价位最新的 16GB 显卡,功耗明显低于 RX 7000 系列的前代产品。本指南介绍它能运行哪些模型、公开测试数据能告诉我们哪些速度信息、Linux 与 Windows 下有哪些差异,以及它与 RX 9070 XT 和 16GB RTX 显卡相比处于什么水平。
您正在挑选电脑吗? 按预算推荐 →
针对此配置: Radeon RX 9070 XT 16GB (ASUS Prime OC).
为什么选择它?我们的完整资料: Radeon RX 9070 XT 16GB (ASUS Prime OC) →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。
#2026年RX 9070的运行表现
RX 9070 可轻松加载 80 亿到 140 亿参数的 Q4 模型,也能加载 200 亿到 240 亿参数的模型,但较大的模型需要使用较短的上下文。它配备 16 GB GDDR6 显存,数据传输速率为 20.1 Gb/s,采用 256 位总线,显存带宽为 640 GB/s,纠正了本页旧版本中的 644 GB/s。在 Llama 2 7B Q4_0 模型上,llama.cpp 仓库的公开讨论给出的生成速度为 Vulkan 下 119.71 tokens/秒、ROCm 下 114.48 tokens/秒;Vulkan 下的提示词读取速度为 3164 tokens/秒,比 RX 7800 XT 和 7900 GRE 更快。它的另一项优势是 220 W 的 TDP,比此前的 16 GB 显卡低 40 到 50 W。
- 架构
- RDNA 4,RX 9000 系列芯片,总线位宽与 9070 XT 相同,均为 256 位。
- 计算
- 3,584 个流处理器(9070 XT 为 4,096 个)。
- 内存
- 16 GB GDDR6,20.1 Gb/s,256 位总线,640 GB/s
- 功耗
- TDP 为 220 W(9070 XT 为 304 W)。
- 价格
- 未列出价格:价格每周都会变化,请参见 /prix-gpu-ia。
#Linux、Windows:ROCm 或 Vulkan
这是 RDNA 4 这一代的特点:支持情况因操作系统而异。AMD 在 ROCm 支持列表中列出了 RX 9070(目标为 gfx1201),Ollama 文档也将其列为 Linux 下受支持的显卡,使用 ROCm v7 驱动。不过,在 Windows 下,Ollama 的 ROCm 支持列表仅列到 RX 7900 XTX,并未包含 RX 9070。它仍可通过默认启用的 Vulkan 使用,而且吞吐量表现不错。AMD 文档最后还明确指出,Radeon RX 9000 系列仅在 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 和 RHEL 9.7 下受支持。
| 环境 | 状态 | 实际影响 |
|---|---|---|
| Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | 官方ROCm支持,目标架构gfx1201 | Ollama 配 ROCm v7 驱动 |
| Windows | 未列入 Ollama 的 ROCm 支持列表 | 使用默认启用的Vulkan |
| Vulkan,所有系统 | 通用路径 | 公开测试中与ROCm的吞吐量相当 |
#16GB VRAM能容纳什么
当显卡不负责驱动显示器时,模型及其 KV 缓存需要约 15 GB 显存。下方 QuelLLM 目录列出的是 Q4 量化后的模型权重大小;上下文所需的内存还要另计。
| 模型 | 模型大小 | 上下文余量 | 结论 |
|---|---|---|---|
| Llama 3.1 8B(Q4 量化) | ≈ 6 GB | ≈ 9 GB | 运行非常从容,可使用很长的上下文 |
| Gemma 4 12B(Q8) | ≈ 13 GB | ≈ 2 GB | 可装入显存(短上下文) |
| Q4 量化的 gpt-oss 20B | ≈ 13 GB | ≈ 2 GB | 可装载,上下文长度为短至中等 |
| Devstral Small 2 24B (Q4) | ≈ 14 GB | ≈ 1 GB | 勉强容纳 |
| Gemma 4 26B-A4B(Q4 量化) | ≈ 16 GB | 无 | 过于吃紧 |
这 16 GB 显存就是分界线:24B 模型能装下,26B 至 30B 模型则装不下。就这一特定容量门槛而言,各品牌的 16 GB 显卡都一样:按显存容量分类的页面对它们进行了比较。RX 9070 的不同之处在于容量之外的优势:更快的提示词处理速度和更低的功耗。
#实测吞吐量:Vulkan 领先于 ROCm
这些数据来自 llama.cpp 仓库的公开讨论,其中的测量均使用 Llama 2 7B 的 Q4_0 版本(3.56 GiB)和 llama-bench;它们并非本网站测得。在 RX 9070 上,Vulkan 的提示词读取速度为 3,164.10 token/秒,生成速度为 119.71 token/秒;启用 Flash Attention 后,分别为 2,859.98 和 119.51 token/秒。ROCm 的两项速度分别为 2,381.77 和 114.48 token/秒。两个后端的生成速度接近,Vulkan 略快;提示词读取速度的差距则更明显。各组测量的配置、驱动和代码提交版本不同,因此这些差距只能作为大致参考。
| Backend | Flash Attention | 提示词处理(pp512) | tg128 生成 |
|---|---|---|---|
| Vulkan | 否 | 3 164,10 t/s | 119,71 t/s |
| Vulkan | 是 | 2 859,98 t/s | 119,51 t/s |
| ROCm | 否 | 2 381,77 t/s | 114,48 t/s |
理论生成速度上限为 640 GB/s 除以 3.82 GB,即约每秒 167 个 token;在 Vulkan 下,这张显卡可达到该上限的 71%。将这一效率用于更大的模型,可以估算其生成速度的大致范围。这些是计算结果,而非实测数据,并且假设更大的模型表现与作为参考的 7B 模型相似。
| 模型 (Q4) | 模型大小 | 理论上限 | 大致量级 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 107 tokens/s | 约 76 个 token/秒 |
| Gemma 4 12B | ≈ 7 GB | ≈ 91 tokens/s | ≈ 65 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 71 tokens/s | ≈ 50 tokens/s |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 46 tokens/s | ≈ 32 tokens/s |
#RDNA 4 对本地 LLM 的影响
RDNA 4 增加了专用 AI 硬件:根据该系列的规格表,RX 9070 配备 112 个 AI 加速器,而 9070 XT 配备 128 个。按理说,这可能带来远高于 RDNA 3 的生成吞吐量。但公开测量结果并未体现这一点:RX 9070 在 Vulkan 下为每秒 119.71 个 token,而同一讨论中的 RX 7800 XT 为每秒 118.27 个 token。LLM 的生成速度受限于内存带宽,640 GB/s 与 7800 XT 的 624 GB/s 相差不大。AI 加速器更多有助于提示词处理,在这方面,RX 9070 比 7800 XT 快 57%。
对买家而言,这意味着:购买 RDNA 4 不应是为了对话速度,而应是为了提示词处理、更低的功耗和更长的软件支持期限;新款显卡获得软件支持的时间会比旧款更长。如果您只是用 80 亿至 140 亿参数的模型聊天,二手 RX 7800 XT 也能提供相近的生成表现。
#与 RX 9070 XT 对比:差距超过「10 %」
此页面的旧版本声称 RX 9070 比 9070 XT 慢 10% 至 12%。在 Vulkan 下运行参考 7B 模型时,9070 XT 的生成速度为每秒 137.11 个 token,而前者为 119.71 个,高出 15%;提示词读取速度为每秒 5 036 个 token,而前者为 3 164 个,高出 59%。然而,根据规格表,两张显卡的内存均为 16 GB,带宽也相同。因此,差距源于计算能力(4 096 个流处理器对 3 584 个),这在生成阶段影响较小,但在提示词读取阶段影响较大。
| 标准 | RX 9070 | RX 9070 XT |
|---|---|---|
| 流处理器 | 3 584 | 4 096 |
| TDP | 220 W | 304 W |
| 提示词处理(pp512) | 3 164,10 t/s | 5 036,04 t/s |
| tg128 生成 | 119,71 t/s | 137,11 t/s |
简而言之:在聊天场景中,9070相比功耗降低84W,速度损失约15%,属于合理折衷;而在RAG及长文档处理中,9070 XT的读取速度可提升约1.6倍。
#与 16 GB 显存的 RTX 显卡相比:提示词处理仍是性能短板
与在 Vulkan 下测得性能的 16 GB NVIDIA 显卡相比,RX 9070 的生成速度略低:比 RTX 4070 Ti Super 低 8%,比 RTX 5070 Ti 低 12%;处理提示词的速度则大约只有它们的一半。经常被视为直接竞争对手的 12 GB RTX 5070 并未出现在作为参考的 Vulkan 讨论中,因此没有与它进行比较的可靠量化数据,只能比较显存容量:16 GB 对 12 GB。
| 显卡 | 提示词处理(pp512) | tg128 生成 |
|---|---|---|
| RX 9070 | 3 164,10 t/s | 119,71 t/s |
| RTX 4070 Ti Super | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 6 213,63 t/s | 135,63 t/s |
#快速入门
- 01选择系统在 Linux 下,请使用 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 或 RHEL 9.7,以确保所用系统处于 AMD 的支持范围内。在 Windows 下,则使用 Vulkan。
- 02安装 Ollama在 Linux 上,安装 ROCm v7 驱动程序(使用 amdgpu-install),然后安装 Ollama。在 Windows 上,安装 Ollama:Vulkan 默认启用。
- 03加载模型先选择12B或20B模型,再选择24B,然后使用ollama ps命令确认模型在GPU上达到100%利用率。
- 04比较后端针对您的模型,先使用 Vulkan,再使用 ROCm 运行 llama-bench:在公开测量结果中,Vulkan 略微领先。
应该等待下一代产品吗?对于运行 8B 至 24B 模型的用途,所引用的实测数据没有提供任何值得等待的理由:瓶颈是 16 GB 的显存容量,只有 20 至 24 GB 显存的显卡才能突破这一限制。如果您已经确定想运行 30B 及以上的模型,就跳过这张显卡;否则,购买一张 16 GB 显存显卡是否合理,应取决于您今天运行什么,而不是明天会推出什么。
#2026 结论
- 一个良好的选择
- 如果您希望在功耗较低的显卡(220 W)上获得16 GB显存,并接受Windows系统下使用Vulkan。
- 优先选择 9070 XT
- 如果您的提示词较长:它读取提示词的速度快 59%,但功耗也高出 84 W。
- 建议使用 16 GB 显存的 RTX 显卡
- 如果您需要 CUDA,或需要将提示词处理速度提高到两倍。
价格变动迅速:网站每周一和周四会更新本地AI显卡的最低价格,包含VRAM的每GB价格。比较时应以该数值为准,与RTX 5070或RX 9070 XT进行对比。
#常见问题
本地运行 LLM,该选 RX 9070 还是 RX 9070 XT?+
运行本地 LLM,该选 RX 9070 还是 RTX 5070?+
Ollama 是否支持 RX 9070?+
RX 9070 每秒能处理多少 token?+
在配备 16 GB 显存的 RX 9070 上,可以运行哪些模型?+
RX 9070 上该选 Vulkan 还是 ROCm?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。