进阶 11 分钟Radeon RX 9000

Radeon RX 9070(16 GB)适合运行哪个LLM ?

直接回答

Radeon RX 9070(RDNA 4,16 GB GDDR6,640 GB/s,220 W)可以运行 20B 至 24B 参数的 Q4 量化模型,根据公开测量,在 Vulkan 下运行 Llama 2 7B 的 Q4_0 量化版本时,生成速度约为每秒 120 个 token。在 Linux 下,Ollama 通过 ROCm v7 支持该显卡;在 Windows 下,它不在 Ollama 的 ROCm 支持列表中,因此通过 Vulkan 运行,而 Vulkan 已经取得了不错的成绩。

RX 9070 是 AMD 在这一价位最新的 16GB 显卡,功耗明显低于 RX 7000 系列的前代产品。本指南介绍它能运行哪些模型、公开测试数据能告诉我们哪些速度信息、Linux 与 Windows 下有哪些差异,以及它与 RX 9070 XT 和 16GB RTX 显卡相比处于什么水平。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

针对此配置: Radeon RX 9070 XT 16GB (ASUS Prime OC).

为什么选择它?我们的完整资料: Radeon RX 9070 XT 16GB (ASUS Prime OC) →

按预算比较所有选项,从 800 到 3 500 € →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接 — 您无需承担额外费用,我们可能获得佣金。作为 Amazon 合作伙伴,哪个LLM 会从符合条件的购买中获利。

#2026年RX 9070的运行表现

RX 9070 可轻松加载 80 亿到 140 亿参数的 Q4 模型,也能加载 200 亿到 240 亿参数的模型,但较大的模型需要使用较短的上下文。它配备 16 GB GDDR6 显存,数据传输速率为 20.1 Gb/s,采用 256 位总线,显存带宽为 640 GB/s,纠正了本页旧版本中的 644 GB/s。在 Llama 2 7B Q4_0 模型上,llama.cpp 仓库的公开讨论给出的生成速度为 Vulkan 下 119.71 tokens/秒、ROCm 下 114.48 tokens/秒;Vulkan 下的提示词读取速度为 3164 tokens/秒,比 RX 7800 XT 和 7900 GRE 更快。它的另一项优势是 220 W 的 TDP,比此前的 16 GB 显卡低 40 到 50 W。

架构
RDNA 4,RX 9000 系列芯片,总线位宽与 9070 XT 相同,均为 256 位。
计算
3,584 个流处理器(9070 XT 为 4,096 个)。
内存
16 GB GDDR6,20.1 Gb/s,256 位总线,640 GB/s
功耗
TDP 为 220 W(9070 XT 为 304 W)。
价格
未列出价格:价格每周都会变化,请参见 /prix-gpu-ia。

#Linux、Windows:ROCm 或 Vulkan

这是 RDNA 4 这一代的特点:支持情况因操作系统而异。AMD 在 ROCm 支持列表中列出了 RX 9070(目标为 gfx1201),Ollama 文档也将其列为 Linux 下受支持的显卡,使用 ROCm v7 驱动。不过,在 Windows 下,Ollama 的 ROCm 支持列表仅列到 RX 7900 XTX,并未包含 RX 9070。它仍可通过默认启用的 Vulkan 使用,而且吞吐量表现不错。AMD 文档最后还明确指出,Radeon RX 9000 系列仅在 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 和 RHEL 9.7 下受支持。

支持 RX 9070 显卡
环境状态实际影响
Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)官方ROCm支持,目标架构gfx1201Ollama 配 ROCm v7 驱动
Windows未列入 Ollama 的 ROCm 支持列表使用默认启用的Vulkan
Vulkan,所有系统通用路径公开测试中与ROCm的吞吐量相当
i
需注意的一个差异
Ollama 文档中的目标架构表以 RX 9070 对应 gfx1200、9070 XT 对应 gfx1201 为例,而 AMD 的表格则将 RX 9070 对应到 gfx1201。请以您机器上 rocminfo 命令的结果为准,不要以文档中的示例为准。

#16GB VRAM能容纳什么

当显卡不负责驱动显示器时,模型及其 KV 缓存需要约 15 GB 显存。下方 QuelLLM 目录列出的是 Q4 量化后的模型权重大小;上下文所需的内存还要另计。

RX 9070 能容纳哪些模型(仅计模型权重)
模型模型大小上下文余量结论
Llama 3.1 8B(Q4 量化)≈ 6 GB≈ 9 GB运行非常从容,可使用很长的上下文
Gemma 4 12B(Q8)≈ 13 GB≈ 2 GB可装入显存(短上下文)
Q4 量化的 gpt-oss 20B≈ 13 GB≈ 2 GB可装载,上下文长度为短至中等
Devstral Small 2 24B (Q4)≈ 14 GB≈ 1 GB勉强容纳
Gemma 4 26B-A4B(Q4 量化)≈ 16 GB无过于吃紧

这 16 GB 显存就是分界线:24B 模型能装下,26B 至 30B 模型则装不下。就这一特定容量门槛而言,各品牌的 16 GB 显卡都一样:按显存容量分类的页面对它们进行了比较。RX 9070 的不同之处在于容量之外的优势:更快的提示词处理速度和更低的功耗。

#实测吞吐量:Vulkan 领先于 ROCm

这些数据来自 llama.cpp 仓库的公开讨论,其中的测量均使用 Llama 2 7B 的 Q4_0 版本(3.56 GiB)和 llama-bench;它们并非本网站测得。在 RX 9070 上,Vulkan 的提示词读取速度为 3,164.10 token/秒,生成速度为 119.71 token/秒;启用 Flash Attention 后,分别为 2,859.98 和 119.51 token/秒。ROCm 的两项速度分别为 2,381.77 和 114.48 token/秒。两个后端的生成速度接近,Vulkan 略快;提示词读取速度的差距则更明显。各组测量的配置、驱动和代码提交版本不同,因此这些差距只能作为大致参考。

RX 9070 在 Llama 2 7B Q4_0(llama.cpp 公开测试)上运行
BackendFlash Attention提示词处理(pp512)tg128 生成
Vulkan否3 164,10 t/s119,71 t/s
Vulkan是2 859,98 t/s119,51 t/s
ROCm否2 381,77 t/s114,48 t/s

理论生成速度上限为 640 GB/s 除以 3.82 GB,即约每秒 167 个 token;在 Vulkan 下,这张显卡可达到该上限的 71%。将这一效率用于更大的模型,可以估算其生成速度的大致范围。这些是计算结果,而非实测数据,并且假设更大的模型表现与作为参考的 7B 模型相似。

预计达到640 GB/s上限的71%(计算值,非实测)
模型 (Q4)模型大小理论上限大致量级
Llama 3.1 8B≈ 6 GB≈ 107 tokens/s约 76 个 token/秒
Gemma 4 12B≈ 7 GB≈ 91 tokens/s≈ 65 tokens/s
Phi-4 14B≈ 9 GB≈ 71 tokens/s≈ 50 tokens/s
Devstral Small 2 24B≈ 14 GB≈ 46 tokens/s≈ 32 tokens/s

#RDNA 4 对本地 LLM 的影响

RDNA 4 增加了专用 AI 硬件:根据该系列的规格表,RX 9070 配备 112 个 AI 加速器,而 9070 XT 配备 128 个。按理说,这可能带来远高于 RDNA 3 的生成吞吐量。但公开测量结果并未体现这一点:RX 9070 在 Vulkan 下为每秒 119.71 个 token,而同一讨论中的 RX 7800 XT 为每秒 118.27 个 token。LLM 的生成速度受限于内存带宽,640 GB/s 与 7800 XT 的 624 GB/s 相差不大。AI 加速器更多有助于提示词处理,在这方面,RX 9070 比 7800 XT 快 57%。

对买家而言,这意味着:购买 RDNA 4 不应是为了对话速度,而应是为了提示词处理、更低的功耗和更长的软件支持期限;新款显卡获得软件支持的时间会比旧款更长。如果您只是用 80 亿至 140 亿参数的模型聊天,二手 RX 7800 XT 也能提供相近的生成表现。

#与 RX 9070 XT 对比:差距超过「10 %」

此页面的旧版本声称 RX 9070 比 9070 XT 慢 10% 至 12%。在 Vulkan 下运行参考 7B 模型时,9070 XT 的生成速度为每秒 137.11 个 token,而前者为 119.71 个,高出 15%;提示词读取速度为每秒 5 036 个 token,而前者为 3 164 个,高出 59%。然而,根据规格表,两张显卡的内存均为 16 GB,带宽也相同。因此,差距源于计算能力(4 096 个流处理器对 3 584 个),这在生成阶段影响较小,但在提示词读取阶段影响较大。

在 Vulkan 下运行的 RX 9070 和 RX 9070 XT(Llama 2 7B Q4_0,未启用 Flash Attention)
标准RX 9070RX 9070 XT
流处理器3 5844 096
TDP220 W304 W
提示词处理(pp512)3 164,10 t/s5 036,04 t/s
tg128 生成119,71 t/s137,11 t/s

简而言之:在聊天场景中,9070相比功耗降低84W,速度损失约15%,属于合理折衷;而在RAG及长文档处理中,9070 XT的读取速度可提升约1.6倍。

#与 16 GB 显存的 RTX 显卡相比:提示词处理仍是性能短板

与在 Vulkan 下测得性能的 16 GB NVIDIA 显卡相比,RX 9070 的生成速度略低:比 RTX 4070 Ti Super 低 8%,比 RTX 5070 Ti 低 12%;处理提示词的速度则大约只有它们的一半。经常被视为直接竞争对手的 12 GB RTX 5070 并未出现在作为参考的 Vulkan 讨论中,因此没有与它进行比较的可靠量化数据,只能比较显存容量:16 GB 对 12 GB。

RX 9070 和配备 16 GB 显存的 RTX 显卡在 Vulkan 下的表现(Llama 2 7B Q4_0,不启用 FA)
显卡提示词处理(pp512)tg128 生成
RX 90703 164,10 t/s119,71 t/s
RTX 4070 Ti Super6 099,18 t/s129,45 t/s
RTX 5070 Ti6 213,63 t/s135,63 t/s

#快速入门

  1. 01
    选择系统
    在 Linux 下,请使用 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1 或 RHEL 9.7,以确保所用系统处于 AMD 的支持范围内。在 Windows 下,则使用 Vulkan。
  2. 02
    安装 Ollama
    在 Linux 上,安装 ROCm v7 驱动程序(使用 amdgpu-install),然后安装 Ollama。在 Windows 上,安装 Ollama:Vulkan 默认启用。
  3. 03
    加载模型
    先选择12B或20B模型,再选择24B,然后使用ollama ps命令确认模型在GPU上达到100%利用率。
  4. 04
    比较后端
    针对您的模型,先使用 Vulkan,再使用 ROCm 运行 llama-bench:在公开测量结果中,Vulkan 略微领先。
终端
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

应该等待下一代产品吗?对于运行 8B 至 24B 模型的用途,所引用的实测数据没有提供任何值得等待的理由:瓶颈是 16 GB 的显存容量,只有 20 至 24 GB 显存的显卡才能突破这一限制。如果您已经确定想运行 30B 及以上的模型,就跳过这张显卡;否则,购买一张 16 GB 显存显卡是否合理,应取决于您今天运行什么,而不是明天会推出什么。

#2026 结论

一个良好的选择
如果您希望在功耗较低的显卡(220 W)上获得16 GB显存,并接受Windows系统下使用Vulkan。
优先选择 9070 XT
如果您的提示词较长:它读取提示词的速度快 59%,但功耗也高出 84 W。
建议使用 16 GB 显存的 RTX 显卡
如果您需要 CUDA,或需要将提示词处理速度提高到两倍。

价格变动迅速:网站每周一和周四会更新本地AI显卡的最低价格,包含VRAM的每GB价格。比较时应以该数值为准,与RTX 5070或RX 9070 XT进行对比。

#常见问题

FAQ
本地运行 LLM,该选 RX 9070 还是 RX 9070 XT?+
9070 XT 在 Vulkan 下运行参考 7B 模型时,生成速度快 15%,提示词读取速度快 59%,但 TDP 为 304 W,而另一款为 220 W。对于聊天应用,9070 已足够;对于 RAG 和长文档处理,XT 版本更具合理性。请比较当前价格。
运行本地 LLM,该选 RX 9070 还是 RTX 5070?+
RX 9070 提供 16 GB 显存,而对比的显卡为 12 GB,因此可运行 200 至 240 亿参数的模型。RTX 5070 则保有 CUDA 生态优势,且提示词处理速度更快。目前尚未找到 RTX 5070 的公开 Vulkan 实测数据,因此仍需进行数值比较。
Ollama 是否支持 RX 9070?+
在 Linux 上支持,但需要使用 ROCm v7 驱动:该显卡列在 Ollama 的支持列表中。在 Windows 上,它不在 Ollama 的 ROCm 支持列表中,该列表只列到 RX 7900 XTX;不过,默认启用的 Vulkan 可以让您使用这张显卡。请用 ollama ps 检查模型是否已加载到 GPU 上。
RX 9070 每秒能处理多少 token?+
对于 Q4_0 量化的 Llama 2 7B,llama.cpp 仓库的公开讨论给出的生成速度为:Vulkan 下每秒 119.71 个 token,ROCm 下每秒 114.48 个 token。对于 Q4 量化的 24B 模型,计算得到的速度约为每秒 32 个 token:这是估算值,需要在您自己的机器上实测。
在配备 16 GB 显存的 RX 9070 上,可以运行哪些模型?+
Llama 3.1 8B、最高可用 Q8 量化的 Gemma 4 12B,以及采用 Q4 量化的 gpt-oss 20B 和 Devstral Small 2 24B,后两者需使用短上下文。26B 至 30B 模型在 Q4 量化下会超过 16 GB 显存容量,需要由 CPU 承担部分运行工作,速度会明显下降。
RX 9070 上该选 Vulkan 还是 ROCm?+
在 llama.cpp 仓库公开的测量结果中,Vulkan 的生成速度稍快(119.71 对 114.48 token/秒),处理提示词的速度也更快(3 164 对 2 382)。在 Windows 下,Vulkan 本来就是默认路径。做决定前,请用您的模型测试这两种方案。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。