Radeon RX 9070 XT(16 GB)上运行哪个 LLM ?
RX 9070 XT(16 GB GDDR6,据 AMD 称带宽最高可达 640 GB/s)适合在 Linux 下搭配 ROCm 7,或在 Windows 下通过 Vulkan 运行本地 LLM。它可以加载 Q4 量化后权重大小不超过 13–14 GB 的模型,例如 gpt-oss 20B 或 Mistral Small 24B,无需将部分模型转移到系统内存。270 亿参数的稠密模型则超出了它的能力范围。
RX 9070 XT 是 AMD 的高端 Radeon RDNA 4 显卡。本指南介绍其 16 GB 显存能做什么、如何在 Linux 或 Windows 下安装使用、公开测量结果说明了什么,以及何时选择 RTX 5070 Ti 或一张配备 24 GB 显存的显卡更合适。
您正在挑选电脑吗? 按预算推荐 →
针对此配置: Radeon RX 9070 XT 16 GB.
为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RX 9070 XT 用于 LLM:16 GB,640 GB/s,计算性能良好
Radeon RX 9070 XT 是 RX 9000 系列中运行 LLM 能力最强的消费级 Radeon 显卡:配备 16 GB GDDR6 显存和 256 位总线,据 AMD 称,带宽最高可达 640 GB/秒,FP16 和 FP8 矩阵计算能力明显高于 RX 7900 XTX。它可以运行 Q4 量化后权重大小低于约 13 至 14 GB 的模型,而无需溢出到系统内存:搭配长上下文的 9B 或 12B 模型、gpt-oss 20B,以及搭配短上下文的 Mistral Small 24B。其限制在于容量:Q4 量化的 270 亿参数稠密模型(约 16 GB)无法完全装入显存。
| 特性 | 数值 |
|---|---|
| 内存 | 16 GB GDDR6,256位总线 |
| 带宽 | 最高达640 GB/s |
| 流处理器 / 计算单元 | 4 096 / 64 |
| AI加速器 | 128 |
| 矩阵运算 FP16 / FP8 | 195 / 389 TFLOPs |
| 显卡典型功耗 | 304 W |
| 推荐的最低电源要求 | 750 W |
| 电源接口 | 2 个 8 针接口 |
#软件:ROCm、Vulkan、LM Studio、vLLM
RX 9070 XT 列于 AMD Radeon 文档的 ROCm 7.2.1 兼容性矩阵中(Ubuntu 22.04、24.04 和 25.10)。Ollama 将其列为 Linux 下使用 ROCm v7 驱动时受支持的显卡,并在其 LLVM 目标表中将 gfx1201 对应到 9070 XT。LM Studio 在 2025 年 7 月发布的 0.3.19 版本中宣布,支持在 Linux 上通过 ROCm 使用 AMD 9000 系列 GPU。vLLM 将 Radeon RX 9000(gfx1200 和 gfx1201)列入其 AMD 硬件列表。
在 Windows 下,Ollama 的 ROCm 支持列表止于 RX 7000 系列:其中没有 RX 9000 系列。不过,Ollama 说明,Vulkan 在 Windows 和 Linux 下提供额外支持,且默认启用。因此,9070 XT 在 Windows 下实际使用的是 Vulkan;请用 ollama ps 确认模型确实在 GPU 上运行,如果自行编译,请参阅使用 Vulkan 的 llama.cpp 指南。
#在 Linux 上使用 Ollama 入门
- 01安装 ROCm 驱动程序请按照 Ollama 的要求,参考 AMD 的 ROCm 文档并使用 amdgpu-install 工具进行安装,将您的用户添加到 render 和 video 组,然后重启系统。
- 02确认已检测到显卡rocminfo 需要列出 GPU 代理,且 rocm-smi 应显示 16 GB。否则,Ollama 将使用 CPU。
- 03启动首个模型使用官方脚本安装 Ollama,并启动一个能装入 16 GB 显存的模型,例如一个采用 Q4 量化的 90 亿参数模型。
- 04检查模型的运行位置首次回答后,ollama ps 应显示 100% GPU。如果模型由 GPU 和 CPU 分担运行,就说明模型或上下文过大。
#16 GB 能容纳哪些模型
权重来自 QuelLLM 目录,除特别说明外均为 Q4 量化。请加上 KV 缓存以及约一 GB 的余量。按显存档位划分的完整列表请参阅 16 GB VRAM 指南。
| 模型 | 模型大小 | 能装入 16 GB 显存吗? | 理论上限 |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | 可以,余量很大 | ≈ 107 tokens/s |
| Qwen 3.5 9B Q8 | 10 GB | 是 | 64 tokens/s |
| Gemma 4 12B Q4 | 7 GB | 是,支持长上下文 | ≈ 91 tokens/s |
| Gemma 4 12B Q8 | 13 GB | 可以,使用短上下文 | ≈ 49 tokens/s |
| gpt-oss 20B (MoE) | 13 GB | 可以,但上下文长度需适中 | 取决于当前激活的权重 |
| Mistral Small 24B Q4 | 14 GB | 吃紧 | ≈ 46 tokens/s |
| Qwen 3.8 27B Q4 | 16 GB | 否 | - |
速度上限等于带宽除以生成每个 token 时读取的权重数据量;没有任何显卡能恰好达到这一上限。gpt-oss 20B 这类 MoE 模型每个 token 读取的权重数据量小于模型的总权重数据量,因此,只要模型能完整放入显存,就会比同等规模的稠密模型更快。
#公开测量数据说明了什么
llama.cpp 社区的 ROCm 测试表在多张显卡上测量同一个模型:采用 Q4_0 量化的 Llama 2 7B。对于 RX 9070 XT,一位参与者记录的提示词读取速度为每秒 5 055 个 token(pp512),生成速度为每秒 101 个 token(tg128),未启用 Flash Attention。表中 7900 XTX 的两项速度分别为每秒 3 552 和 167 个 token;9060 XT 则分别为每秒 1 420 和 68 个 token。
| 显卡 | AMD 带宽 | 读取提示词 | 生成 |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
有两点启示。首先,9070 XT 处理长提示词的速度比 7900 XTX 快约 40%,尽管带宽更低:这是更强的矩阵计算能力带来的优势,对 RAG、长文档和返回大量上下文的编程智能体很有用。其次,在生成方面,7900 XTX 仍然领先,这也符合其带宽高出 50% 所带来的预期。
#根据使用场景选择合适的模型
在 16 GB 的配置下,选得是否合适,与其说取决于能运行的最大模型,不如说取决于为上下文留下的余量。一条简单的规则是:除了权重占用的空间,至少留出 2 GB 空闲容量用于 KV 缓存和缓冲区;如果处理长文档,还应留出更多。表格依据 QuelLLM 目录中的模型权重,按用途提供选择的起点。
| 用途 | 初始模型 | Q4 权重 | 16 GB 容量下的余量 |
|---|---|---|---|
| 通用聊天与写作 | Gemma 4 12B | 7 GB | 9 GB,支持长上下文 |
| 编程、开发智能体 | Devstral Small 2 24B | 14 GB | 2 GB,短上下文 |
| 快速推理(MoE) | gpt-oss 20B | 13 GB | 3 GB |
| 使用长提示词的 RAG | Qwen 3.5 9B | 6 GB | 10 GB 用于上下文 |
| 轻量级持续任务 | Granite 4.2 8B | 4.6 GB | 11 GB |
对于 RAG,9070 XT 的矩阵计算能力是一大优势:它能快速读取包含数千个 token 的提示词,而 Q4 量化的 9B 模型可为 KV 缓存留出 10 GB 空间,从而支持长上下文。对于编程任务,14 GB 的模型能装入显存,但只能使用较短的上下文;此时需要量化 KV 缓存或缩小上下文窗口。
#上下文和 KV 缓存:两个关键设置
Ollama 文档指出,默认上下文窗口为 4 096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 变量调整。启用 Flash Attention 时,可通过 OLLAMA_KV_CACHE_TYPE 设置 KV 缓存的量化类型,默认值为 f16;当后端和显卡支持时,Ollama 会自动使用 Flash Attention。逐步增大上下文窗口,同时查看 ollama ps:一旦模型有一部分转到 CPU 上运行,就将上下文窗口调回上一个档位。
#FP8 在 RX 9070 XT 上的应用:实际带来了哪些变化
AMD 列出 9070 XT 的 FP8 矩阵计算性能为 389 TFLOPs,这在 RX 7900 XTX 的规格表中并不存在。实际上,使用 Ollama 和 Q4 或 Q5 的 GGUF 模型时,您并不消耗 FP8:权重是量化整数。FP8 主要用于加载 FP8 权重的引擎,如 vLLM,其列出了 RX 9000。请将其视为未来的余量,而非即时收益,不要为此购买显卡:16 GB 容量和带宽仍然是决定您今天能运行什么的两个标准。
#RX 9070 XT 或 RTX 5070 Ti
NVIDIA 的规格说明指出,RTX 5070 Ti 配备 16 GB GDDR7 显存和 256 位总线:显存容量与 AMD 显卡相同,但采用不同代的显存。容量相同时,能装入显存的模型也相同;差别在于生成速度、CUDA 生态以及价格,而这里不列出固定价格。请查看我们针对本地 AI 显卡的价格跟踪:通常是价格决定最终选择。
| 您的情况 | 推荐的显卡 | 原因 |
|---|---|---|
| Linux,Ollama 或 LM Studio,预算适度 | RX 9070 XT | 支持 ROCm 7,16 GB,列有 FP8 计算能力 |
| 使用 Windows,完全不想调试 | RTX 5070 Ti | 支持 CUDA 生态系统,驱动程序更通用 |
| 需要CUDA的项目(部分微调链路) | RTX 5070 Ti | CUDA 仍是许多项目默认的目标平台 |
| 使用长提示词的 RAG | RX 9070 XT 或 RTX 5070 Ti | 计算能力与带宽同样重要 |
| 270亿参数及以上模型 | 24 GB 显存的显卡 | 任何配备 16 GB 显存的显卡都无法满足这一需求 |
#供电与机箱
AMD 建议电源额定功率至少为 750 W,并标明显卡的典型功耗为 304 W,配备两个 8 针接口。为确定整机所需的电源功率,还应计入处理器、硬盘和风扇的功耗,并检查您所选厂商显卡型号的长度和厚度:这类显卡通常体积较大。通风良好的机箱有助于降低持续负载下的噪音和降频,这在显卡连续数小时生成文本时尤为重要。对于持续开机的 AI 服务器,从长期来看,空闲和负载状态下的功耗与购买价格同样重要。
- 16 GB VRAM 下应选择哪个 LLM:完整列表
- 在 AMD GPU(ROCm)上使用 Ollama:安装指南
- RX 7900 XTX (24 GB) 上的 LLM
- LLM 在 RX 9060 XT (8 / 16 GB) 上的运行
- RX 9070 XT 硬件资料
- 本地 AI 显卡价格
- 来源:AMD Radeon RX 9070 XT 技术规格表
- 来源:Ollama GPU文档
- 来源:LM Studio 0.3.19,支持AMD 9000系列
- 来源:llama.cpp 在 ROCm 上的性能表格
#常见问题
RX 9070 XT 是否适合本地运行 LLM?+
如何在 RX 9070 XT 上使用 LM Studio?+
RX 9070 XT 该选 ROCm 还是 Vulkan?+
RX 9070 XT每秒能生成多少token?+
RX 9070 XT 是否支持 FP8?+
为RX 9070 XT应选择何种电源?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。