进阶 11 分钟Radeon RX 9000

Radeon RX 9070 XT(16 GB)上运行哪个 LLM ?

直接回答

RX 9070 XT(16 GB GDDR6,据 AMD 称带宽最高可达 640 GB/s)适合在 Linux 下搭配 ROCm 7,或在 Windows 下通过 Vulkan 运行本地 LLM。它可以加载 Q4 量化后权重大小不超过 13–14 GB 的模型,例如 gpt-oss 20B 或 Mistral Small 24B,无需将部分模型转移到系统内存。270 亿参数的稠密模型则超出了它的能力范围。

RX 9070 XT 是 AMD 的高端 Radeon RDNA 4 显卡。本指南介绍其 16 GB 显存能做什么、如何在 Linux 或 Windows 下安装使用、公开测量结果说明了什么,以及何时选择 RTX 5070 Ti 或一张配备 24 GB 显存的显卡更合适。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

针对此配置: Radeon RX 9070 XT 16 GB.

为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RX 9070 XT 用于 LLM:16 GB,640 GB/s,计算性能良好

Radeon RX 9070 XT 是 RX 9000 系列中运行 LLM 能力最强的消费级 Radeon 显卡:配备 16 GB GDDR6 显存和 256 位总线,据 AMD 称,带宽最高可达 640 GB/秒,FP16 和 FP8 矩阵计算能力明显高于 RX 7900 XTX。它可以运行 Q4 量化后权重大小低于约 13 至 14 GB 的模型,而无需溢出到系统内存:搭配长上下文的 9B 或 12B 模型、gpt-oss 20B,以及搭配短上下文的 Mistral Small 24B。其限制在于容量:Q4 量化的 270 亿参数稠密模型(约 16 GB)无法完全装入显存。

RX 9070 XT 技术规格表(来源:AMD)
特性数值
内存16 GB GDDR6,256位总线
带宽最高达640 GB/s
流处理器 / 计算单元4 096 / 64
AI加速器128
矩阵运算 FP16 / FP8195 / 389 TFLOPs
显卡典型功耗304 W
推荐的最低电源要求750 W
电源接口2 个 8 针接口
i
带宽:640 GB/s,非 644
一些在线文档,包括本指南的早期版本,指出644 GB/s。AMD官方文档注明「最高可达640 GB/s」;在计算中应使用此数值。

#软件:ROCm、Vulkan、LM Studio、vLLM

RX 9070 XT 列于 AMD Radeon 文档的 ROCm 7.2.1 兼容性矩阵中(Ubuntu 22.04、24.04 和 25.10)。Ollama 将其列为 Linux 下使用 ROCm v7 驱动时受支持的显卡,并在其 LLVM 目标表中将 gfx1201 对应到 9070 XT。LM Studio 在 2025 年 7 月发布的 0.3.19 版本中宣布,支持在 Linux 上通过 ROCm 使用 AMD 9000 系列 GPU。vLLM 将 Radeon RX 9000(gfx1200 和 gfx1201)列入其 AMD 硬件列表。

在 Windows 下,Ollama 的 ROCm 支持列表止于 RX 7000 系列:其中没有 RX 9000 系列。不过,Ollama 说明,Vulkan 在 Windows 和 Linux 下提供额外支持,且默认启用。因此,9070 XT 在 Windows 下实际使用的是 Vulkan;请用 ollama ps 确认模型确实在 GPU 上运行,如果自行编译,请参阅使用 Vulkan 的 llama.cpp 指南。

#在 Linux 上使用 Ollama 入门

  1. 01
    安装 ROCm 驱动程序
    请按照 Ollama 的要求,参考 AMD 的 ROCm 文档并使用 amdgpu-install 工具进行安装,将您的用户添加到 render 和 video 组,然后重启系统。
  2. 02
    确认已检测到显卡
    rocminfo 需要列出 GPU 代理,且 rocm-smi 应显示 16 GB。否则,Ollama 将使用 CPU。
  3. 03
    启动首个模型
    使用官方脚本安装 Ollama,并启动一个能装入 16 GB 显存的模型,例如一个采用 Q4 量化的 90 亿参数模型。
  4. 04
    检查模型的运行位置
    首次回答后,ollama ps 应显示 100% GPU。如果模型由 GPU 和 CPU 分担运行,就说明模型或上下文过大。
验证
rocminfo | grep -i gfx
rocm-smi --showmeminfo vram
ollama ps

#16 GB 能容纳哪些模型

权重来自 QuelLLM 目录,除特别说明外均为 Q4 量化。请加上 KV 缓存以及约一 GB 的余量。按显存档位划分的完整列表请参阅 16 GB VRAM 指南。

模型权重大小(QuelLLM 目录)及基于 640 GB/s 带宽计算的理论上限
模型模型大小能装入 16 GB 显存吗?理论上限
Qwen 3.5 9B Q46 GB可以,余量很大≈ 107 tokens/s
Qwen 3.5 9B Q810 GB是64 tokens/s
Gemma 4 12B Q47 GB是,支持长上下文≈ 91 tokens/s
Gemma 4 12B Q813 GB可以,使用短上下文≈ 49 tokens/s
gpt-oss 20B (MoE)13 GB可以,但上下文长度需适中取决于当前激活的权重
Mistral Small 24B Q414 GB吃紧≈ 46 tokens/s
Qwen 3.8 27B Q416 GB否-

速度上限等于带宽除以生成每个 token 时读取的权重数据量;没有任何显卡能恰好达到这一上限。gpt-oss 20B 这类 MoE 模型每个 token 读取的权重数据量小于模型的总权重数据量,因此,只要模型能完整放入显存,就会比同等规模的稠密模型更快。

!
16 GB无法支持的内容
根据目录,270 至 350 亿参数的 Q4 量化模型大小为 16 至 21 GB:它们会溢出到系统内存,且速度会大幅下降。对于此类模型,请查看 24 GB 指南或 RX 7900 XTX。

#公开测量数据说明了什么

llama.cpp 社区的 ROCm 测试表在多张显卡上测量同一个模型:采用 Q4_0 量化的 Llama 2 7B。对于 RX 9070 XT,一位参与者记录的提示词读取速度为每秒 5 055 个 token(pp512),生成速度为每秒 101 个 token(tg128),未启用 Flash Attention。表中 7900 XTX 的两项速度分别为每秒 3 552 和 167 个 token;9060 XT 则分别为每秒 1 420 和 68 个 token。

Llama 2 7B Q4_0,llama.cpp ROCm(社区表格,未使用 Flash Attention)
显卡AMD 带宽读取提示词生成
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

有两点启示。首先,9070 XT 处理长提示词的速度比 7900 XTX 快约 40%,尽管带宽更低:这是更强的矩阵计算能力带来的优势,对 RAG、长文档和返回大量上下文的编程智能体很有用。其次,在生成方面,7900 XTX 仍然领先,这也符合其带宽高出 50% 所带来的预期。

i
社区汇总表并不等于基准测试
在同一个表格中,RX 9070(非XT版)的生成速度达到114 tokens/s,超过9070 XT的101 tokens/s,尽管它本应更慢。这些数据来自不同版本的llama.cpp和不同驱动程序。请将这些数值视为大致数量级,而非精确排名。

#根据使用场景选择合适的模型

在 16 GB 的配置下,选得是否合适,与其说取决于能运行的最大模型,不如说取决于为上下文留下的余量。一条简单的规则是:除了权重占用的空间,至少留出 2 GB 空闲容量用于 KV 缓存和缓冲区;如果处理长文档,还应留出更多。表格依据 QuelLLM 目录中的模型权重,按用途提供选择的起点。

16 GB 显存下各类用途的起步选择
用途初始模型Q4 权重16 GB 容量下的余量
通用聊天与写作Gemma 4 12B7 GB9 GB,支持长上下文
编程、开发智能体Devstral Small 2 24B14 GB2 GB,短上下文
快速推理(MoE)gpt-oss 20B13 GB3 GB
使用长提示词的 RAGQwen 3.5 9B6 GB10 GB 用于上下文
轻量级持续任务Granite 4.2 8B4.6 GB11 GB

对于 RAG,9070 XT 的矩阵计算能力是一大优势:它能快速读取包含数千个 token 的提示词,而 Q4 量化的 9B 模型可为 KV 缓存留出 10 GB 空间,从而支持长上下文。对于编程任务,14 GB 的模型能装入显存,但只能使用较短的上下文;此时需要量化 KV 缓存或缩小上下文窗口。

#上下文和 KV 缓存:两个关键设置

Ollama 文档指出,默认上下文窗口为 4 096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 变量调整。启用 Flash Attention 时,可通过 OLLAMA_KV_CACHE_TYPE 设置 KV 缓存的量化类型,默认值为 f16;当后端和显卡支持时,Ollama 会自动使用 Flash Attention。逐步增大上下文窗口,同时查看 ollama ps:一旦模型有一部分转到 CPU 上运行,就将上下文窗口调回上一个档位。

32k上下文,使用q8_0格式的KV缓存
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#FP8 在 RX 9070 XT 上的应用:实际带来了哪些变化

AMD 列出 9070 XT 的 FP8 矩阵计算性能为 389 TFLOPs,这在 RX 7900 XTX 的规格表中并不存在。实际上,使用 Ollama 和 Q4 或 Q5 的 GGUF 模型时,您并不消耗 FP8:权重是量化整数。FP8 主要用于加载 FP8 权重的引擎,如 vLLM,其列出了 RX 9000。请将其视为未来的余量,而非即时收益,不要为此购买显卡:16 GB 容量和带宽仍然是决定您今天能运行什么的两个标准。

#RX 9070 XT 或 RTX 5070 Ti

NVIDIA 的规格说明指出,RTX 5070 Ti 配备 16 GB GDDR7 显存和 256 位总线:显存容量与 AMD 显卡相同,但采用不同代的显存。容量相同时,能装入显存的模型也相同;差别在于生成速度、CUDA 生态以及价格,而这里不列出固定价格。请查看我们针对本地 AI 显卡的价格跟踪:通常是价格决定最终选择。

16 GB 显存下如何做选择
您的情况推荐的显卡原因
Linux,Ollama 或 LM Studio,预算适度RX 9070 XT支持 ROCm 7,16 GB,列有 FP8 计算能力
使用 Windows,完全不想调试RTX 5070 Ti支持 CUDA 生态系统,驱动程序更通用
需要CUDA的项目(部分微调链路)RTX 5070 TiCUDA 仍是许多项目默认的目标平台
使用长提示词的 RAGRX 9070 XT 或 RTX 5070 Ti计算能力与带宽同样重要
270亿参数及以上模型24 GB 显存的显卡任何配备 16 GB 显存的显卡都无法满足这一需求

#供电与机箱

AMD 建议电源额定功率至少为 750 W,并标明显卡的典型功耗为 304 W,配备两个 8 针接口。为确定整机所需的电源功率,还应计入处理器、硬盘和风扇的功耗,并检查您所选厂商显卡型号的长度和厚度:这类显卡通常体积较大。通风良好的机箱有助于降低持续负载下的噪音和降频,这在显卡连续数小时生成文本时尤为重要。对于持续开机的 AI 服务器,从长期来看,空闲和负载状态下的功耗与购买价格同样重要。

#常见问题

常见问题
RX 9070 XT 是否适合本地运行 LLM?+
对于能装入其 16 GB 显存的模型来说,是的:例如使用长上下文的 9B 或 12B 模型、gpt-oss 20B,以及使用短上下文的 Mistral Small 24B。其 640 GB/s 的带宽和矩阵计算能力使它运行速度很快,尤其是在处理提示词时。它不适合运行拥有 270 亿参数的稠密模型。
如何在 RX 9070 XT 上使用 LM Studio?+
LM Studio 宣布,自 0.3.19 版本起支持在 Linux 上通过 ROCm 使用 AMD 9000 系列 GPU。在 Windows 上,llama.cpp 的 Vulkan 引擎是备选方案。两种情况下,都应加载小于 14 GB 的模型,并在界面中确认所有层都位于 GPU 上。
RX 9070 XT 该选 ROCm 还是 Vulkan?+
在 Linux 上,ROCm 7 是 Ollama 的官方方案,这张显卡对应的目标架构为 gfx1201。在 Windows 上,Ollama 的 ROCm 列表未列出 RX 9000 系列,因此默认启用的 Vulkan 是实际可用的方案。做决定前,请用 llama-bench 在您的模型上对比测试这两种方案。
RX 9070 XT每秒能生成多少token?+
这取决于模型。对于采用 Q4_0 量化的 Llama 2 7B,llama.cpp 的社区测试表记录了使用 ROCm 时每秒生成 101 个 token 的速度。对于其他模型,理论上限是将 640 GB/s 除以模型权重大小:一个权重为 14 GB 的 24B 模型,在不计任何损耗的情况下,约为每秒 46 个 token。
RX 9070 XT 是否支持 FP8?+
纸面上是的:AMD列出的FP8矩阵计算性能为389 TFLOPs。但使用Ollama和Q4量化的GGUF模型时,并不能直接享受到这一性能,因为权重是量化后的整数。FP8用于加载FP8权重的引擎,例如vLLM,该引擎列出了RX 9000支持情况。
为RX 9070 XT应选择何种电源?+
AMD 标明电源额定功率至少应为 750 W,显卡的典型功耗为 304 W,并配备两个 8 针供电接口。请加上电脑其余部件的功耗,并留出余量,尤其是在处理器性能较强时。还应查看您所用厂商具体型号的规格表,其建议的电源功率可能更高。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。