入门 11 分钟Radeon RX 9000

Radeon RX 9060 XT(8 / 16 GB)适合运行哪款 LLM ?

直接回答

RX 9060 XT 可用于在本地运行 LLM,前提是选择 16 GB 版本:根据 AMD 的数据,其带宽与 8 GB 版本相同,均为 320 GB/s,但显存足以容纳 Q4 量化的 120 亿至 240 亿参数模型。8 GB 版本最多只能容纳 90 亿参数模型。Linux 下的 ROCm 7 支持该显卡。

RX 9060 XT是面向本地AI的入门级Radeon RDNA 4显卡。本指南对比其两种显存版本,说明各自能容纳哪些模型,给出320 GB/s带宽所决定的速度上限,并说明其在Linux和Windows上的兼容性。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: Radeon RX 9070 XT 16 GB.

为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RX 9060 XT:用于 LLM,只有 16 GB 版本值得认真考虑

要在本地运行 LLM,请选择 Radeon RX 9060 XT 的 16 GB 版本。两个版本使用相同的图形处理器,带宽也同为 320 GB/s;只有显存容量不同,而这决定了您能加载什么。使用 8 GB 版本时,您只能运行采用 Q4 量化的 70 亿至 90 亿参数模型,而且上下文较短。使用 16 GB 版本时,则可以运行 120 亿至 240 亿参数模型,使用更长的上下文和保真度更高的量化。发布时,AMD 公布的价格为:8 GB 版本 299 美元,16 GB 版本 349 美元,相差 50 美元即可让显存容量翻倍。

RX 9060 XT 8 GB 和 16 GB(根据 AMD 数据)
特性8 GB16 GB
内存8 GB GDDR616 GB GDDR6
内存总线与带宽128 位,最高达 320 GB/s128 位,最高达 320 GB/s
显卡典型功耗150 W160 W
推荐的最低电源要求450 W450 W
上市时的美国建议零售价(2025 年 5 月)299 $349 $

价格会变动;如需了解当日价格及每 GB 显存的价格,请参考本地 AI 显卡价格追踪。核心要点:对于价格较低的显卡,升级到 16 GB 版本的额外费用,与其解锁的能力相比很低。

#ROCm、Vulkan 和 Windows 兼容性

RX 9060 XT 已列入 Radeon 的 ROCm 7.2.1 兼容性矩阵,对应 Ubuntu 22.04、24.04 和 25.10。Ollama 也将它列为 Linux 下通过 ROCm 支持的显卡,使用 ROCm v7 驱动。因此,在 Linux 下安装支持 ROCm 的 Ollama,流程与其他 Radeon 显卡相同:《Ollama 搭配 AMD GPU》指南详细介绍了操作步骤。

在 Windows 上使用时需谨慎。Ollama 文档列出的 Windows 下 ROCm 支持显卡仅涵盖到 RX 7000 系列,未提及 RX 9000 系列。此外,Ollama 表示 Vulkan 在 Windows 和 Linux 下提供额外支持,且默认启用。因此,RX 9060 XT 有可能在 Windows 下通过 Vulkan 运行;请使用 ollama ps 确认模型确实在 GPU 上运行,而不是在 CPU 上运行。LM Studio 和 llama.cpp 也提供 Vulkan 后端。

i
需要您自行核实的一点
本站并未测试这些显卡:上述兼容性是 AMD 和 Ollama 宣布的。安装后,两条命令即可确认:在 Linux 下运行 rocm-smi 查看显卡,并在模型回答后运行 ollama ps,查看模型有多少百分比被放在 GPU 上。

#8 GB 和 16 GB 分别能容纳什么

以下权重来自 QuelLLM 目录,除另有说明外均为 Q4 量化。在这些权重之外,还需加上随上下文增长而增加的 KV 缓存,以及约一吉字节用于系统和缓冲区的余量。因此,如果某个模型的权重占满了显卡的 100%,那么它实际上太大了。

模型大小(QuelLLM 目录)及各版本的适用性结论
模型模型大小8 GB16 GB
Qwen 3.5 9B Q46 GB勉强够用,仅限短上下文舒适
Qwen 3.5 9B Q810 GB否舒适
Gemma 4 12B Q47 GB显存余量太小舒适
Gemma 4 12B Q813 GB否吃紧
gpt-oss 20B Q413 GB否可以,但上下文长度需适中
Mistral Small 24B Q414 GB否余量紧张,留给上下文的空间为 2 GB
Qwen 3.8 27B Q416 GB否否,超出显存容量

实际选择时,结论可以用一句话概括:16 GB 版本让你能够运行 120 亿至 240 亿参数的模型,其中有些模型在推理、编程和法语方面的能力明显更强。16 GB 显存指南提供完整列表,8 GB 显存指南则介绍如何充分利用有限的内存。

#预期速度:带宽决定上限

文本生成时,每生成一个 token 都要读取模型的大部分权重:因此,最大速度等于带宽除以所读取权重的大小。以 320 GB/s 为例,Q4 量化的 Qwen 3.5 9B(6 GB)的上限约为每秒 53 个 token,Gemma 4 12B(7 GB)约为每秒 46 个 token,Mistral Small 24B(14 GB)约为每秒 23 个 token,而同一个 Qwen 3.5 9B 在 Q8 量化下(10 GB)约为每秒 32 个 token。这些数值都是理论上限,实际速度从不会恰好达到这些值;MoE 模型只读取活跃权重,因此在一定程度上不受这一限制。

唯一可用于比较的公开参考是 llama.cpp 社区关于 ROCm 的数据表:针对 RX 9060 XT,一名参与者测得 Llama 2 7B 在 Q4_0 量化、未启用 Flash Attention 的情况下,提示词读取速度为每秒 1 420 个 token,生成速度为每秒 68 个 token。这个小模型比前表中的模型轻量得多。它给出的是速度的数量级,而不是您实际环境中 12B 或 24B 模型的运行速度;后者会随驱动程序、系统和显卡厂商的具体型号而变化。

在 320 GB/s 带宽下的理论上限(带宽 ÷ 模型目录中 Q4 权重的大小)
模型每个 token 需读取的权重理论上限
Qwen 3.5 9B Q46 GB≈ 53 tokens/s
Qwen 3.5 9B Q810 GB≈ 32 tokens/s
Gemma 4 12B Q47 GB≈ 46 tokens/s
Mistral Small 24B Q414 GB约 23 个标记/秒
→
Q8或Q4:真正的成本
从 Q4 升级到 Q8 几乎使每个 token 读取的权重翻倍,因此将速度上限大致减半。在 320 GB/s 的显存带宽下,Q4_K_M 仍是对话场景的最佳折中方案;将 Q8 保留用于对精度要求高于流畅性的任务。

#设置 Ollama 以防止超出 16 GB

在 16 GB 显存下,余量要按每 GB 精打细算。三个设置可避免负载悄悄转移到 CPU 上,否则速度会下降,却没有错误提示。第一个是上下文长度:Ollama 文档说明默认窗口为 4 096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 修改;上下文长度每翻倍一次,KV 缓存就会增大。第二个是 KV 缓存本身:启用 Flash Attention 时,可通过 OLLAMA_KV_CACHE_TYPE 对其进行量化(默认为 f16,使用 q8_0 可减小缓存)。第三个是检查:生成一条回答后,ollama ps 会显示负载在 GPU 和 CPU 之间的分配情况。

配置为 16k 上下文、KV 缓存采用 q8_0 的服务器
OLLAMA_CONTEXT_LENGTH=16384 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve
# dans un autre terminal
ollama run <nom-du-modèle>
ollama ps

举例说明如何判断:一个大小为 14 GB 的模型,例如 Q4 量化的 Mistral Small 24B,在显存为 16 GB 的显卡上运行时,会留下约 2 GB 供上下文、缓存和缓冲区使用。如果 ollama ps 显示模型由 GPU 和 CPU 分担运行,应先缩短上下文,再量化 KV 缓存,然后降低模型的量化位宽,而不是让模型因显存不足而部分卸载到系统内存。关于 KV 缓存量化的指南详细介绍了这一操作流程。

#购买、等待,还是选择 24 GB 显存

可以分为三种情况。如果您已有一台较新的台式电脑,且电源功率为 450 W 或以上,9060 XT 16 GB 能让您轻松摆脱只能使用小模型的限制,真正用上聊天、翻译和轻量编程功能。如果您想运行 270 亿至 350 亿参数的模型,16 GB 显存容量和 320 GB/s 带宽都不够:请考虑 24 GB 显存的显卡,并参阅 RX 7900 XTX 的指南。如果您难以根据价格做出选择,请利用本网站的价格跟踪数据,比较每 GB 显存的成本;这是选择本地 AI 硬件的合适标准。

#两块 RX 9060 XT:以更低的价格获得 32 GB 显存?

这个问题经常出现在搜索中。在 llama.cpp 中,默认的分配模式按层将模型拆分到多张显卡上,以流水线方式运行,并通过一个选项设置各显卡的分配比例。两张 9060 XT 16 GB 显卡共提供 32 GB 显存;根据 AMD 的数据,典型总功耗约为 320 W。这足以加载 Q4 量化的 Qwen 3.8 27B(权重占 16 GB),并留出大量上下文空间,或加载一个拥有 300 亿至 350 亿参数的 MoE 模型(占 19 至 21 GB)。

有两个限制需要了解。每个 token 的处理速度不会翻倍:显卡会依次处理每个 token,每张卡的带宽仍为 320 GB/s。此外,主板需要有两个可用的 PCIe 插槽,还需要一个通风良好的机箱。单张 24 GB 显卡,例如 7900 XTX,在一条总线上就能提供 960 GB/s 的带宽;对于能完全装入其显存的模型,它的生成速度明显更快。

#FP8:纸面优势,实际使用中对 Ollama 影响甚微

Radeon RX 9000 系列属于 RDNA 4 世代,AMD 为9060 XT列出的 FP8 算力为205 TFLOPs,而 RX 7900 XTX 的规格表没有提及这一项。日常使用 Ollama 或 LM Studio 时,这一点影响不大:GGUF 格式的模型采用整数量化(Q4、Q5、Q8),而非 FP8。使用能利用 FP8 权重的引擎时,这一点才有用,例如 vLLM,其文档列出了 RX 9000 系列。如果您继续使用 Ollama,就不要把这一点作为购买显卡的理由。

#RX 9060 XT 或 RTX 5060 Ti:16 GB 对决

NVIDIA 提供 16 GB 和 8 GB 两种 RTX 5060 Ti,均采用 GDDR7 显存和 128 位总线,而 AMD 显卡采用的是 GDDR6 显存和 128 位总线。更快的显存让 NVIDIA 在带宽方面占优,因此生成速度也更快;具体带宽请查阅 NVIDIA 规格表。另一个优势在于软件:大多数 AI 项目默认面向 CUDA 平台。

16GB决策标准
您最看重的方面选择原因
最大生成速度,需 CUDA 支持RTX 5060 Ti 16 GBGDDR7内存,CUDA生态系统
Linux、Ollama 或 llama.cpp,预算适中RX 9060 XT 16 GBROCm 7 和 Vulkan 支持常规使用场景
Windows,不想调试RTX 5060 Ti 16 GB最通用的驱动程序和工具
超过 16 GB 的模型两者都不选建议配置 24 GB 显存:RX 7900 XTX 或 RTX 3090
预算非常紧张RX 9060 XT 8 GB仅建议用于 90 亿参数的模型
!
没有当日价格就不提供购买建议
这些显卡之间的价差每周都会变化,甚至可能让您改变选择。做出决定前,请在本站的价格追踪页面上比较它们的价格。

#常见问题

常见问题
运行 LLM,RX 9060 XT 该选 8 GB 还是 16 GB?+
选择 16 GB 版本。根据 AMD 的数据,两款的带宽均为 320 GB/s,但 8 GB 版本最多只能运行采用 Q4 量化、上下文较短的 90 亿参数模型。16 GB 版本可加载采用 Q4 量化的 Gemma 4 12B、gpt-oss 20B 或 Mistral Small 24B。上市时,两款的建议售价相差 50 美元。
RX 9060 XT 每秒能生成多少 token?+
这取决于模型。理论上限为带宽(320 GB/s)除以模型权重大小:Q4 量化的 9B 模型约为 53 tokens/s,24B 模型约为 23 tokens/s。llama.cpp 测试结果表中的一位参与者报告,使用 ROCm 运行 Q4_0 量化的 Llama 2 7B 时,生成速度为 68 tokens/s。
RX 9060 XT 能否与 Ollama 兼容?+
在 Linux 下可以:Ollama 将其列为 ROCm v7 支持的显卡。在 Windows 下,其 ROCm 列表仅涵盖 RX 7000,但默认启用的 Vulkan 提供了额外支持。请使用 ollama ps 验证模型是否 100% 放置在 GPU 上。
RX 9060 XT 支持 FP8 吗?+
AMD 规格表列出了 205 TFLOPs 的 FP8 矩阵计算能力,而 RX 7900 XTX 的规格表中没有这一项。Ollama 和 Q4 量化的 GGUF 模型无法直接利用这一能力。FP8 主要对 vLLM 有用,vLLM 将 Radeon RX 9000 列为受支持的硬件。
能否同时连接两块 RX 9060 XT,以获得 32 GB 显存?+
是的,使用 llama.cpp,它默认会将层分布在多个 GPU 之间。您将获得 32 GB 的容量,但速度并不会翻倍:每张显卡仍保持 320 GB/s 的带宽,并轮流工作。根据 AMD 的数据,两块显卡的功耗约为 320 W,再加上电脑其他部分的功耗。
RX 9060 XT 需要什么电源?+
AMD 建议两个版本都使用额定功率至少为 450 W 的电源,8 GB 版本的典型功耗为 150 W,16 GB 版本为 160 W。确定电源功率时,还要加上处理器和磁盘的功耗,再核对您具体显卡型号的规格表,因为部分显卡厂商建议的电源功率高于 AMD 给出的最低要求。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。