进阶 12 分钟Ollama

Ollama + AMD GPU (ROCm):配置 Radeon RX 6000 至 9000

AMD 长期落后于 CUDA,但 ROCm 6 已经缩小了足够多的差距,使 Radeon RX 6000、7000 和 9000 系列显卡能够充分用于 LLM 推理。本指南介绍干净安装、Ollama 配置,以及让未列入官方支持名单的显卡也能运行的覆盖设置。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为什么选择 ROCm

要使用AMD GPU,Ollama(基于llama.cpp)必须通过ROCm——AMD版的CUDA。没有ROCm,显卡在推理时将不可见,所有运算将在CPU上进行。

i
替代方案:Vulkan
如果 ROCm 无法正常工作,编译时启用了 Vulkan 支持的 llama.cpp 也能在 AMD 显卡上运行(Intel Arc 显卡也可以)。速度稍慢,但更简单。参见 llama.cpp 的 Vulkan 使用指南。

#官方确认兼容的显卡

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
RX 7900 XTX / XT / GRE
gfx1100。官方支持。性能约为RTX 4080的80%。
RX 7800 / 7700 XT
gfx1101。自ROCm 6.1版本起提供官方支持。
RX 6900 / 6800 / 6700 XT
gfx1030/1031。高端显卡有官方支持,较低端的显卡需要使用 override 覆盖设置。
Instinct MI200 / MI300
数据中心显卡。提供完整的原生支持。
!
RX 6600、6500、5700
未获官方支持。借助 HSA_OVERRIDE_GFX_VERSION 变量(见下文),一切皆有可能,但风险需自行承担。

#1. 安装ROCm

支持最完善的两个发行版是 Ubuntu 22.04/24.04 和 RHEL/Fedora。Debian、Arch 等发行版则需要额外做一些变通调整。

Ubuntu 24.04
# Dépôt officiel
wget https://repo.radeon.com/amdgpu-install/6.1/ubuntu/noble/amdgpu-install_6.1.60100-1_all.deb
sudo apt install ./amdgpu-install_6.1.60100-1_all.deb

# ROCm + drivers GPU
sudo amdgpu-install --usecase=rocm,graphics

# Droits utilisateur
sudo usermod -aG render,video $USER

# Reboot obligatoire
sudo reboot
重启后验证
rocminfo | grep gfx
# Doit afficher votre architecture, ex : gfx1100

rocm-smi
# Résumé VRAM, température, conso

#2. Ollama 和 ROCm

Ollama 0.3+ 会自动检测 ROCm。如果您先安装了 Ollama,后安装了 ROCm,请重新安装 Ollama——安装脚本此时会检测到 AMD GPU,并安装正确的库。

安装 ROCm 后重新安装
curl -fsSL https://ollama.com/install.sh | sh
systemctl restart ollama
测试
ollama run qwen3.5:9b "Test GPU"
# Puis dans un autre terminal :
rocm-smi --showuse
# La ligne GPU[0] doit bouger

#3. 强制使用不支持的显卡

若 rocminfo 未列出您的 GPU,或 Ollama 仍使用 CPU,可通过设置 HSA_OVERRIDE_GFX_VERSION 强制 ROCm 模拟硬件版本。

RX 6600 / 6700
HSA_OVERRIDE_GFX_VERSION=10.3.0
RX 5700 XT
HSA_OVERRIDE_GFX_VERSION=10.1.0(支持不稳定)
RX 6800 / 6900
原生支持,无需使用覆盖设置(override)。
在 Ollama 的 systemd 覆盖配置文件中
sudo systemctl edit ollama

# Ajouter :
[Service]
Environment="HSA_OVERRIDE_GFX_VERSION=10.3.0"

sudo systemctl daemon-reload
sudo systemctl restart ollama

#4. 预期性能

对于 Qwen 3.5 9B Q4_K_M(6.6 GB,2026 年面向 8 GB 显存配置的标杆选择),推理速度的大致数值如下,单位为 token/秒:

RX 7900 XTX (24 GB)
~90 个 token/秒。性能相当于 RTX 4080
RX 7800 XT (16 GB)
约 62 token/秒。性能介于 RTX 4070 和 4070 Ti 之间。
RX 6900 XT(16 GB)
~52 tok/s。相当于RTX 3080 10 GB。
RX 6700 XT(12 GB,覆盖设置)
~33个token/秒。在RTX 3060与RTX 3060 Ti之间。
→
VRAM 至关重要
无论是在 AMD 还是 NVIDIA 平台上,VRAM 都是运行大型模型的门槛。一块 24 GB 的 RX 7900 XTX 可以运行 Qwen 3.6 35B-A3B(Q4 量化下需 23 GB),而 12 GB 的 RTX 4070 则无法加载,尽管 4070 在纯计算速度上更快。

#故障排除

rocminfo为空
驱动未安装或用户未加入 render 组。请检查 groups $USER。
Ollama在使用ROCm时仍依赖CPU
这通常是架构不兼容导致的。请尝试使用对应下一代架构的 HSA_OVERRIDE 设置。
大模型运行时崩溃(内存不足)
使用 rocm-smi 查看消耗的 VRAM。如果超出,请减少 num_ctx 或切换至 Q3_K_M
ROCm 版本与 Ollama 不兼容
Ollama 按 ROCm 6.x 打包。ROCm 5 无法使用,请升级。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。