入门 11 分钟Radeon RX 6000

在Radeon RX 6700 XT(12 GB)上运行哪个LLM? ?

直接回答

RX 6700 XT(12 GB,384 GB/s)可以轻松运行最高 14B 的 Q4 量化模型(约 9 GB),运行 Gemma 4 12B 这样的 12B 模型时,还能为上下文留出余量。它通过 Vulkan 而非 ROCm 运行:既未列入 ROCm 官方列表,也未列入 Ollama 的列表。在生成阶段,其性能与 RTX 3060 12 GB 相当,甚至更强;在提示词读取阶段,其速度则接近后者的一半。

这款 2021 年的显卡从未以 AI 为设计目标,但软件生态也并未因此将它遗忘。本指南说明它如今能运行什么、通过哪种软件方案运行、根据已公布的测量结果能达到怎样的速度,以及何时更换显卡会比坚持使用它更划算。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: Radeon RX 9070 XT 16 GB.

为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#2026年RX 6700 XT的性能表现

Radeon RX 6700 XT 很适合作为运行本地大语言模型的入门显卡,但需接受三个事实:其 12 GB 显存可容纳一个 Q4 量化的 140 亿参数模型(权重约 9 GB),但容纳不下 240 亿参数模型;可靠的软件方案是通过 llama.cpp 或 Ollama 使用 Vulkan,因为 AMD 未将该显卡列入 ROCm 支持列表;其生成速度受限于 384 GB/s 的显存带宽,但足以让 80 亿至 120 亿参数模型进行流畅对话。在一个 Q4_0 量化的 70 亿参数模型上,llama.cpp 仓库中公布的一项测试测得 Vulkan 下的生成速度为每秒 83.88 个 token,略高于同一讨论中 RTX 3060 12 GB 的测试结果。真正的短板是提示词处理,速度慢一倍。

架构
RDNA 2,Navi 22芯片,于2021年3月18日发布(RX 6000系列在Wikipedia上的技术资料)
计算
2 560 个流处理器,40 个计算单元。
内存
12 GB GDDR6,192位总线,384 GB/s
功耗
230瓦的显卡功耗。
价格
此处未注明:二手价格每周变动,敬请访问 /prix-gpu-ia。

#Ollama, ROCm 或 Vulkan:可行的路径

使用这张显卡时,最常见的陷阱是去寻找 ROCm 指南。Ollama 文档在 Linux 部分列出了从 6800 到 9070 XT 的 Radeon RX 显卡,但其中没有 6700 XT。在 ROCm 方面,AMD 的兼容性表中,RDNA 2 架构仅列有 PRO W6800 或 V620 等专业显卡。Ollama 通过 Vulkan 扩展了支持范围;安装相应后端后,Vulkan 默认启用,这也是 6700 XT 仍可采用的路径。ROCm 也有一种变通方法:使用 HSA_OVERRIDE_GFX_VERSION 变量,强制指定一个相近的 LLVM 目标,但这种方法仅供实验使用。

RX 6700 XT 的三种软件方案
路径在该显卡上的状态何时选择
Vulkan (Ollama, llama.cpp, LM Studio)可正常运行,已有使用 llama.cpp 的公开实测Windows 和 Linux 下的默认选择
官方 ROCmGPU未出现在ROCm支持列表及Ollama的支持列表中需避免:无任何支持保证
强制使用ROCm (HSA_OVERRIDE_GFX_VERSION)Ollama 为其他显卡记录的变通方案仅用于测试,不应期待有已证实的性能收益
!
使用这款显卡时,不要指望 ROCm
Ollama 表示,ROCm 并不支持所有 AMD 显卡,并建议使用 HSA_OVERRIDE_GFX_VERSION 变量排查问题。对于 6700 XT,没有任何来源表明这样做比 Vulkan 有性能提升,而 Vulkan 的测试结果已公开。尝试之前,请先用 rocminfo 命令读取目标信息。

#12 GB 显存能装下什么

本站的计算规则不变:Q4 量化后的模型大小,加上 KV 缓存,再为驱动程序和显示预留一些空间。对于 12 GB 显存,如果显卡不负责驱动屏幕,合理的预算可为模型及其上下文留出约 11 GB。以下大小来自 QuelLLM 目录和我们惯用的参考值,仅指模型本身的大小。

12 GB 显存的显卡能容纳哪些模型(Q4,仅计权重)
模型Q4 量化后的模型大小留给上下文的剩余显存结论
Llama 3.1 8B≈ 6 GB≈ 5至6 GB运行非常轻松,可使用长上下文
Gemma 4 12B≈ 7 GB≈ 4 至 5 GB使用顺畅,可搭配中等至较长的上下文
Phi-4 14B≈ 9 GB≈ 2 至 3 GB可运行,需限制上下文
gpt-oss 20B≈ 13 GB负值超出显存容量:部分转由 CPU 运行
Devstral Small 2 24B≈ 14 GB负值Q4 量化后仍太大,12 GB 显存装不下

KV缓存随对话长度增长而扩大,这解释了为何14B模型在纸面上看似可行,但一旦历史记录变长便会变得缓慢。网站上的VRAM计算器会精确计算您的模型和上下文所需资源,而关于KV缓存量化指南则说明了如何回收一到两吉字节的内存。针对所有12GB显存的显卡,专门页面会对比不同模型,不限于AMD产品。

#实测吞吐量与带宽上限

本页列出的吞吐量均非本站实测。数据来自 llama.cpp 仓库的公开讨论,该讨论使用同一个模型——Q4_0 量化的 Llama 2 7B(3.56 GiB)——和 llama-bench 命令,对比各显卡在 Vulkan 下的表现。其中有两个关键指标:pp512,即读取一个包含 512 个 token 的提示的速度;tg128,即生成 128 个 token 的速度。对于 RX 6700 XT,讨论给出的提示读取速度为每秒 1 051 个 token,生成速度为每秒 83.88 个 token;启用 Flash Attention 后,两者分别为每秒 1 011 个和 81.86 个 token。

可以将这一结果与一个简单的上限比较:生成时,每个 token 都需要显卡重新读取全部权重,因此最高速度大致等于内存带宽除以模型大小。这里,384 GB/s 的带宽除以 3.82 GB 的权重,得到的理论上限是每秒 100 个 token;这张显卡达到了该上限的 83%,效率相当不错,比同一讨论中提到的几款更新的显卡还高。

常见模型的估算(基于计算,非实际测量)
模型 (Q4)模型大小理论最大值 384 GB/s现实估算值(83%)
Llama 3.1 8B≈ 6 GB≈ 64 tokens/s≈ 50 到 55 tokens/s
Gemma 4 12B≈ 7 GB≈ 55 tokens/s≈ 45 tokens/s
Phi-4 14B≈ 9 GB≈ 43 tokens/s≈ 35 tokens/s

这些数量级估算假设,在 7B 模型上测得的效率也能在更大的模型上保持,但这一点并无保证:驱动程序、llama.cpp 版本或量化方式的差异,都可能让结果变动几个点。对于提示词处理,只需关注显卡之间的相对性能:在使用长文档的 RAG 场景中,提示词处理才是影响较大的环节。

#与 RTX 3060 12 GB 相比:生成更快,提示词处理更慢

通常的比较认为,RTX 3060 12 GB 凭借 CUDA 更胜一筹。在 Vulkan 下公布的测量结果则让这一惯常判断需要有所保留。在文本生成方面,RX 6700 XT 在两种模式下都领先于 RTX 3060;在提示词读取方面,RTX 3060 的表现则接近其两倍。这两组测量结果来自同一讨论,但使用了不同版本的 llama.cpp:请将差距视为大致的量级参考,而不是固定不变的排名。

RX 6700 XT 和 RTX 3060 使用 Vulkan(Llama 2 7B Q4_0,llama.cpp 讨论)
测量RX 6700 XTRTX 3060 (12 GB)
提示词读取(pp512),不使用 Flash Attention1 051,20 t/s1 815,70 t/s
生成(tg128),未使用 Flash Attention83,88 t/s75,94 t/s
提示词处理(pp512),启用 Flash Attention1 010,90 t/s2 012,88 t/s
生成(tg128),配合Flash Attention81,86 t/s80,59 t/s

实际而言:与模型对话时,两块显卡表现相当;针对长文档提问时,RTX 3060 能更快输出第一个词。CUDA 也仍有生态系统优势,需要了解的变通办法更少。在二手价格相当的情况下,RTX 3060 12 GB 仍是稳妥之选;只有当 6700 XT 已经装在您的电脑中,或价格明显更低时,它才算划算。

#分步启动指南

  1. 01
    检查 Vulkan 驱动程序
    在 Windows 上,Radeon 驱动包含 Vulkan,Ollama 无需额外步骤。在 Linux 上,请安装 Mesa(RADV)Vulkan 组件或 AMD 驱动,如 Ollama 文档所述。
  2. 02
    安装 Ollama 或编译 llama.cpp
    Ollama 在后端安装完成后默认启用 Vulkan。使用 llama.cpp 时,请通过 -DGGML_VULKAN=on 编译选项启用 Vulkan。
  3. 03
    在 Linux 下提供显卡访问权限
    如果未检测到显卡,请将用户 ollama 添加到 render 组。为了让 Ollama 读取空闲 VRAM,请以 root 身份运行 Ollama,或授予下方命令中指定的 Linux capability 权限。
  4. 04
    启动首个模型
    下载一个8B或Gemma 4 12B模型,量化格式为Q4_K_M,使用命令ollama run启动,然后通过ollama ps检查模型是否加载在GPU上,而非CPU上。
  5. 05
    在本地测量
    使用与公开讨论中相同的 GGUF 文件运行 llama-bench,先将您显卡的测试结果与该讨论中的结果进行比较,再查找运行缓慢的原因。
终端
sudo setcap cap_perfmon+ep /usr/local/bin/ollama
# llama.cpp avec Vulkan
cmake .. -DGGML_VULKAN=on -DCMAKE_BUILD_TYPE=Release
./bin/llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

如果您觉得使用 RADV 时吞吐量偏低,llama.cpp 的相关讨论建议设置环境变量 RADV_PERFTEST=nogttspill 后启动,这能解决多个性能问题。其他 Vulkan 设置可在专门的编译指南中找到。

#局限性与转向其他方案的时机

有三项限制尤为突出。首先是显存:12 GB 无法容纳 200 亿至 320 亿参数的模型,而这类模型关系到代码助手和推理助手的质量。其次是提示词处理,使用长文档的会话会因此变得难熬。最后是支持:不在官方支持列表中的显卡,能否继续获得支持取决于 Vulkan 和 llama.cpp 后续更新是否愿意兼顾它,长期支持没有保障。

何时保持现状,何时更换
您的需求是否继续使用 RX 6700 XT?可考虑的替代显卡
与8B至12B模型进行日常聊天是无
14B 本地代码助手可以,使用短上下文当上下文增大时,建议使用 16 GB 显存的显卡
200 亿至 300 亿参数的模型(gpt-oss 20B、Devstral 24B)不,内存不足配备 16 至 20 GB 显存的显卡,详见下方专题页面
基于大文档的RAG可行,但首个词的输出较慢提示词处理能力更强的显卡
有保障的官方支持否Radeon RX 7000 或 9000、RTX

#2026 结论

值得选择
如果它已经装在您的电脑里:它是少数至今仍能运行 Q4 量化的 14B 模型,且生成效率达到其理论上限 80% 以上的 2021 年显卡之一。
建议改买 RTX 3060 12 GB
如果您从零开始配置电脑,预算也相同:提示词处理速度快一倍,而且无需采用任何软件变通方案。
更换显卡
当您希望运行 200 亿至 300 亿参数的模型时;价格每周都会变化,/prix-gpu-ia 页面提供每 GB 显存的成本。

#常见问题

FAQ
RX 6700 XT LLM:可以运行哪些模型?+
最多140亿参数的Q4模型,约9GB权重,加上上下文:Llama 3.1 8B,Gemma 4 12B,Phi-4 14B。20B级别的模型如gpt-oss(约13GB)或24B模型会超过12GB,部分负载将切换到CPU,导致速度显著下降。
6700 XT 是否能与 Ollama 兼容?+
可以,通过 Vulkan。Ollama 的 ROCm 支持列表没有列出这张显卡,该列表在 Linux 下从 RX 6800 起列,但安装后端后,Ollama 会默认启用 Vulkan。请使用 ollama ps 命令确认模型确实已加载到 GPU 上。
ROCm 在 RX 6700 XT 上可行吗?+
官方并不支持:该显卡既未出现在 AMD 的 ROCm 兼容性表中,也未列入 Ollama 的兼容列表;其中,AMD 表中列出的 RDNA 2 显卡仅限专业显卡。可以通过 HSA_OVERRIDE_GFX_VERSION 变量绕过这一限制,但这种方法仍处于实验阶段,而且没有公开测量结果表明它比 Vulkan 更快,Vulkan 的测量结果则已公开。
在RX 6700 XT上每秒能处理多少token?+
在Llama 2 7B Q4_0下,llama.cpp仓库公开讨论中显示,使用Vulkan时生成速度为83.88 tokens/秒。对于Gemma 4 12B Q4,带宽与权重比表明约45 tokens/秒:此为估算值,建议使用llama-bench在本地验证后引用。
运行 LLM,该选 RX 6700 XT 还是 RTX 3060 12 GB?+
在生成阶段,两者性能相当,Radeon 在已公布的 Vulkan 测量结果中甚至略微领先。在提示词读取阶段,RTX 3060 的速度接近两者中的另一款的两倍,而且 CUDA 可免去采用变通方案的麻烦。在二手价格相同的情况下,RTX 3060 12 GB 仍是最省事的选择。
运行本地 AI 时,什么时候应该不再使用 RX 6700 XT?+
当您想运行参数量为 200 亿到 320 亿、12 GB 显存装不下的模型,或长提示的处理速度过慢影响使用时,下一步合理的选择就是配备 16 到 20 GB 显存的显卡,例如 Radeon RX 7800 XT 或 7900 XT。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。