在Radeon RX 6700 XT(12 GB)上运行哪个LLM? ?
RX 6700 XT(12 GB,384 GB/s)可以轻松运行最高 14B 的 Q4 量化模型(约 9 GB),运行 Gemma 4 12B 这样的 12B 模型时,还能为上下文留出余量。它通过 Vulkan 而非 ROCm 运行:既未列入 ROCm 官方列表,也未列入 Ollama 的列表。在生成阶段,其性能与 RTX 3060 12 GB 相当,甚至更强;在提示词读取阶段,其速度则接近后者的一半。
这款 2021 年的显卡从未以 AI 为设计目标,但软件生态也并未因此将它遗忘。本指南说明它如今能运行什么、通过哪种软件方案运行、根据已公布的测量结果能达到怎样的速度,以及何时更换显卡会比坚持使用它更划算。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: Radeon RX 9070 XT 16 GB.
为什么选择它?我们的完整资料: Radeon RX 9070 XT 16 GB →
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#2026年RX 6700 XT的性能表现
Radeon RX 6700 XT 很适合作为运行本地大语言模型的入门显卡,但需接受三个事实:其 12 GB 显存可容纳一个 Q4 量化的 140 亿参数模型(权重约 9 GB),但容纳不下 240 亿参数模型;可靠的软件方案是通过 llama.cpp 或 Ollama 使用 Vulkan,因为 AMD 未将该显卡列入 ROCm 支持列表;其生成速度受限于 384 GB/s 的显存带宽,但足以让 80 亿至 120 亿参数模型进行流畅对话。在一个 Q4_0 量化的 70 亿参数模型上,llama.cpp 仓库中公布的一项测试测得 Vulkan 下的生成速度为每秒 83.88 个 token,略高于同一讨论中 RTX 3060 12 GB 的测试结果。真正的短板是提示词处理,速度慢一倍。
- 架构
- RDNA 2,Navi 22芯片,于2021年3月18日发布(RX 6000系列在Wikipedia上的技术资料)
- 计算
- 2 560 个流处理器,40 个计算单元。
- 内存
- 12 GB GDDR6,192位总线,384 GB/s
- 功耗
- 230瓦的显卡功耗。
- 价格
- 此处未注明:二手价格每周变动,敬请访问 /prix-gpu-ia。
#Ollama, ROCm 或 Vulkan:可行的路径
使用这张显卡时,最常见的陷阱是去寻找 ROCm 指南。Ollama 文档在 Linux 部分列出了从 6800 到 9070 XT 的 Radeon RX 显卡,但其中没有 6700 XT。在 ROCm 方面,AMD 的兼容性表中,RDNA 2 架构仅列有 PRO W6800 或 V620 等专业显卡。Ollama 通过 Vulkan 扩展了支持范围;安装相应后端后,Vulkan 默认启用,这也是 6700 XT 仍可采用的路径。ROCm 也有一种变通方法:使用 HSA_OVERRIDE_GFX_VERSION 变量,强制指定一个相近的 LLVM 目标,但这种方法仅供实验使用。
| 路径 | 在该显卡上的状态 | 何时选择 |
|---|---|---|
| Vulkan (Ollama, llama.cpp, LM Studio) | 可正常运行,已有使用 llama.cpp 的公开实测 | Windows 和 Linux 下的默认选择 |
| 官方 ROCm | GPU未出现在ROCm支持列表及Ollama的支持列表中 | 需避免:无任何支持保证 |
| 强制使用ROCm (HSA_OVERRIDE_GFX_VERSION) | Ollama 为其他显卡记录的变通方案 | 仅用于测试,不应期待有已证实的性能收益 |
#12 GB 显存能装下什么
本站的计算规则不变:Q4 量化后的模型大小,加上 KV 缓存,再为驱动程序和显示预留一些空间。对于 12 GB 显存,如果显卡不负责驱动屏幕,合理的预算可为模型及其上下文留出约 11 GB。以下大小来自 QuelLLM 目录和我们惯用的参考值,仅指模型本身的大小。
| 模型 | Q4 量化后的模型大小 | 留给上下文的剩余显存 | 结论 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5至6 GB | 运行非常轻松,可使用长上下文 |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 至 5 GB | 使用顺畅,可搭配中等至较长的上下文 |
| Phi-4 14B | ≈ 9 GB | ≈ 2 至 3 GB | 可运行,需限制上下文 |
| gpt-oss 20B | ≈ 13 GB | 负值 | 超出显存容量:部分转由 CPU 运行 |
| Devstral Small 2 24B | ≈ 14 GB | 负值 | Q4 量化后仍太大,12 GB 显存装不下 |
KV缓存随对话长度增长而扩大,这解释了为何14B模型在纸面上看似可行,但一旦历史记录变长便会变得缓慢。网站上的VRAM计算器会精确计算您的模型和上下文所需资源,而关于KV缓存量化指南则说明了如何回收一到两吉字节的内存。针对所有12GB显存的显卡,专门页面会对比不同模型,不限于AMD产品。
#实测吞吐量与带宽上限
本页列出的吞吐量均非本站实测。数据来自 llama.cpp 仓库的公开讨论,该讨论使用同一个模型——Q4_0 量化的 Llama 2 7B(3.56 GiB)——和 llama-bench 命令,对比各显卡在 Vulkan 下的表现。其中有两个关键指标:pp512,即读取一个包含 512 个 token 的提示的速度;tg128,即生成 128 个 token 的速度。对于 RX 6700 XT,讨论给出的提示读取速度为每秒 1 051 个 token,生成速度为每秒 83.88 个 token;启用 Flash Attention 后,两者分别为每秒 1 011 个和 81.86 个 token。
可以将这一结果与一个简单的上限比较:生成时,每个 token 都需要显卡重新读取全部权重,因此最高速度大致等于内存带宽除以模型大小。这里,384 GB/s 的带宽除以 3.82 GB 的权重,得到的理论上限是每秒 100 个 token;这张显卡达到了该上限的 83%,效率相当不错,比同一讨论中提到的几款更新的显卡还高。
| 模型 (Q4) | 模型大小 | 理论最大值 384 GB/s | 现实估算值(83%) |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 64 tokens/s | ≈ 50 到 55 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 55 tokens/s | ≈ 45 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 43 tokens/s | ≈ 35 tokens/s |
这些数量级估算假设,在 7B 模型上测得的效率也能在更大的模型上保持,但这一点并无保证:驱动程序、llama.cpp 版本或量化方式的差异,都可能让结果变动几个点。对于提示词处理,只需关注显卡之间的相对性能:在使用长文档的 RAG 场景中,提示词处理才是影响较大的环节。
#与 RTX 3060 12 GB 相比:生成更快,提示词处理更慢
通常的比较认为,RTX 3060 12 GB 凭借 CUDA 更胜一筹。在 Vulkan 下公布的测量结果则让这一惯常判断需要有所保留。在文本生成方面,RX 6700 XT 在两种模式下都领先于 RTX 3060;在提示词读取方面,RTX 3060 的表现则接近其两倍。这两组测量结果来自同一讨论,但使用了不同版本的 llama.cpp:请将差距视为大致的量级参考,而不是固定不变的排名。
| 测量 | RX 6700 XT | RTX 3060 (12 GB) |
|---|---|---|
| 提示词读取(pp512),不使用 Flash Attention | 1 051,20 t/s | 1 815,70 t/s |
| 生成(tg128),未使用 Flash Attention | 83,88 t/s | 75,94 t/s |
| 提示词处理(pp512),启用 Flash Attention | 1 010,90 t/s | 2 012,88 t/s |
| 生成(tg128),配合Flash Attention | 81,86 t/s | 80,59 t/s |
实际而言:与模型对话时,两块显卡表现相当;针对长文档提问时,RTX 3060 能更快输出第一个词。CUDA 也仍有生态系统优势,需要了解的变通办法更少。在二手价格相当的情况下,RTX 3060 12 GB 仍是稳妥之选;只有当 6700 XT 已经装在您的电脑中,或价格明显更低时,它才算划算。
#分步启动指南
- 01检查 Vulkan 驱动程序在 Windows 上,Radeon 驱动包含 Vulkan,Ollama 无需额外步骤。在 Linux 上,请安装 Mesa(RADV)Vulkan 组件或 AMD 驱动,如 Ollama 文档所述。
- 02安装 Ollama 或编译 llama.cppOllama 在后端安装完成后默认启用 Vulkan。使用 llama.cpp 时,请通过 -DGGML_VULKAN=on 编译选项启用 Vulkan。
- 03在 Linux 下提供显卡访问权限如果未检测到显卡,请将用户 ollama 添加到 render 组。为了让 Ollama 读取空闲 VRAM,请以 root 身份运行 Ollama,或授予下方命令中指定的 Linux capability 权限。
- 04启动首个模型下载一个8B或Gemma 4 12B模型,量化格式为Q4_K_M,使用命令ollama run启动,然后通过ollama ps检查模型是否加载在GPU上,而非CPU上。
- 05在本地测量使用与公开讨论中相同的 GGUF 文件运行 llama-bench,先将您显卡的测试结果与该讨论中的结果进行比较,再查找运行缓慢的原因。
如果您觉得使用 RADV 时吞吐量偏低,llama.cpp 的相关讨论建议设置环境变量 RADV_PERFTEST=nogttspill 后启动,这能解决多个性能问题。其他 Vulkan 设置可在专门的编译指南中找到。
#局限性与转向其他方案的时机
有三项限制尤为突出。首先是显存:12 GB 无法容纳 200 亿至 320 亿参数的模型,而这类模型关系到代码助手和推理助手的质量。其次是提示词处理,使用长文档的会话会因此变得难熬。最后是支持:不在官方支持列表中的显卡,能否继续获得支持取决于 Vulkan 和 llama.cpp 后续更新是否愿意兼顾它,长期支持没有保障。
| 您的需求 | 是否继续使用 RX 6700 XT? | 可考虑的替代显卡 |
|---|---|---|
| 与8B至12B模型进行日常聊天 | 是 | 无 |
| 14B 本地代码助手 | 可以,使用短上下文 | 当上下文增大时,建议使用 16 GB 显存的显卡 |
| 200 亿至 300 亿参数的模型(gpt-oss 20B、Devstral 24B) | 不,内存不足 | 配备 16 至 20 GB 显存的显卡,详见下方专题页面 |
| 基于大文档的RAG | 可行,但首个词的输出较慢 | 提示词处理能力更强的显卡 |
| 有保障的官方支持 | 否 | Radeon RX 7000 或 9000、RTX |
#2026 结论
- 值得选择
- 如果它已经装在您的电脑里:它是少数至今仍能运行 Q4 量化的 14B 模型,且生成效率达到其理论上限 80% 以上的 2021 年显卡之一。
- 建议改买 RTX 3060 12 GB
- 如果您从零开始配置电脑,预算也相同:提示词处理速度快一倍,而且无需采用任何软件变通方案。
- 更换显卡
- 当您希望运行 200 亿至 300 亿参数的模型时;价格每周都会变化,/prix-gpu-ia 页面提供每 GB 显存的成本。
- 本地AI显卡价格,每周更新两次
- Ollama 文档:支持的 GPU、ROCm 和 Vulkan
- llama.cpp 仓库中的 Vulkan 评分表 (Llama 2 7B Q4_0)
- ROCm 的 GPU 兼容性,AMD 文档
#常见问题
RX 6700 XT LLM:可以运行哪些模型?+
6700 XT 是否能与 Ollama 兼容?+
ROCm 在 RX 6700 XT 上可行吗?+
在RX 6700 XT上每秒能处理多少token?+
运行 LLM,该选 RX 6700 XT 还是 RTX 3060 12 GB?+
运行本地 AI 时,什么时候应该不再使用 RX 6700 XT?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。