在 AMD Radeon 6700XT 上运行哪个 LLM?
搜索“6700xt llm”的人通常是拥有 RDNA 2 架构显卡且希望在不更换 GPU 的情况下使用本地模型的用户。对于 6700xt llm 组合来说,好消息是:该显卡的 12 GB GDDR6 显存足以运行 4 比特量化下 70 至 140 亿参数的模型,并提供适合聊天、代码和文档摘要的舒适吞吐量。主要限制不是计算能力,而是显存;第二个障碍是软件层面的:RX 6700 XT 未获得 ROCm 的官方支持,因此需要调整设置或使用 Vulkan 后端。本文详细介绍了有用的规格、不同量化下的显存需求、实际吞吐量、许可证,并在引导您前往配置器之前回答了常见问题。
RX 6700 XT 在本地推理场景下的表现
从规格上看,Radeon RX 6700 XT 是一款 2021 年的游戏显卡。对于 LLM 而言,有三个数字真正重要。
- VRAM : 12 GB GDDR6,192位总线。
- 内存带宽 :384 GB/s。这个数值限制了生成速度的上限(以 token/秒计),因为每生成一个 token,都要重新读取全部活跃权重。
- 架构 : RDNA 2,标识
gfx1031,40 个计算单元,无专用矩阵核心。
作为对比,一款 16 GB 显存的显卡,如文中所述的 Radeon RX 6800 XT LLM 指南 可运行 Q4 量化的 24B 模型,而配备 24 GB 显存的显卡,例如 RX 7900 XTX 可支持 32B 模型。6700 XT 仍属于 12 GB 显存级别,与 NVIDIA 的 RTX 3060 12 GB 相同。 RX 6700 XT 专题指南 以及模型选择 Radeon RX 6700 XT 上表现最佳的 LLM 列出目录中能装入这一显存容量的模型。
不同量化格式的显存占用:Q4、Q5、Q8、FP16
计算规则很简单:参数数量 × 每个参数的字节数,再加上随上下文长度增长的KV缓存。以下数量级假设上下文长度为8192个token,KV缓存为8位;这些数值基于常见的GGUF文件估算得出。
- 7到8B参数模型 : Q4 ≈ 5 GB,Q5 ≈ 6 GB,Q8 ≈ 9 GB,FP16 ≈ 16 GB。12 GB 内可支持至 Q8(含),FP16(不含)
- 12至14B模型 :Q4 ≈ 8 至 9 GB,Q5 ≈ 10 GB,Q8 ≈ 15 GB。Q4 和 Q5 能完全装入显存,Q8 则需要将一部分卸载到系统内存。
- 24B 至 27B 模型 : Q4 约 15 到 17 GB。无法完全容纳;Q3 12 GB 版本可行,但会降低质量。
- 30B参数的MoE模型,其中3B参数激活 :Q4 量化后的模型权重约为 18 GB,但每生成一个 token,只读取活跃专家的权重。将专家卸载到 CPU 上后,吞吐量仍能满足使用需求。
临界点十分明确:当超过12 GB时,llama.cpp 和 Ollama 将剩余层卸载至处理器,吞吐量下降5至10倍。 12 GB VRAM 适合使用哪些 LLM 的指南 详细列出尺寸 × 量化 × 上下文组合在GPU上保持100%的配置。
高端目录中无法运行的模型
quelllm.fr 目录中的部分模型无法在 6700 XT 上运行,与其让人期待软件能创造奇迹,不如明确说明这一点。
- DeepSeek R1 671B :Q4 量化下约需 400 GB,采用 MIT 许可证。无论使用哪种显卡,都无法在普通消费级电脑上本地运行。
- Qwen 3 235B-A22B :Q4 量化下约需 142 GB,采用 Apache 2.0 许可证。即使配备 128 GB 内存,也无法容纳。
- DeepSeek V4 Flash 284B :Q4 下约 170 GB,采用 MIT 许可证。仅适用于多 GPU 服务器或配备统一内存的高端 Mac。
- GLM 5.3 Flash 320B-A18B :Q4 下约 186 GB,MIT 许可证。结论相同。
一个值得关注的边界情况是总参数量约为 120B、但激活参数较少的 MoE 模型。 Qwen 3.5 122B-A10B Q4 量化后大小约为 73 GB,采用 Apache 2.0 许可证, Qwen3.8 Flash Next 125B-A6B 约 72 GB,仅有 6B 参数被激活,而 Mistral Small 4 ~72 GB,采用Apache 2.0许可。配备64 GB系统内存和12 GB显存时,llama.cpp可将专家模块迁移到CPU上加载这些模型。实际吞吐量以每秒数个token计,根据系统内存和CPU性能估算在3至8之间,具体需根据您的配置验证。适用于夜间批量处理,不适用于交互式聊天。权重文件发布于 阿里巴巴在 Hugging Face 上的页面 et Hugging Face 上的 Mistral 页面.
实际每秒令牌数及软件选择
在 RDNA 2 上,吞吐量既取决于后端,也同样取决于模型。有两种可行方案。
- Ollama 配合 ROCm : 6700 XT 并未在官方列表中,但变量
HSA_OVERRIDE_GFX_VERSION=10.3.0使其被识别并接受为同系列显卡。完整操作步骤见 Ollama 使用 AMD GPU 与 ROCm 的指南 ;该仓库 GitHub 上的 Ollama 介绍了环境变量。 - llama.cpp配合Vulkan : 无需专用驱动,可在 Windows 和 Linux 下运行。后端由 llama.cpp 仓库。生成速度与 ROCm 接近,提示词处理速度略慢。
- vLLM :在 RDNA 2 上不是现实可行的选择; vLLM 文档 面向数据中心显卡和较新的 RDNA 3 显卡。
社区在 6700 XT 上测得的大致数值,需在您的机器上确认:
- Q4_K_M 格式的 8B 模型 : 生成速度为35至45 tokens/秒
- 采用 Q4_K_M 量化的 14B 模型 : 每秒 18 到 25 个 token。
- 专家部分在 CPU 上运行的 MoE 30B-A3B : 每秒12至20个token(估算值)
- Q4 量化的 24B 模型,部分卸载至系统内存 : 4至8个token/秒,估算值
如果需要一个基于 Ollama 的聊天界面, Open WebUI 可部署在一个容器中,并管理历史记录、文档和多个模型。
许可证及实际应用场景
许可证决定了您可以如何使用模型输出以及模型是否可以集成到产品中。目录中每项产品均标注其许可证;在 12 GB 规格下,主要家族包括 Apache 2.0、MIT、Llama Community 以及若干自研许可证。按许可证筛选的 目录 可直接排除含有商业用途限制条款的许可证。
6700 XT 在日常使用中的优势:
- 代码助手 :一个采用 Q4 量化、拥有 70 亿至 140 亿参数的模型,响应速度足以满足编辑器中的代码补全和审阅需求。模型资料页上的 HumanEval 和 LiveCodeBench 得分有助于比较候选模型。
- 私有文档的摘要与RAG : 8B模型在Q5量化下,8k至16k上下文长度可容纳于VRAM中;超出此范围时,需降低KV缓存的量化等级。
- 法语聊天 :优先选择模型说明中列有多语言 MMLU 分数或法语评估结果的模型,而不是只列有英语 MMLU 分数的模型。
- 离线批量处理 :分类、字段提取、改写,在这些任务中,吞吐量不如保密性重要。
比较不同模型的得分时, Open LLM Leaderboard 仍是公开的参考标准,但仍需注意通常的局限:基准测试衡量的是某项特定任务,而非您的实际使用场景。
是否需要更换显卡?
如果您遇到 12 GB 显存容量的瓶颈,AMD 有三个升级档位可选。
- 16 GB : 二手RX 6800 XT,RX 7800 XT,或全新RX 9060 XT。 9060 XT 16 GB的基准测试 展示额外 4 GB 显存和 RDNA 4 架构能为 24B 模型带来什么。
- 20 GB :RX 7900 XT,其显存可容纳一个 Q5 量化的 27B 模型。
- 24 GB :RX 7900 XTX,唯一能加载 Q4 量化的 32B 模型并保留实用上下文长度的消费级 AMD 显卡。
Le 对比工具 将两份资料并排展示,以查看额外的显存究竟能让特定模型实现哪些原本受限的能力。
FAQ
Q:RX 6700 XT 是否支持 ROCm?
官方尚不支持。AMD 并未将 gfx1031 列为 ROCm 支持的目标架构。实际使用时,为 ROCm 编译的 Ollama 和 llama.cpp 可以通过强制设置 HSA_OVERRIDE_GFX_VERSION=10.3.0,将显卡识别为 gfx1030. 如果该设置出现问题,llama.cpp的Vulkan后端可提供相似的吞吐量,且不依赖ROCm。
Q:12 GB 显存最多能运行多大的模型?
14B 模型采用 Q4 或 Q5 量化时,在 8k 上下文长度下仍可完全装入显存。24B 或 27B 模型则需要采用压缩程度较高的 Q3 量化,或将部分模型卸载至 CPU,吞吐量会明显下降。在超过 14B 的模型中,总参数量为 30B、激活参数量为 3B 的 MoE 模型是最佳折中选择,前提是将专家卸载到处理器上。
Q:能否在6700 XT上运行 DeepSeek R1 671B 或 Qwen 3 235B?
不是。 DeepSeek R1 671B 在 Q4 量化下需要约 400 GB,Qwen 3 235B-A22B 则需要约 142 GB。桌面 PC 上,无论如何搭配 RAM 与 12 GB 显存,都不足以满足需求。总参数约 1200 亿、激活参数为 60 亿至 100 亿的 MoE 模型是绝对上限,搭配 64 GB RAM 时,吞吐量为每秒几个 token。
Q:在6700 XT上运行LLM,推荐使用Windows还是Linux?
两者都能用。在 Windows 上,llama.cpp 的 Vulkan 后端和近期的 Ollama 构建版本可以让您免于安装 ROCm。在 Linux 上,配合覆盖变量使用 ROCm,提示词处理速度会稍快一些。生成吞吐量的差异估计仍在 10% 左右,仅凭这一差异不足以构成更换操作系统的理由。
Q:还需要配备多少系统内存?
32 GB 足以运行能完全装入显存的模型,以及将专家放在 CPU 端的 30B-A3B MoE 模型。只有想尝试将约 120B 的 MoE 模型完全卸载到系统内存中运行时,升级到 64 GB 才有意义,例如 Qwen3.8 Flash Next 125B-A6B,但代价是吞吐量降低。
Q:在 12 GB 显存下是否支持长上下文?
可以,但需要有所取舍。8B 模型的 KV 缓存在 16 位精度下,每 8k token 约占用 1 GB;将 KV 缓存量化为 8 位后,Q4 量化的 8B 模型可在 12 GB 显存内达到 32k 上下文。同样条件下,14B 模型最多只能达到 16k。模型目录中的详情页列出了每个模型支持的最大上下文长度。
结论
对于“6700xt llm”这一搜索词,答案可以概括为一句话:一个采用 Q4 或 Q5 量化、拥有 70 亿至 140 亿参数的模型,通过 Ollama 配合 ROCm 覆盖设置或通过 llama.cpp 的 Vulkan 后端加载后,可以完全在显存中运行,并达到流畅的生成速度。将部分专家卸载到系统内存的 MoE 模型可以扩大可运行模型的范围,但目录中规模最大的模型仍然无法运行。要获取与您的 12 GB 显存、系统内存及目标许可证相匹配的确切模型列表,请使用 quelllm.fr 配置器.
本地运行 LLM 所需的硬件
要在本地流畅运行这些模型,一张 RTX 5070 Ti 提供出色的性价比。比较价格:
联盟推广链接——QuelLLM 可能会从购买中获得佣金,您无需支付额外费用。作为亚马逊联盟合作伙伴,QuelLLM 会从符合条件的购买中获得收益。