在 AMD Radeon 6700XT 上运行哪个 LLM?

搜索“6700xt llm”的人通常是拥有 RDNA 2 架构显卡且希望在不更换 GPU 的情况下使用本地模型的用户。对于 6700xt llm 组合来说,好消息是:该显卡的 12 GB GDDR6 显存足以运行 4 比特量化下 70 至 140 亿参数的模型,并提供适合聊天、代码和文档摘要的舒适吞吐量。主要限制不是计算能力,而是显存;第二个障碍是软件层面的:RX 6700 XT 未获得 ROCm 的官方支持,因此需要调整设置或使用 Vulkan 后端。本文详细介绍了有用的规格、不同量化下的显存需求、实际吞吐量、许可证,并在引导您前往配置器之前回答了常见问题。

RX 6700 XT 在本地推理场景下的表现

从规格上看,Radeon RX 6700 XT 是一款 2021 年的游戏显卡。对于 LLM 而言,有三个数字真正重要。

作为对比,一款 16 GB 显存的显卡,如文中所述的 Radeon RX 6800 XT LLM 指南 可运行 Q4 量化的 24B 模型,而配备 24 GB 显存的显卡,例如 RX 7900 XTX 可支持 32B 模型。6700 XT 仍属于 12 GB 显存级别,与 NVIDIA 的 RTX 3060 12 GB 相同。 RX 6700 XT 专题指南 以及模型选择 Radeon RX 6700 XT 上表现最佳的 LLM 列出目录中能装入这一显存容量的模型。

不同量化格式的显存占用:Q4、Q5、Q8、FP16

计算规则很简单:参数数量 × 每个参数的字节数,再加上随上下文长度增长的KV缓存。以下数量级假设上下文长度为8192个token,KV缓存为8位;这些数值基于常见的GGUF文件估算得出。

临界点十分明确:当超过12 GB时,llama.cpp 和 Ollama 将剩余层卸载至处理器,吞吐量下降5至10倍。 12 GB VRAM 适合使用哪些 LLM 的指南 详细列出尺寸 × 量化 × 上下文组合在GPU上保持100%的配置。

高端目录中无法运行的模型

quelllm.fr 目录中的部分模型无法在 6700 XT 上运行,与其让人期待软件能创造奇迹,不如明确说明这一点。

一个值得关注的边界情况是总参数量约为 120B、但激活参数较少的 MoE 模型。 Qwen 3.5 122B-A10B Q4 量化后大小约为 73 GB,采用 Apache 2.0 许可证, Qwen3.8 Flash Next 125B-A6B 约 72 GB,仅有 6B 参数被激活,而 Mistral Small 4 ~72 GB,采用Apache 2.0许可。配备64 GB系统内存和12 GB显存时,llama.cpp可将专家模块迁移到CPU上加载这些模型。实际吞吐量以每秒数个token计,根据系统内存和CPU性能估算在3至8之间,具体需根据您的配置验证。适用于夜间批量处理,不适用于交互式聊天。权重文件发布于 阿里巴巴在 Hugging Face 上的页面 et Hugging Face 上的 Mistral 页面.

实际每秒令牌数及软件选择

在 RDNA 2 上,吞吐量既取决于后端,也同样取决于模型。有两种可行方案。

社区在 6700 XT 上测得的大致数值,需在您的机器上确认:

如果需要一个基于 Ollama 的聊天界面, Open WebUI 可部署在一个容器中,并管理历史记录、文档和多个模型。

许可证及实际应用场景

许可证决定了您可以如何使用模型输出以及模型是否可以集成到产品中。目录中每项产品均标注其许可证;在 12 GB 规格下,主要家族包括 Apache 2.0、MIT、Llama Community 以及若干自研许可证。按许可证筛选的 目录 可直接排除含有商业用途限制条款的许可证。

6700 XT 在日常使用中的优势:

比较不同模型的得分时, Open LLM Leaderboard 仍是公开的参考标准,但仍需注意通常的局限:基准测试衡量的是某项特定任务,而非您的实际使用场景。

是否需要更换显卡?

如果您遇到 12 GB 显存容量的瓶颈,AMD 有三个升级档位可选。

Le 对比工具 将两份资料并排展示,以查看额外的显存究竟能让特定模型实现哪些原本受限的能力。

FAQ

Q:RX 6700 XT 是否支持 ROCm?

官方尚不支持。AMD 并未将 gfx1031 列为 ROCm 支持的目标架构。实际使用时,为 ROCm 编译的 Ollama 和 llama.cpp 可以通过强制设置 HSA_OVERRIDE_GFX_VERSION=10.3.0,将显卡识别为 gfx1030. 如果该设置出现问题,llama.cpp的Vulkan后端可提供相似的吞吐量,且不依赖ROCm。

Q:12 GB 显存最多能运行多大的模型?

14B 模型采用 Q4 或 Q5 量化时,在 8k 上下文长度下仍可完全装入显存。24B 或 27B 模型则需要采用压缩程度较高的 Q3 量化,或将部分模型卸载至 CPU,吞吐量会明显下降。在超过 14B 的模型中,总参数量为 30B、激活参数量为 3B 的 MoE 模型是最佳折中选择,前提是将专家卸载到处理器上。

Q:能否在6700 XT上运行 DeepSeek R1 671B 或 Qwen 3 235B?

不是。 DeepSeek R1 671B 在 Q4 量化下需要约 400 GB,Qwen 3 235B-A22B 则需要约 142 GB。桌面 PC 上,无论如何搭配 RAM 与 12 GB 显存,都不足以满足需求。总参数约 1200 亿、激活参数为 60 亿至 100 亿的 MoE 模型是绝对上限,搭配 64 GB RAM 时,吞吐量为每秒几个 token。

Q:在6700 XT上运行LLM,推荐使用Windows还是Linux?

两者都能用。在 Windows 上,llama.cpp 的 Vulkan 后端和近期的 Ollama 构建版本可以让您免于安装 ROCm。在 Linux 上,配合覆盖变量使用 ROCm,提示词处理速度会稍快一些。生成吞吐量的差异估计仍在 10% 左右,仅凭这一差异不足以构成更换操作系统的理由。

Q:还需要配备多少系统内存?

32 GB 足以运行能完全装入显存的模型,以及将专家放在 CPU 端的 30B-A3B MoE 模型。只有想尝试将约 120B 的 MoE 模型完全卸载到系统内存中运行时,升级到 64 GB 才有意义,例如 Qwen3.8 Flash Next 125B-A6B,但代价是吞吐量降低。

Q:在 12 GB 显存下是否支持长上下文?

可以,但需要有所取舍。8B 模型的 KV 缓存在 16 位精度下,每 8k token 约占用 1 GB;将 KV 缓存量化为 8 位后,Q4 量化的 8B 模型可在 12 GB 显存内达到 32k 上下文。同样条件下,14B 模型最多只能达到 16k。模型目录中的详情页列出了每个模型支持的最大上下文长度。

结论

对于“6700xt llm”这一搜索词,答案可以概括为一句话:一个采用 Q4 或 Q5 量化、拥有 70 亿至 140 亿参数的模型,通过 Ollama 配合 ROCm 覆盖设置或通过 llama.cpp 的 Vulkan 后端加载后,可以完全在显存中运行,并达到流畅的生成速度。将部分专家卸载到系统内存的 MoE 模型可以扩大可运行模型的范围,但目录中规模最大的模型仍然无法运行。要获取与您的 12 GB 显存、系统内存及目标许可证相匹配的确切模型列表,请使用 quelllm.fr 配置器.

本地运行 LLM 所需的硬件

要在本地流畅运行这些模型,一张 RTX 5070 Ti 提供出色的性价比。比较价格:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

联盟推广链接——QuelLLM 可能会从购买中获得佣金,您无需支付额外费用。作为亚马逊联盟合作伙伴,QuelLLM 会从符合条件的购买中获得收益。

文章发布及更新于 由 Mohamed Meguedmi · 数据来源: /api/models.json · 内容许可协议: CC BY 4.0.

有错误或更新需要反馈吗? 参与贡献.