◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

方法论 · 更新于2026年

推荐工具: 量化

根据您的确切显存容量,匹配最优 GGUF、GPTQ 或 AWQ 量化方案的指南 — 无需反复摸索,也不浪费内存。

基础公式: VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. 1.2 的乘数将 8K 上下文下的 KV 缓存和激活开销计入其中。

我的机器应该使用什么量化方式?

请输入您的内存容量:该工具会列出目录中能装入该容量的模型,并为每个模型列出在这一容量限制下可用的最佳量化方案。

正在加载目录……

30秒内做出选择

先在下方找到您可用的显存容量,再查看在 8K 上下文下能够装入的最大模型及其量化级别。表中采用常见 GGUF 文件大小(llama.cpp/Ollama 默认设置,KV 缓存使用 FP16);最后一列标明可用于将上下文增至 16K 的剩余显存。

VRAM典型 GPU推荐模型及量化方案16K 余量
6 GBRTX 3060 Laptop(6 GB)、RTX 4050 LaptopQwen 3 4B Q5_K_M,或 Qwen 3 8B Q3_K_M勉强够用 — 改回 Q4_K_S
8 GBRTX 3050 8 GB,RTX 4060,RTX 5060Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_MQ4_K_M 可用
12 GBRTX 3060 12 GB、RTX 4070、RTX 5070Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_M仅适用于 14B
16 GBRTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080Qwen 3 14B Q6_K、Mistral Small 3.2 24B Q4_K_M(内存余量很紧张)对于 14B 模型而言表现不错
24 GBRTX 3090、RTX 4090、RX 7900 XTXQwen 3 32B Q4_K_M,Qwen3-Coder 30B-A3B Q4_K_M,Gemma 3 27B Q4_K_M32B 稠密模型勉强够用;27B 模型则很宽裕
32 GBRTX 5090Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_K仅针对 32B 模型的 Q6_K 量化
48 GBRTX 6000 Ada,2× RTX 3090/4090Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_S仅限短上下文(8K)
80 GBH100 80 GB,A100 80 GBgpt-oss 120B (MXFP4)、Llama 3.3 70B Q8_0(短上下文)可轻松运行 gpt-oss 120B

推荐背后的计算

量化将每个 FP16(16 位)权重压缩至 2 至 8 位。一个 7B 模型在 Q4_K_M 量化下平均每个权重使用约 4.85 位,即 7 000 000 000 × 4.85 / 8 ≈ 4.2 GB。加上 KV 缓存(随上下文增长),对于采用分组注意力的模型(Mistral 7B、Qwen、Llama 3),在 8K 上下文下总占用约为 5.5 GB。对于长上下文,KV 缓存带来的开销远超使用 ×1.2 系数所估算的额外开销。

每个权重的比特数参考值

Quant每个权重的有效位数显存 (8B)显存(32B)VRAM (70B)
FP1616,016.0 GB64.0 GB140.0 GB
Q8_08,58.5 GB34.0 GB74.4 GB
Q6_K6,66.6 GB26.4 GB57.8 GB
Q5_K_M5,75.7 GB22.8 GB49.9 GB
Q4_K_M4,834.83 GB19.3 GB42.3 GB
Q4_K_S4,584.58 GB18.3 GB40.1 GB
Q3_K_M3,93.9 GB15.6 GB34.1 GB
Q2_K3,353.35 GB13.4 GB29.3 GB

质量下降:数据揭示的真相

参考指标仍为 llama.cpp 使用 k-quants 发布的困惑度 (PR #1684,LLaMA 7B,FP16 = 5.9066)。差距越小,量化模型的表现就越接近原始模型。Q4_K_M 与 Q3_K_M 之间的性能断崖十分明显,而从 Q5 到 Q6 的提升微乎其微。

Quant困惑度(LLaMA 7B)与FP16的差距结论
Q8_0—可忽略无法区分
Q6_K5,9110+0,07 %几乎无损
Q5_K_M5,9208+0,24 %优秀
Q4_K_M5,9601+0,91 %平衡点
Q4_K_S6,0215+1,95 %可接受
Q3_K_M6,1503+4,13 %可感知
Q2_K6,7764+14,7 %最后手段

这些测量于 2023 年在 LLaMA 7B 上进行:较新的模型使用了更多训练数据,通常对量化稍微更敏感。不过,数量级仍然适用。

在内存相同的情况下,Q4_K_M格式的更大模型通常比Q8_0格式的小模型表现更好。若有疑问,应优先增加参数量,而非位数。

GGUF、GPTQ 或 AWQ:正确的格式,而不仅仅是位数

GGUF (llama.cpp / Ollama / LM Studio):单用户推理、CPU 卸载和 Apple Silicon 的默认选择。 GPTQ : 4位量化,纯GPU推理,支持vLLM/TGI。 AWQ : 4 位,纯 GPU — 2026 年在 RTX 4090、RTX 5090、H100/H200 上批量推理的最快选项

使用场景最佳格式为什么
单用户,桌面端,类似 ChatGPT 的使用体验GGUF Q4_K_M可将部分计算卸载到 CPU、仅将部分模型层放在 GPU 上运行,各类设备均可运行
Apple Silicon (M1-M5)GGUF Q4_K_M 或 MLX 4位Metal 内核,统一内存
API 批处理,超过 4 位用户同时使用vLLM 上的 AWQ 4 位量化大批量下吞吐量更高
旧款Ampere架构(A100、RTX 3090)GPTQ 4 位或 AWQ两者都可用;根据自己的使用场景进行基准测试

常见问题

Q4_K_M 真的是最佳平衡点,还是仅仅流行?

是的。在 llama.cpp 发布的 LLaMA 7B 模型 perplexity 测量中,Q4_K_M 与 FP16 的偏差仅约为 0.9%,内存占用约为 30%。Q5_K_M 的偏差降至 0.2%,内存占用增加约 17%——通常不划算,除非有充足的空闲内存。

70B模型需要多少VRAM?

对于 Llama 3.3 70B,Q4_K_M 量化后的权重约占 42 GB,8K 上下文的 KV 缓存还需 2 至 3 GB(得益于分组注意力)。在上下文较短的情况下,可将其装入一张 48 GB 显存的显卡(RTX 6000 Ada)或两张 24 GB 显存的显卡(2×RTX 3090/4090)。采用 Q2_K 量化时,权重降至约 26 GB,但质量明显下降。

GGUF、GPTQ 或 AWQ:应选择哪一个?

GGUF 适合在个人电脑或 Apple Silicon 设备上进行单用户使用。AWQ 适合在 Ada、Hopper 或 Blackwell GPU 上提供批处理 API 服务。GPTQ 仍是一个沿用至今的老方案,在 Ampere 上依然可用,但在 2026 年很少是最快的选择。

量化KV缓存会降低质量吗?

将 KV 缓存量化为 Q8_0 可使其大小减半,质量损失通常被认为可以忽略不计。使用 Q4_0 时,质量损失就可以测量出来:仅在这是容纳长上下文的唯一办法时使用。

像 DeepSeek V3 这样的 MoE 模型是否有所不同?

是的。存储需求取决于参数总数,因此即使采用 Q4 量化,671B 的 MoE 模型仍需要数百 GB 的存储空间。速度则取决于激活的参数量(DeepSeek V3 为 37B)。量化精度低于 Q4 时,质量损失会迅速增大;不过,动态量化方案(例如 Unsloth 为 DeepSeek R1 提供的方案)表明,超大型 MoE 模型即使采用 2 位量化,仍可能保持可用。

如何验证量化后的模型确实能完全放入显存?

在生成 500 个 token 时运行 nvidia-smi -l 1。如果显存占用上升后趋于稳定,就没有问题。如果显存占用达到上限,同时每秒生成的 token 数骤降,说明部分模型已转移到系统内存中——请降低一级量化精度,或缩短上下文。

想进一步了解吗? 显存计算器 精确计算您模型的需求,我们的 Q4 与 Q5 与 Q8 对比指南 详细说明质量测试内容。

更多免费工具