方法论 · 更新于2026年
推荐工具: 量化
根据您的确切显存容量,匹配最优 GGUF、GPTQ 或 AWQ 量化方案的指南 — 无需反复摸索,也不浪费内存。
基础公式: VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. 1.2 的乘数将 8K 上下文下的 KV 缓存和激活开销计入其中。
我的机器应该使用什么量化方式?
请输入您的内存容量:该工具会列出目录中能装入该容量的模型,并为每个模型列出在这一容量限制下可用的最佳量化方案。
正在加载目录……
30秒内做出选择
先在下方找到您可用的显存容量,再查看在 8K 上下文下能够装入的最大模型及其量化级别。表中采用常见 GGUF 文件大小(llama.cpp/Ollama 默认设置,KV 缓存使用 FP16);最后一列标明可用于将上下文增至 16K 的剩余显存。
| VRAM | 典型 GPU | 推荐模型及量化方案 | 16K 余量 |
|---|---|---|---|
| 6 GB | RTX 3060 Laptop(6 GB)、RTX 4050 Laptop | Qwen 3 4B Q5_K_M,或 Qwen 3 8B Q3_K_M | 勉强够用 — 改回 Q4_K_S |
| 8 GB | RTX 3050 8 GB,RTX 4060,RTX 5060 | Qwen 3 8B Q4_K_M, Llama 3.1 8B Q4_K_M | Q4_K_M 可用 |
| 12 GB | RTX 3060 12 GB、RTX 4070、RTX 5070 | Qwen 3 14B Q4_K_M, Qwen 2.5 Coder 14B Q4_K_M, Gemma 3 12B Q5_K_M | 仅适用于 14B |
| 16 GB | RTX 4060 Ti 16 GB, RTX 5060 Ti 16 GB, RTX 5070 Ti, RTX 5080 | Qwen 3 14B Q6_K、Mistral Small 3.2 24B Q4_K_M(内存余量很紧张) | 对于 14B 模型而言表现不错 |
| 24 GB | RTX 3090、RTX 4090、RX 7900 XTX | Qwen 3 32B Q4_K_M,Qwen3-Coder 30B-A3B Q4_K_M,Gemma 3 27B Q4_K_M | 32B 稠密模型勉强够用;27B 模型则很宽裕 |
| 32 GB | RTX 5090 | Qwen 3 32B Q6_K, Qwen 3 30B-A3B Q6_K | 仅针对 32B 模型的 Q6_K 量化 |
| 48 GB | RTX 6000 Ada,2× RTX 3090/4090 | Llama 3.3 70B Q4_K_M, Qwen 2.5 72B Q4_K_S | 仅限短上下文(8K) |
| 80 GB | H100 80 GB,A100 80 GB | gpt-oss 120B (MXFP4)、Llama 3.3 70B Q8_0(短上下文) | 可轻松运行 gpt-oss 120B |
推荐背后的计算
量化将每个 FP16(16 位)权重压缩至 2 至 8 位。一个 7B 模型在 Q4_K_M 量化下平均每个权重使用约 4.85 位,即 7 000 000 000 × 4.85 / 8 ≈ 4.2 GB。加上 KV 缓存(随上下文增长),对于采用分组注意力的模型(Mistral 7B、Qwen、Llama 3),在 8K 上下文下总占用约为 5.5 GB。对于长上下文,KV 缓存带来的开销远超使用 ×1.2 系数所估算的额外开销。
每个权重的比特数参考值
| Quant | 每个权重的有效位数 | 显存 (8B) | 显存(32B) | VRAM (70B) |
|---|---|---|---|---|
| FP16 | 16,0 | 16.0 GB | 64.0 GB | 140.0 GB |
| Q8_0 | 8,5 | 8.5 GB | 34.0 GB | 74.4 GB |
| Q6_K | 6,6 | 6.6 GB | 26.4 GB | 57.8 GB |
| Q5_K_M | 5,7 | 5.7 GB | 22.8 GB | 49.9 GB |
| Q4_K_M | 4,83 | 4.83 GB | 19.3 GB | 42.3 GB |
| Q4_K_S | 4,58 | 4.58 GB | 18.3 GB | 40.1 GB |
| Q3_K_M | 3,9 | 3.9 GB | 15.6 GB | 34.1 GB |
| Q2_K | 3,35 | 3.35 GB | 13.4 GB | 29.3 GB |
质量下降:数据揭示的真相
参考指标仍为 llama.cpp 使用 k-quants 发布的困惑度 (PR #1684,LLaMA 7B,FP16 = 5.9066)。差距越小,量化模型的表现就越接近原始模型。Q4_K_M 与 Q3_K_M 之间的性能断崖十分明显,而从 Q5 到 Q6 的提升微乎其微。
| Quant | 困惑度(LLaMA 7B) | 与FP16的差距 | 结论 |
|---|---|---|---|
| Q8_0 | — | 可忽略 | 无法区分 |
| Q6_K | 5,9110 | +0,07 % | 几乎无损 |
| Q5_K_M | 5,9208 | +0,24 % | 优秀 |
| Q4_K_M | 5,9601 | +0,91 % | 平衡点 |
| Q4_K_S | 6,0215 | +1,95 % | 可接受 |
| Q3_K_M | 6,1503 | +4,13 % | 可感知 |
| Q2_K | 6,7764 | +14,7 % | 最后手段 |
这些测量于 2023 年在 LLaMA 7B 上进行:较新的模型使用了更多训练数据,通常对量化稍微更敏感。不过,数量级仍然适用。
在内存相同的情况下,Q4_K_M格式的更大模型通常比Q8_0格式的小模型表现更好。若有疑问,应优先增加参数量,而非位数。
GGUF、GPTQ 或 AWQ:正确的格式,而不仅仅是位数
GGUF (llama.cpp / Ollama / LM Studio):单用户推理、CPU 卸载和 Apple Silicon 的默认选择。 GPTQ : 4位量化,纯GPU推理,支持vLLM/TGI。 AWQ : 4 位,纯 GPU — 2026 年在 RTX 4090、RTX 5090、H100/H200 上批量推理的最快选项
| 使用场景 | 最佳格式 | 为什么 |
|---|---|---|
| 单用户,桌面端,类似 ChatGPT 的使用体验 | GGUF Q4_K_M | 可将部分计算卸载到 CPU、仅将部分模型层放在 GPU 上运行,各类设备均可运行 |
| Apple Silicon (M1-M5) | GGUF Q4_K_M 或 MLX 4位 | Metal 内核,统一内存 |
| API 批处理,超过 4 位用户同时使用 | vLLM 上的 AWQ 4 位量化 | 大批量下吞吐量更高 |
| 旧款Ampere架构(A100、RTX 3090) | GPTQ 4 位或 AWQ | 两者都可用;根据自己的使用场景进行基准测试 |
常见问题
Q4_K_M 真的是最佳平衡点,还是仅仅流行?
是的。在 llama.cpp 发布的 LLaMA 7B 模型 perplexity 测量中,Q4_K_M 与 FP16 的偏差仅约为 0.9%,内存占用约为 30%。Q5_K_M 的偏差降至 0.2%,内存占用增加约 17%——通常不划算,除非有充足的空闲内存。
70B模型需要多少VRAM?
对于 Llama 3.3 70B,Q4_K_M 量化后的权重约占 42 GB,8K 上下文的 KV 缓存还需 2 至 3 GB(得益于分组注意力)。在上下文较短的情况下,可将其装入一张 48 GB 显存的显卡(RTX 6000 Ada)或两张 24 GB 显存的显卡(2×RTX 3090/4090)。采用 Q2_K 量化时,权重降至约 26 GB,但质量明显下降。
GGUF、GPTQ 或 AWQ:应选择哪一个?
GGUF 适合在个人电脑或 Apple Silicon 设备上进行单用户使用。AWQ 适合在 Ada、Hopper 或 Blackwell GPU 上提供批处理 API 服务。GPTQ 仍是一个沿用至今的老方案,在 Ampere 上依然可用,但在 2026 年很少是最快的选择。
量化KV缓存会降低质量吗?
将 KV 缓存量化为 Q8_0 可使其大小减半,质量损失通常被认为可以忽略不计。使用 Q4_0 时,质量损失就可以测量出来:仅在这是容纳长上下文的唯一办法时使用。
像 DeepSeek V3 这样的 MoE 模型是否有所不同?
是的。存储需求取决于参数总数,因此即使采用 Q4 量化,671B 的 MoE 模型仍需要数百 GB 的存储空间。速度则取决于激活的参数量(DeepSeek V3 为 37B)。量化精度低于 Q4 时,质量损失会迅速增大;不过,动态量化方案(例如 Unsloth 为 DeepSeek R1 提供的方案)表明,超大型 MoE 模型即使采用 2 位量化,仍可能保持可用。
如何验证量化后的模型确实能完全放入显存?
在生成 500 个 token 时运行 nvidia-smi -l 1。如果显存占用上升后趋于稳定,就没有问题。如果显存占用达到上限,同时每秒生成的 token 数骤降,说明部分模型已转移到系统内存中——请降低一级量化精度,或缩短上下文。
想进一步了解吗? 显存计算器 精确计算您模型的需求,我们的 Q4 与 Q5 与 Q8 对比指南 详细说明质量测试内容。