◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

工具 · 实时计算

LLM VRAM 计算器

本地 LLM 到底需要多少 GPU 显存?将模型权重、KV 缓存和额外开销一并计入,给出实事求是的估算。

计算规则:VRAM ≈ 参数量(十亿)× 每个权重的字节数 + KV 缓存 + 约 20% 的额外开销。Q4 量化约需每十亿个参数 0.55-0.6 GB;FP16 则为每十亿个参数 2 GB。更长的上下文会使 KV 缓存的占用远超 20%。

估算值 = 权重占用内存 × (1 + 0.2 × 上下文长度/8K)。这是适用于稠密模型的经验公式;MoE(混合专家)模型每个 token 激活的权重较少,实际运行表现可能优于其参数规模给人的预期。请始终为操作系统和画面显示预留 1-2 GB。

不同模型大小所需的显存(8K 上下文)

大小Q4_K_MQ8_0FP16可容纳模型的硬件(Q4)
7B4.9 GB9.0 GB16.8 GB8GB 显卡(RTX 3050,4060)
9B6.3 GB11.6 GB21.6 GB8-12 GB显存显卡
14B9.7 GB18.0 GB33.6 GB12-16 GB 显存显卡
27B18.8 GB34.7 GB64.8 GB24GB显存显卡(RTX 3090/4090)
32B22.3 GB41.1 GB76.8 GB24 GB 显存的显卡,短上下文
70B48.7 GB89.9 GB168.0 GB48 GB+,或两块各有 24 GB 显存的 GPU

数值已计入 8K 上下文下 KV 缓存和额外开销所需的 20% 余量,并以 GB 为单位四舍五入至小数点后一位。

现在,选择模型

了解可用的显存容量,只完成了一半的准备。硬件配置工具会为您的具体 GPU 或 Mac 型号匹配实际可用的模型;本地 LLM 排行榜则对所有可在本地运行的模型进行排名。按硬件档位划分的榜单能帮您直接找到目标:适合 8 GB 显存的最佳 LLM、RTX 4090、16 GB 内存的 Mac。还在云端和本地运行之间犹豫?用成本计算器算一算费用。

常见问题

每十亿个参数需要多少 VRAM?

每十亿参数约 2 GB(FP16),每十亿参数约 1.1 GB(Q8),每十亿参数约 0.55-0.6 GB(Q4 量化)。加上约 20% 用于 KV 缓存和 8K 标准上下文的开销,更长上下文则需额外增加。

8 GB显存足以运行本地大语言模型吗?

足够。在 Q4 量化下,8-9B 模型的权重约占 5-6 GB,可完整装入 8 GB 显存的 GPU,并为上下文留出余量。请参阅适合 8 GB 显存的最佳 LLM 排行榜。

24GB显存的GPU(如RTX 3090/4090)能否运行32B模型?

是的,以Q4量化格式,一个32B的密集模型需要约20-22 GB,短上下文情况下可容纳在24 GB显存的显卡上。对于长上下文场景,27B模型更为稳妥。

Mac的统一内存是否算作VRAM?

搭载 Apple Silicon 的 Mac 由 CPU 和 GPU 共享同一个统一内存池,因此,配备 32 GB 内存的 Mac 可以加载比 16 GB 独立 GPU 更大的模型。但请为 macOS 本身预留 8-10 GB 内存。

更多免费工具