VRAM 是什么,运行 AI 需要多少? ?
VRAM(视频内存)是焊接在显卡上的内存,专供GPU使用:截至2026年9月,消费级显卡的VRAM容量为8至32GB,而Mac Studio M5 Ultra则拥有高达512GB的统一内存。它直接决定了哪些本地AI模型可以加载:当LLM超出其容量时,会溢出RAM,运行速度下降5至20倍。容量决定了能承载的内容,带宽决定了运行速度。
VRAM,即显存,是直接焊接在显卡上的内存,专供GPU使用。其速度远超电脑的系统内存(RAM),并决定了您本地可以运行哪些AI模型:一个大语言模型(LLM)必须完整加载到显存中才能实现快速响应。截至2026年9月20日,消费级显卡的显存容量范围为8至32GB。本页面将解释什么是显存、如何在三十秒内查看您的显存大小,以及每个显存等级实际上能支持哪些模型。
#显存一分钟速览
VRAM 是 Video Random Access Memory(视频随机存取存储器)的缩写。它和 RAM 一样是一种内存,但位于距图形芯片仅几毫米的位置,并通过位宽很大的总线与芯片相连。它最初的作用是存储 GPU 持续处理的内容:游戏中的纹理、几何数据和图像。在 AI 中,它存储模型权重和模型的工作内存。
两个数值描述了它的特性。容量以 GB 为单位,表示其中能容纳多少数据。带宽以 GB/s 为单位,表示 GPU 能以多快的速度读取其中的数据。玩游戏时,主要关注容量。用于 AI 时,两者都重要:容量决定模型能否加载,带宽决定模型生成文本的速度。
#RAM与VRAM:区别
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
| RAM(系统内存) | VRAM(显存) | |
|---|---|---|
| 位置 | 主板上的内存条 | 焊接在显卡上的芯片 |
| 服务于 | 处理器(CPU) | 图形处理器(GPU) |
| 技术 | DDR4、DDR5 | GDDR6, GDDR6X, GDDR7 |
| 带宽 | DDR5 双通道,传输速率 60 至 100 GB/s | 360 GB/s (RTX 3060) 至 1 792 GB/s (RTX 5090) |
| 常见容量 | 16 到 64 GB | 8 到 32 GB |
| 可扩展 | 可以,通过加装内存条扩容 | 不,它是焊死的 |
约十到二十倍的带宽差距,解释了本页其余内容。AI 模型每生成一个 token,都会重新读取全部权重。从显存读取时,速度很快;从系统内存读取时,同一个模型的运行速度则会降至原来的五分之一到二十分之一。
#了解自己的 VRAM
- Windows系统,无需额外安装
- 打开任务管理器(Ctrl + Shift + Esc),切换到“性能”选项卡,再选择左侧栏中的 GPU。“专用 GPU 内存”一行显示的就是您的 VRAM。旁边的“共享 GPU 内存”并不是 VRAM,而是 Windows 可以借给 GPU 使用的系统内存,速度慢得多。
- Windows,替代方法
- 按 Windows + R,输入 dxdiag,切换到显示选项卡:查看「显示内存(VRAM)」行。
- 配备 NVIDIA 显卡的 Windows 和 Linux 系统
- 在终端中,nvidia-smi 命令会实时显示显存总量和已用显存。模型运行时,适合让这个工具保持打开。
- Linux系统搭配AMD显卡
- 使用命令 rocm-smi --showmeminfo vram,或您所用发行版的图形工具。
- Mac
- 苹果菜单,关于此 Mac:内存项。一款搭载 Apple 芯片的 Mac 没有独立的 VRAM,详情请参见下方专门章节。
#为何本地 AI 依赖于 VRAM
LLM 以三种方式占用 VRAM。首先是权重:参数数量乘以精度。在 4 位量化下,每十亿参数约需 0.6 GB,即 8B 模型约需 5 GB。其次是 KV 缓存,它保存当前对话并随上下文长度增加而增大。最后是运行余量,约为 1 至 2 GB。
如果总内存需求超过显存容量,Ollama 或 llama.cpp 等工具会将模型的一部分卸载到系统内存中:这就是 CPU+GPU offload,llama.cpp 项目文档介绍了这一功能,用于运行大小超过可用显存容量的模型。模型仍能运行,但只要有几层转移到系统内存中,速度就会骤降,因为每个 token 都必须等待系统内存读取,而这种读取比显存读取慢十到二十倍。因此,像配备 24 GB 显存的 RTX 3090 这样的较旧显卡,在本地 AI 中仍比配备 12 GB 显存的新显卡更有用,尽管后者在游戏和 3D 渲染中更快。
#不同模型需要多少显存
该表将我们数据库中的 90 款显卡和芯片与目录中的 249 个模型交叉对照。对于每个档位,表中列出一个经过 Q4_K_M 量化后可完全装入显存的代表性模型。请为上下文预留 1 至 3 GB 的余量:当模型大小接近显卡的显存容量时,对话必须保持简短。
| VRAM | 常见显卡 | 可装入该显存容量的代表性模型 | Q4 量化后的模型大小 | 详细指南 |
|---|---|---|---|---|
| 6 GB | RTX 2060、GTX 1660、RTX 4050 笔记本版 | Qwen 3 8B,使用短上下文时 | 5 GB | 6 GB 显存适合哪些 LLM |
| 8 GB | RTX 3060 Ti、RTX 4060、RTX 5060 | Qwen 3 8B 可轻松运行,Gemma 4 12B 需使用短上下文 | 5GB和7GB | 8GB显存下选择何种LLM |
| 12 GB | RTX 3060 12 GB、RTX 4070、RTX 5070 | Qwen 3 14B | 9 GB | 12 GB 显存下适合使用哪个 LLM |
| 16 GB | RTX 4060 Ti 16 GB,RTX 5070 Ti,RTX 5080,RX 9070 XT | gpt-oss 20B, Mistral Small 3.2 24B | 13 和 14 GB | 16 GB显存下适合的LLM |
| 24 GB | RTX 3090、RTX 4090、RX 7900 XTX | Qwen 3.8 27B, Qwen 3.6 35B-A3B | 16 和 21 GB | 24 GB显存适合哪些LLM |
| 32 GB | RTX 5090 | Qwen 3.6 35B-A3B的Q5版本 | 25 GB | 32 GB 显存适合哪个 LLM? |
| 48 GB | 2 × RTX 3090 或 4090,Mac 64 GB | Llama 3.3 70B | 40 GB | 查看计算器 |
| 96 GB | Mac 128 GB | gpt-oss 120B | 70 GB | 查看计算器 |
#可以增加 VRAM 吗?
对于独立显卡,不可以,无论是哪家厂商。显存芯片是焊接固定的,其容量在设计阶段就已根据GPU确定:要获得更多显存,唯一的办法是更换显卡或再增加一块。本地AI工具可以利用多块显卡,自动将模型分配到各张卡上。Windows或BIOS中声称可以“增加显存”的设置并不会创造额外的内存:它们针对的是下文介绍的两种特殊情况,对已经被系统完整识别的独立显卡没有帮助。
- 集成显卡(iGPU)
- 它没有自己的显存,而是借用一部分系统内存。BIOS通常允许增大这部分分配量(通过UMA Frame Buffer Size或同类设置)。这会增加可用的显存容量,但不会提高速度,速度仍取决于系统内存。
- Windows 的共享 GPU 内存
- Windows 允许独立显卡在显存不足时使用系统内存。对游戏来说,这可以避免崩溃。对 LLM 来说,这就是前面描述的运行缓慢的情况。
真正可调整的空间在软件层面:选择更轻量的量化格式、缩小上下文窗口、量化 KV 缓存。这三种方法往往能节省数 GB 的内存,而无需改动硬件。
#Mac的情况:统一内存
搭载 Apple Silicon 的 Mac 没有独立显存。CPU 和 GPU 共享同一块高带宽内存,称为统一内存。在 M4 这一代中,基础款芯片的带宽为 120 GB/s,M4 Max 最高可达 546 GB/s。GPU 无法使用全部内存,因为 macOS 会预留一部分;实际估算时,24 GB 内存的 Mac 可供模型使用的内存约为 16 GB,64 GB 的 Mac 约为 48 GB,128 GB 的 Mac 约为 96 GB。这部分预留内存在较小配置中占比更高。
该系列此后已有更新:Apple 于 2025 年底推出 M5 芯片(153.6 GB/s,最高 32 GB 内存),随后推出 M5 Pro(307 GB/s,64 GB)和 M5 Max(最高 614 GB/s,128 GB)。Mac Studio 随后搭载了于 2026 年 8 月 25 日公布的 M5 Ultra:Apple 宣称统一内存“最高可达 512 GB”,带宽为“1.2 TB/s”,理论上足以加载一个拥有数千亿参数的模型。同日,Apple 推出了采用 2 纳米制程的 M6,并于 2026 年 9 月 22 日起发售:它仅是一款入门级芯片,这一代没有 Pro 或 Max 变体,内存上限为 32 GB,带宽上限为 170 GB/s,低于一年前推出的 M5 Pro。在购买用于 AI 的“最新一代”Mac 前,需要核实这一点:芯片名称不能说明一切,具体变体比推出年份更重要。
| 芯片 | 带宽 | 最大内存 |
|---|---|---|
| M4 | 120 GB/s | 32 GB |
| M4 Pro | 273 GB/s | 64 GB |
| M4 Max | 410 至 546 GB/s | 128 GB |
| M5 | 153.6 GB/s | 32 GB |
| M5 Pro | 307 GB/s | 64 GB |
| M5 Max | 最高达614 GB/s | 128 GB |
| M5 Ultra | 1.2太字节/秒(1 228.8 GB/s) | 512 GB |
| M6 | 170 GB/s | 32 GB |
这正是高端 Mac 在本地 AI 领域独特之处:没有任何消费级显卡提供 96 GB 可用显存,更不用说 Mac Studio M5 Ultra 的数百 GB 内存容量了。相应的取舍是,在容量相同的情况下,较新的 NVIDIA 显卡仍然更快,因为每 GB 容量对应的带宽更高:RTX 5090 的 32 GB 显存拥有 1 792 GB/s 带宽,远高于 M5 Max 的 128 GB 内存所提供的 614 GB/s,但后者能加载大四倍的模型。
- 本地 AI 硬件配置:我们的设备指南
- 本地 LLM 该选什么 GPU?
- 来源:Apple Newsroom 关于 M6 和 M5 Ultra 的新闻稿(2026 年 8 月 25 日)
- 来源:NVIDIA GeForce RTX 5090 技术规格
- 来源:llama.cpp 的 GitHub 仓库(多 GPU 分配)
#FAQ
内存(RAM)和显存(VRAM)有什么区别?+
8 GB 显存,在2026年是否足够?+
为什么Windows显示的GPU内存比我的显卡实际容量多?+
两块显卡的显存会相加吗?+
对于本地AI,显存容量是否比GPU性能更重要?+
推荐硬件: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — 16 GB VRAM,足以加载一个14B Q4量化模型及其上下文。 所有 AI 硬件 →
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。