入门 11 分钟概念

VRAM 是什么,运行 AI 需要多少? ?

直接回答

VRAM(视频内存)是焊接在显卡上的内存,专供GPU使用:截至2026年9月,消费级显卡的VRAM容量为8至32GB,而Mac Studio M5 Ultra则拥有高达512GB的统一内存。它直接决定了哪些本地AI模型可以加载:当LLM超出其容量时,会溢出RAM,运行速度下降5至20倍。容量决定了能承载的内容,带宽决定了运行速度。

VRAM,即显存,是直接焊接在显卡上的内存,专供GPU使用。其速度远超电脑的系统内存(RAM),并决定了您本地可以运行哪些AI模型:一个大语言模型(LLM)必须完整加载到显存中才能实现快速响应。截至2026年9月20日,消费级显卡的显存容量范围为8至32GB。本页面将解释什么是显存、如何在三十秒内查看您的显存大小,以及每个显存等级实际上能支持哪些模型。

作者: Mohamed Meguedmi·更新于 2026-09-28·已在 Windows、macOS 和 Linux 上测试

#显存一分钟速览

VRAM 是 Video Random Access Memory(视频随机存取存储器)的缩写。它和 RAM 一样是一种内存,但位于距图形芯片仅几毫米的位置,并通过位宽很大的总线与芯片相连。它最初的作用是存储 GPU 持续处理的内容:游戏中的纹理、几何数据和图像。在 AI 中,它存储模型权重和模型的工作内存。

两个数值描述了它的特性。容量以 GB 为单位,表示其中能容纳多少数据。带宽以 GB/s 为单位,表示 GPU 能以多快的速度读取其中的数据。玩游戏时,主要关注容量。用于 AI 时,两者都重要:容量决定模型能否加载,带宽决定模型生成文本的速度。

#RAM与VRAM:区别

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
带宽:制造商规格
RAM(系统内存)VRAM(显存)
位置主板上的内存条焊接在显卡上的芯片
服务于处理器(CPU)图形处理器(GPU)
技术DDR4、DDR5GDDR6, GDDR6X, GDDR7
带宽DDR5 双通道,传输速率 60 至 100 GB/s360 GB/s (RTX 3060) 至 1 792 GB/s (RTX 5090)
常见容量16 到 64 GB8 到 32 GB
可扩展可以,通过加装内存条扩容不,它是焊死的

约十到二十倍的带宽差距,解释了本页其余内容。AI 模型每生成一个 token,都会重新读取全部权重。从显存读取时,速度很快;从系统内存读取时,同一个模型的运行速度则会降至原来的五分之一到二十分之一。

#了解自己的 VRAM

Windows系统,无需额外安装
打开任务管理器(Ctrl + Shift + Esc),切换到“性能”选项卡,再选择左侧栏中的 GPU。“专用 GPU 内存”一行显示的就是您的 VRAM。旁边的“共享 GPU 内存”并不是 VRAM,而是 Windows 可以借给 GPU 使用的系统内存,速度慢得多。
Windows,替代方法
按 Windows + R,输入 dxdiag,切换到显示选项卡:查看「显示内存(VRAM)」行。
配备 NVIDIA 显卡的 Windows 和 Linux 系统
在终端中,nvidia-smi 命令会实时显示显存总量和已用显存。模型运行时,适合让这个工具保持打开。
Linux系统搭配AMD显卡
使用命令 rocm-smi --showmeminfo vram,或您所用发行版的图形工具。
Mac
苹果菜单,关于此 Mac:内存项。一款搭载 Apple 芯片的 Mac 没有独立的 VRAM,详情请参见下方专门章节。
运行模型时监控VRAM(NVIDIA)
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv -l 2

#为何本地 AI 依赖于 VRAM

LLM 以三种方式占用 VRAM。首先是权重:参数数量乘以精度。在 4 位量化下,每十亿参数约需 0.6 GB,即 8B 模型约需 5 GB。其次是 KV 缓存,它保存当前对话并随上下文长度增加而增大。最后是运行余量,约为 1 至 2 GB。

如果总内存需求超过显存容量,Ollama 或 llama.cpp 等工具会将模型的一部分卸载到系统内存中:这就是 CPU+GPU offload,llama.cpp 项目文档介绍了这一功能,用于运行大小超过可用显存容量的模型。模型仍能运行,但只要有几层转移到系统内存中,速度就会骤降,因为每个 token 都必须等待系统内存读取,而这种读取比显存读取慢十到二十倍。因此,像配备 24 GB 显存的 RTX 3090 这样的较旧显卡,在本地 AI 中仍比配备 12 GB 显存的新显卡更有用,尽管后者在游戏和 3D 渲染中更快。

#不同模型需要多少显存

该表将我们数据库中的 90 款显卡和芯片与目录中的 249 个模型交叉对照。对于每个档位,表中列出一个经过 Q4_K_M 量化后可完全装入显存的代表性模型。请为上下文预留 1 至 3 GB 的余量:当模型大小接近显卡的显存容量时,对话必须保持简短。

根据 QuelLLM 模型目录和硬件数据库计算 · 模型权重采用 Q4_K_M 量化 · 20/09/2026
VRAM常见显卡可装入该显存容量的代表性模型Q4 量化后的模型大小详细指南
6 GBRTX 2060、GTX 1660、RTX 4050 笔记本版Qwen 3 8B,使用短上下文时5 GB6 GB 显存适合哪些 LLM
8 GBRTX 3060 Ti、RTX 4060、RTX 5060Qwen 3 8B 可轻松运行,Gemma 4 12B 需使用短上下文5GB和7GB8GB显存下选择何种LLM
12 GBRTX 3060 12 GB、RTX 4070、RTX 5070Qwen 3 14B9 GB12 GB 显存下适合使用哪个 LLM
16 GBRTX 4060 Ti 16 GB,RTX 5070 Ti,RTX 5080,RX 9070 XTgpt-oss 20B, Mistral Small 3.2 24B13 和 14 GB16 GB显存下适合的LLM
24 GBRTX 3090、RTX 4090、RX 7900 XTXQwen 3.8 27B, Qwen 3.6 35B-A3B16 和 21 GB24 GB显存适合哪些LLM
32 GBRTX 5090Qwen 3.6 35B-A3B的Q5版本25 GB32 GB 显存适合哪个 LLM?
48 GB2 × RTX 3090 或 4090,Mac 64 GBLlama 3.3 70B40 GB查看计算器
96 GBMac 128 GBgpt-oss 120B70 GB查看计算器
→
购买前的首要考虑
预算相同时,用于本地 AI 应优先考虑显存容量,再考虑显卡代际。从 12 GB 升级到 16 GB,就能运行 200 亿至 240 亿参数这一档的模型;从 16 GB 升级到 24 GB,则能运行 270 亿至 350 亿参数这一档的模型。任何速度提升都无法弥补模型无法加载的问题。

#可以增加 VRAM 吗?

对于独立显卡,不可以,无论是哪家厂商。显存芯片是焊接固定的,其容量在设计阶段就已根据GPU确定:要获得更多显存,唯一的办法是更换显卡或再增加一块。本地AI工具可以利用多块显卡,自动将模型分配到各张卡上。Windows或BIOS中声称可以“增加显存”的设置并不会创造额外的内存:它们针对的是下文介绍的两种特殊情况,对已经被系统完整识别的独立显卡没有帮助。

集成显卡(iGPU)
它没有自己的显存,而是借用一部分系统内存。BIOS通常允许增大这部分分配量(通过UMA Frame Buffer Size或同类设置)。这会增加可用的显存容量,但不会提高速度,速度仍取决于系统内存。
Windows 的共享 GPU 内存
Windows 允许独立显卡在显存不足时使用系统内存。对游戏来说,这可以避免崩溃。对 LLM 来说,这就是前面描述的运行缓慢的情况。

真正可调整的空间在软件层面:选择更轻量的量化格式、缩小上下文窗口、量化 KV 缓存。这三种方法往往能节省数 GB 的内存,而无需改动硬件。

#Mac的情况:统一内存

搭载 Apple Silicon 的 Mac 没有独立显存。CPU 和 GPU 共享同一块高带宽内存,称为统一内存。在 M4 这一代中,基础款芯片的带宽为 120 GB/s,M4 Max 最高可达 546 GB/s。GPU 无法使用全部内存,因为 macOS 会预留一部分;实际估算时,24 GB 内存的 Mac 可供模型使用的内存约为 16 GB,64 GB 的 Mac 约为 48 GB,128 GB 的 Mac 约为 96 GB。这部分预留内存在较小配置中占比更高。

该系列此后已有更新:Apple 于 2025 年底推出 M5 芯片(153.6 GB/s,最高 32 GB 内存),随后推出 M5 Pro(307 GB/s,64 GB)和 M5 Max(最高 614 GB/s,128 GB)。Mac Studio 随后搭载了于 2026 年 8 月 25 日公布的 M5 Ultra:Apple 宣称统一内存“最高可达 512 GB”,带宽为“1.2 TB/s”,理论上足以加载一个拥有数千亿参数的模型。同日,Apple 推出了采用 2 纳米制程的 M6,并于 2026 年 9 月 22 日起发售:它仅是一款入门级芯片,这一代没有 Pro 或 Max 变体,内存上限为 32 GB,带宽上限为 170 GB/s,低于一年前推出的 M5 Pro。在购买用于 AI 的“最新一代”Mac 前,需要核实这一点:芯片名称不能说明一切,具体变体比推出年份更重要。

Apple Silicon 芯片:统一内存与带宽(M4 至 M6 对比)
芯片带宽最大内存
M4120 GB/s32 GB
M4 Pro273 GB/s64 GB
M4 Max410 至 546 GB/s128 GB
M5153.6 GB/s32 GB
M5 Pro307 GB/s64 GB
M5 Max最高达614 GB/s128 GB
M5 Ultra1.2太字节/秒(1 228.8 GB/s)512 GB
M6170 GB/s32 GB

这正是高端 Mac 在本地 AI 领域独特之处:没有任何消费级显卡提供 96 GB 可用显存,更不用说 Mac Studio M5 Ultra 的数百 GB 内存容量了。相应的取舍是,在容量相同的情况下,较新的 NVIDIA 显卡仍然更快,因为每 GB 容量对应的带宽更高:RTX 5090 的 32 GB 显存拥有 1 792 GB/s 带宽,远高于 M5 Max 的 128 GB 内存所提供的 614 GB/s,但后者能加载大四倍的模型。

#FAQ

内存(RAM)和显存(VRAM)有什么区别?+
RAM 为处理器提供内存,位于主板上;VRAM 为 GPU 提供显存,焊接在显卡上。VRAM 的带宽是 RAM 的十到二十倍,但容量更小,而且无法升级扩容。能完全放入显存的 AI 模型,响应速度远快于因显存不足而需要将部分模型放入系统内存的情况。
8 GB 显存,在2026年是否足够?+
对于 1080p 游戏,大多数情况下足够。对于本地 AI,8 GB 显存可运行 Q4 量化下最多 120 亿参数的模型,例如 Gemma 4 12B,前提是保持较短的上下文;8B 模型则有更充裕的运行空间。这是一个不错的起点,但如果您想运行 200 亿参数及以上的模型,就会很快遇到限制。
为什么Windows显示的GPU内存比我的显卡实际容量多?+
任务管理器会将两个不同的数值相加:专用内存,即焊接在显卡上的实际 VRAM,以及共享内存,即 Windows 允许 GPU 在需要时借用的一部分系统 RAM。要评估 AI 模型在全速运行时能加载多大的模型,只应考虑专用内存:一旦 LLM 超出专用内存、开始使用共享内存,生成速度就会大幅下降,如同在 CPU 上运行一样。
两块显卡的显存会相加吗?+
对于AI而言,是的:如llama.cpp、Ollama 或 vLLM等推理引擎能够将模型的层分布在多个GPU上,因此两块24GB显卡实际可加载高达40-45GB的模型。而对于游戏而言,答案是否定的:每块显卡仍独立使用自己的内存,无法相互叠加。
对于本地AI,显存容量是否比GPU性能更重要?+
对于运行模型来说,是的:容量决定了哪些内容能加载到内存中,而内存带宽随后决定逐个 token 生成的速度,其影响远大于 GPU 的原始计算能力。后者主要影响初始提示的处理和图像生成;这两项任务对纯计算的需求远高于对反复读取内存的需求。

推荐硬件: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) — 16 GB VRAM,足以加载一个14B Q4量化模型及其上下文。 所有 AI 硬件 →

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。