12 GB 显存适合运行哪个 LLM ?
配备 12 GB 显存时,请选择 120 亿至 140 亿参数的 Q4 量化模型(Gemma 4 12B:7 GB,Qwen 3 14B:9 GB),或 90 亿参数的 Q8 量化模型(10 GB),并为上下文预留 1 至 3 GB。200 亿至 240 亿参数的模型需要 16 GB 显存,270 亿至 350 亿参数的模型需要 24 GB 显存。
12 GB VRAM 可以容纳 120 亿到 140 亿参数的模型,并留有余量。本指南说明了哪些配置可以运行,哪些显卡真正拥有 12 GB,如何为本地 RAG 分配内存,以及何时应升级到 16 GB。
您正在挑选电脑吗? 按预算推荐 →
要升级到16GB显存: RTX 5060 Ti 16 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#12 GB 显存:开始能运行 140 亿参数模型的配置档位
拥有 12GB 显存时,您可以运行 120 亿至 140 亿参数的 Q4 模型,同时为上下文留出充足余量,也可以运行 90 亿参数的 Q8 模型。根据 QuelLLM 目录,Gemma 4 12B 的 Q4 版本大小为 7GB,Qwen 3 14B 的 Q4 版本为 9GB,Qwen 3.5 9B 的 Q8 版本为 10GB。达到 12GB 显存这一档位,就可以告别在推理和写作质量上较为受限的 80 亿至 90 亿参数模型,但还无法运行需要 16GB 显存的 240 亿参数模型。仍然无法运行的是 270 亿至 350 亿参数的模型,其 Q4 版本大小为 16GB 至 21GB。
| 模型 | Q4 | Q5 | Q8 | 在 12 GB 显存上运行 |
|---|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 7 GB | 10 GB | 可使用 Q8 量化,上下文需较短 |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | Q4 或 Q5;Q8 会超出显存容量 |
| Mistral Nemo 12B | 7 GB | 9 GB | 13 GB | Q4 或 Q5;Q8 会超出显存容量 |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | Q4 显存余量充足,Q5 显存较紧张 |
| Mistral Small 24B | 14 GB | 17 GB | 26 GB | 否 |
如何解读此表:在模型权重基础上加上 KV 缓存和约 1 GB 的余量。因此,Q4 格式的 Qwen 3 14B(9 GB)仅剩下约 2 GB 用于上下文;Q8 格式的 Qwen 3.5 9B(10 GB)则仅剩 1 GB,从而限制了上下文长度。在继续之前,需更正一点:本指南的早期版本曾称在 12 GB 显存上运行 Q8 格式的 9B 模型很宽裕;但目录显示权重为 10 GB,因此余量其实很紧。
#12GB显存显卡:真正具备这一配置的型号
许多显卡系列都有不同容量的版本;仅凭名称并不足以判断。NVIDIA 对 RTX 4070 系列的介绍列明:4070 Ti Super 配备 16 GB 显存,4070 Ti、4070 Super 和 4070 则配备 12 GB。RTX 5070 配备 12 GB GDDR7 显存,采用 192 位总线,而 5070 Ti 则配备 16 GB 显存。RTX 3060 有 12 GB 和 8 GB 两种版本,其中 12 GB 版本更适合本地 AI。AMD 方面,RX 7700 XT 指南将这款显卡归入这一容量档位。
| 显卡 | 容量 | Guide |
|---|---|---|
| RTX 3060(12 GB版本) | 12 GB GDDR6 | RTX 3060 12 GB 上的 LLM |
| RTX 4070、4070 Super、4070 Ti | 12 GB GDDR6X 或 GDDR6 | 在 RTX 4070 上运行 LLM |
| RTX 5070 | 12GB GDDR7,192位 | 在 RTX 5070 上运行 LLM |
| RX 7700 XT | 12 GB(参见指南) | 在 RX 7700 XT 上运行 LLM |
比较时,容量是首要标准,带宽次之:容量相同时,显存越快,生成就越流畅。价格每周都会变化;本站的价格跟踪功能列出了 12 GB 和 16 GB 显卡每 GB 显存的成本,方便判断更高容量档位是否值得多花这笔钱。
#12 GB 显存下,如何按用途选择模型
| 用途 | 模型与量化 | 模型大小 | 需要了解的内容 |
|---|---|---|---|
| 法语日常对话 | Mistral Nemo 12B Q5 | 9 GB | 目录中标注为法语;有 3 GB 的余量 |
| 推理与写作 | Qwen 3 14B Q4 | 9 GB | 上下文约 2 GB |
| 多模态(图像) | Gemma 4 12B Q4 | 7 GB | 图像模块额外消耗内存 |
| 9B 模型的最高质量 | Qwen 3.5 9B Q8 | 10 GB | 上下文长度仅限于几千个token |
| 速度与轻量 | Granite 4.2 8B Q5 | 6 GB | 为嵌入模型或长上下文预留5 GB |
对于编程任务,目录中能力最强的专用模型所需空间超过 12 GB:Devstral Small 2 24B 的 Q4 版本大小为 14 GB,Qwen3-Coder 30B-A3B 则为 19 GB。使用 12 GB 显存时,请选择 120 亿至 140 亿参数的通用模型,或 Qwen 2.5 Coder 14B;目录标注后者的 Q4 版本大小为 9 GB。您可以结合相关的 8 GB 和 16 GB 显存指南,对这些模型进行比较。
#速度:需自行计算
无论显存是 12 GB 还是其他容量,生成速度的上限都是显卡的内存带宽除以生成每个 token 时读取的权重大小。各厂商都会在显卡规格表中公布带宽,单位为 GB/s。只需将这一数值除以模型权重的大小,就能得到理论上限,而实际速度永远无法完全达到这一上限。表格列出了带宽为 100 GB/s 时的上限;请将表中的数值乘以您显卡的带宽数值。
| Q4 量化模型 | 读取的权重 | 每 100 GB/s 带宽对应的理论吞吐量上限 | 300 GB/s 示例 |
|---|---|---|---|
| Granite 4.2 8B | 4.6 GB | ≈ 22 tokens/s | ≈ 65 tokens/s |
| Gemma 4 12B | 7 GB | ≈ 14 tokens/s | ≈ 43 tokens/s |
| Qwen 3 14B | 9 GB | ≈ 11 tokens/s | ≈ 33 tokens/s |
| Qwen 3.5 9B Q8 量化版 | 10 GB | 10 tokens/秒 | 30个标记/秒 |
这个上限解释了为什么更高精度的量化会降低速度:从 Q4 换成 Q8,读取的权重数据量几乎翻倍。它也解释了为什么两张容量相同的显卡可能表现不同:显存总线很重要。NVIDIA 标明,12 GB 的 RTX 5070 使用 192 位总线,16 GB 的 5070 Ti 使用 256 位总线。由于缺少可比较的来源,我们不公布各款显卡每秒生成的 token 数;要查看您自己硬件上的实际速度,可以运行 ollama run 并加上 --verbose 选项。
#采用模型前,先确认显存是否装得下
- 01查看模型目录中标注的大小在 QuelLLM 模型目录中打开模型页面,记录目标量化格式的权重大小。
- 02增加安全余量为系统额外预留约 1 GB,并根据目标上下文长度,为 KV 缓存预留 1–3 GB。总量必须低于 12 GB。
- 03启动并测量加载模型,提出问题,然后输入 ollama ps:PROCESSOR 列应显示 100% GPU
- 04必要时进行调整请按以下顺序尝试:缩短上下文、量化 KV 缓存,或将量化位数降低一档。
#12 GB 下运行本地 RAG:如何分配内存
本地 RAG 由三个组件组成:用于索引文档的嵌入模型、可选的用于重新排列文本片段的重排序器,以及负责撰写文本的 LLM。前两个组件比 LLM 小得多,可以选择在 GPU 或 CPU 上运行。内存预算的计算方式是将三者的需求相加,再为 KV 缓存预留余量:发送给 LLM 的文本片段越多,其上下文就越长。
| 策略 | 布局 | 优点 | 限制 |
|---|---|---|---|
| 全部放在 GPU 上 | Q5 量化的 8B 大语言模型(6 GB)+ 嵌入模型 + 重排序模型 | 响应迅速 | 留给长上下文的余量不多 |
| 嵌入模型在 CPU 上运行 | 12B LLM 采用 Q4(7 GB)在 GPU 上运行 | 为上下文释放 VRAM | 索引速度较慢 |
| 建立索引后关闭 | 仅在索引时启动 Embedder | 随后完全释放 VRAM | 需处理两个步骤 |
第二种策略通常是最佳选择:索引是一项后台工作,不需要GPU,而回答生成能充分利用VRAM。嵌入模型在索引期间于后台运行,随后进入休眠;使用CPU为一个文档文件夹建立索引需要更长时间,但只需进行一次。这里不提供嵌入模型的大小;各模型的具体数值请参阅嵌入和本地RAG指南。
#12 GB 显存无法做到的事
- 240亿参数模型
- 根据模型目录,Mistral Small 24B 在 Q4 量化下占用 14 GB:超出了显存容量。运行 240 亿参数的模型需要 16 GB 显存。
- 270 亿至 320 亿参数的稠密模型
- Qwen 3.8 27B 及同类模型在 Q4 量化下占用16 GB;建议选择24 GB显存。
- 300至350亿参数的 MoE 模型
- Qwen 3.6 35B-A3B占用21GB,GLM 4.7 Flash占用19GB,Qwen3-Coder 30B-A3B也占用19GB:12GB显存容纳不下这些模型,即使它们只读取30亿个活跃参数,因为整个模型都必须驻留在内存中。
- 在 14B 模型上使用长上下文
- Qwen 3 14B 在 Q4 量化下仅剩余约 2 GB:除非对 KV 缓存进行量化,否则不要指望处理数万 token。
Ollama 支持量化 KV 缓存以节省空间:根据其文档,启用 Flash Attention 后,OLLAMA_KV_CACHE_TYPE=q8_0 的内存用量约为默认 f16 的一半。KV 缓存指南详细介绍了这一设置;Ollama 的默认上下文窗口为 4,096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 修改。
#12GB或16GB:适合您的选择
| 您的需求 | 12 GB足够吗? | 为什么 |
|---|---|---|
| 聊天、翻译、摘要使用9B至14B模型 | 是 | Q4 或 Q5 量化,并留有上下文空间 |
| 轻量级 RAG,嵌入模型在 CPU 上运行 | 是 | 7至9 GB的大模型运行在GPU上 |
| 200至240亿参数的模型(gpt-oss 20B、Mistral Small 24B) | 否 | Q4 量化下,模型权重占13至14 GB |
| 支持长上下文的编程智能体 | 否 | 上下文和模型权重超过12 GB |
| 预算有限,偶尔使用 | 是 | 如果您用不到200至240亿参数的模型,增加的显存就没有用处 |
- 来源:Ollama 常见问题解答(上下文、KV 缓存)
- 来源:NVIDIA 的 RTX 4070 系列规格表
- 来源:NVIDIA 的 RTX 5070 系列产品页面
- QuelLLM 模型目录(模型的显存占用大小)
#常见问题
12 GB VRAM下哪个LLM最佳?+
2026年12GB显存足够吗?+
14B 模型能在 12 GB 显存下运行吗?+
运行LLM,选12 GB还是16 GB?+
该选哪款 12 GB 显存的显卡?+
300亿参数的MoE模型能完全装入12 GB显存吗?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。