入门 11 分钟按 VRAM 分类

12 GB 显存适合运行哪个 LLM ?

直接回答

配备 12 GB 显存时,请选择 120 亿至 140 亿参数的 Q4 量化模型(Gemma 4 12B:7 GB,Qwen 3 14B:9 GB),或 90 亿参数的 Q8 量化模型(10 GB),并为上下文预留 1 至 3 GB。200 亿至 240 亿参数的模型需要 16 GB 显存,270 亿至 350 亿参数的模型需要 24 GB 显存。

12 GB VRAM 可以容纳 120 亿到 140 亿参数的模型,并留有余量。本指南说明了哪些配置可以运行,哪些显卡真正拥有 12 GB,如何为本地 RAG 分配内存,以及何时应升级到 16 GB。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

要升级到16GB显存: RTX 5060 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#12 GB 显存:开始能运行 140 亿参数模型的配置档位

拥有 12GB 显存时,您可以运行 120 亿至 140 亿参数的 Q4 模型,同时为上下文留出充足余量,也可以运行 90 亿参数的 Q8 模型。根据 QuelLLM 目录,Gemma 4 12B 的 Q4 版本大小为 7GB,Qwen 3 14B 的 Q4 版本为 9GB,Qwen 3.5 9B 的 Q8 版本为 10GB。达到 12GB 显存这一档位,就可以告别在推理和写作质量上较为受限的 80 亿至 90 亿参数模型,但还无法运行需要 16GB 显存的 240 亿参数模型。仍然无法运行的是 270 亿至 350 亿参数的模型,其 Q4 版本大小为 16GB 至 21GB。

12 GB 显存能容纳哪些模型(模型权重大小取自 QuelLLM 目录)
模型Q4Q5Q8在 12 GB 显存上运行
Qwen 3.5 9B6 GB7 GB10 GB可使用 Q8 量化,上下文需较短
Gemma 4 12B7 GB9 GB13 GBQ4 或 Q5;Q8 会超出显存容量
Mistral Nemo 12B7 GB9 GB13 GBQ4 或 Q5;Q8 会超出显存容量
Qwen 3 14B9 GB11 GB16 GBQ4 显存余量充足,Q5 显存较紧张
Mistral Small 24B14 GB17 GB26 GB否

如何解读此表:在模型权重基础上加上 KV 缓存和约 1 GB 的余量。因此,Q4 格式的 Qwen 3 14B(9 GB)仅剩下约 2 GB 用于上下文;Q8 格式的 Qwen 3.5 9B(10 GB)则仅剩 1 GB,从而限制了上下文长度。在继续之前,需更正一点:本指南的早期版本曾称在 12 GB 显存上运行 Q8 格式的 9B 模型很宽裕;但目录显示权重为 10 GB,因此余量其实很紧。

#12GB显存显卡:真正具备这一配置的型号

许多显卡系列都有不同容量的版本;仅凭名称并不足以判断。NVIDIA 对 RTX 4070 系列的介绍列明:4070 Ti Super 配备 16 GB 显存,4070 Ti、4070 Super 和 4070 则配备 12 GB。RTX 5070 配备 12 GB GDDR7 显存,采用 192 位总线,而 5070 Ti 则配备 16 GB 显存。RTX 3060 有 12 GB 和 8 GB 两种版本,其中 12 GB 版本更适合本地 AI。AMD 方面,RX 7700 XT 指南将这款显卡归入这一容量档位。

12 GB 显存的显卡及对应指南
显卡容量Guide
RTX 3060(12 GB版本)12 GB GDDR6RTX 3060 12 GB 上的 LLM
RTX 4070、4070 Super、4070 Ti12 GB GDDR6X 或 GDDR6在 RTX 4070 上运行 LLM
RTX 507012GB GDDR7,192位在 RTX 5070 上运行 LLM
RX 7700 XT12 GB(参见指南)在 RX 7700 XT 上运行 LLM

比较时,容量是首要标准,带宽次之:容量相同时,显存越快,生成就越流畅。价格每周都会变化;本站的价格跟踪功能列出了 12 GB 和 16 GB 显卡每 GB 显存的成本,方便判断更高容量档位是否值得多花这笔钱。

#12 GB 显存下,如何按用途选择模型

各使用场景的起步选择
用途模型与量化模型大小需要了解的内容
法语日常对话Mistral Nemo 12B Q59 GB目录中标注为法语;有 3 GB 的余量
推理与写作Qwen 3 14B Q49 GB上下文约 2 GB
多模态(图像)Gemma 4 12B Q47 GB图像模块额外消耗内存
9B 模型的最高质量Qwen 3.5 9B Q810 GB上下文长度仅限于几千个token
速度与轻量Granite 4.2 8B Q56 GB为嵌入模型或长上下文预留5 GB

对于编程任务,目录中能力最强的专用模型所需空间超过 12 GB:Devstral Small 2 24B 的 Q4 版本大小为 14 GB,Qwen3-Coder 30B-A3B 则为 19 GB。使用 12 GB 显存时,请选择 120 亿至 140 亿参数的通用模型,或 Qwen 2.5 Coder 14B;目录标注后者的 Q4 版本大小为 9 GB。您可以结合相关的 8 GB 和 16 GB 显存指南,对这些模型进行比较。

→
选择量化方法的简单标准
若使用超过8000个token的上下文,内存中应保留至少2GB的空闲空间。若内存余量较小,应降低量化等级(例如从Q8降至Q5,从Q5降至Q4),而非减少上下文长度:对于常规使用,Q5的性能损失极小。

#速度:需自行计算

无论显存是 12 GB 还是其他容量,生成速度的上限都是显卡的内存带宽除以生成每个 token 时读取的权重大小。各厂商都会在显卡规格表中公布带宽,单位为 GB/s。只需将这一数值除以模型权重的大小,就能得到理论上限,而实际速度永远无法完全达到这一上限。表格列出了带宽为 100 GB/s 时的上限;请将表中的数值乘以您显卡的带宽数值。

每 100 GB/s 带宽对应的理论速度上限
Q4 量化模型读取的权重每 100 GB/s 带宽对应的理论吞吐量上限300 GB/s 示例
Granite 4.2 8B4.6 GB≈ 22 tokens/s≈ 65 tokens/s
Gemma 4 12B7 GB≈ 14 tokens/s≈ 43 tokens/s
Qwen 3 14B9 GB≈ 11 tokens/s≈ 33 tokens/s
Qwen 3.5 9B Q8 量化版10 GB10 tokens/秒30个标记/秒

这个上限解释了为什么更高精度的量化会降低速度:从 Q4 换成 Q8,读取的权重数据量几乎翻倍。它也解释了为什么两张容量相同的显卡可能表现不同:显存总线很重要。NVIDIA 标明,12 GB 的 RTX 5070 使用 192 位总线,16 GB 的 5070 Ti 使用 256 位总线。由于缺少可比较的来源,我们不公布各款显卡每秒生成的 token 数;要查看您自己硬件上的实际速度,可以运行 ollama run 并加上 --verbose 选项。

#采用模型前,先确认显存是否装得下

  1. 01
    查看模型目录中标注的大小
    在 QuelLLM 模型目录中打开模型页面,记录目标量化格式的权重大小。
  2. 02
    增加安全余量
    为系统额外预留约 1 GB,并根据目标上下文长度,为 KV 缓存预留 1–3 GB。总量必须低于 12 GB。
  3. 03
    启动并测量
    加载模型,提出问题,然后输入 ollama ps:PROCESSOR 列应显示 100% GPU
  4. 04
    必要时进行调整
    请按以下顺序尝试:缩短上下文、量化 KV 缓存,或将量化位数降低一档。

#12 GB 下运行本地 RAG:如何分配内存

本地 RAG 由三个组件组成:用于索引文档的嵌入模型、可选的用于重新排列文本片段的重排序器,以及负责撰写文本的 LLM。前两个组件比 LLM 小得多,可以选择在 GPU 或 CPU 上运行。内存预算的计算方式是将三者的需求相加,再为 KV 缓存预留余量:发送给 LLM 的文本片段越多,其上下文就越长。

三种分配方式
策略布局优点限制
全部放在 GPU 上Q5 量化的 8B 大语言模型(6 GB)+ 嵌入模型 + 重排序模型响应迅速留给长上下文的余量不多
嵌入模型在 CPU 上运行12B LLM 采用 Q4(7 GB)在 GPU 上运行为上下文释放 VRAM索引速度较慢
建立索引后关闭仅在索引时启动 Embedder随后完全释放 VRAM需处理两个步骤

第二种策略通常是最佳选择:索引是一项后台工作,不需要GPU,而回答生成能充分利用VRAM。嵌入模型在索引期间于后台运行,随后进入休眠;使用CPU为一个文档文件夹建立索引需要更长时间,但只需进行一次。这里不提供嵌入模型的大小;各模型的具体数值请参阅嵌入和本地RAG指南。

#12 GB 显存无法做到的事

240亿参数模型
根据模型目录,Mistral Small 24B 在 Q4 量化下占用 14 GB:超出了显存容量。运行 240 亿参数的模型需要 16 GB 显存。
270 亿至 320 亿参数的稠密模型
Qwen 3.8 27B 及同类模型在 Q4 量化下占用16 GB;建议选择24 GB显存。
300至350亿参数的 MoE 模型
Qwen 3.6 35B-A3B占用21GB,GLM 4.7 Flash占用19GB,Qwen3-Coder 30B-A3B也占用19GB:12GB显存容纳不下这些模型,即使它们只读取30亿个活跃参数,因为整个模型都必须驻留在内存中。
在 14B 模型上使用长上下文
Qwen 3 14B 在 Q4 量化下仅剩余约 2 GB:除非对 KV 缓存进行量化,否则不要指望处理数万 token。

Ollama 支持量化 KV 缓存以节省空间:根据其文档,启用 Flash Attention 后,OLLAMA_KV_CACHE_TYPE=q8_0 的内存用量约为默认 f16 的一半。KV 缓存指南详细介绍了这一设置;Ollama 的默认上下文窗口为 4,096 个 token,可通过 OLLAMA_CONTEXT_LENGTH 修改。

16k 上下文长度,KV 缓存采用 q8_0,适用于 14B 模型
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=16384 ollama serve
ollama ps

#12GB或16GB:适合您的选择

在 12 GB 和 16 GB 之间做选择
您的需求12 GB足够吗?为什么
聊天、翻译、摘要使用9B至14B模型是Q4 或 Q5 量化,并留有上下文空间
轻量级 RAG,嵌入模型在 CPU 上运行是7至9 GB的大模型运行在GPU上
200至240亿参数的模型(gpt-oss 20B、Mistral Small 24B)否Q4 量化下,模型权重占13至14 GB
支持长上下文的编程智能体否上下文和模型权重超过12 GB
预算有限,偶尔使用是如果您用不到200至240亿参数的模型,增加的显存就没有用处

#常见问题

常见问题
12 GB VRAM下哪个LLM最佳?+
根据 QuelLLM 目录,可选择采用 Q4 或 Q5 量化的 120 亿至 140 亿参数模型,例如 Gemma 4 12B(Q4 下为 7 GB)、Mistral Nemo 12B 或 Qwen 3 14B(9 GB)。这些模型能为上下文留出余量。采用 Q8 量化的 Qwen 3.5 9B(10 GB)能让 9B 模型发挥最佳精度,但可用的上下文更短。
2026年12GB显存足够吗?+
对于聊天、翻译、摘要和轻量级 RAG,使用不超过 140 亿参数的模型时足够。但对于 200 至 240 亿参数的模型则不够,这类模型在 Q4 量化下占用 13 至 14 GB;对于 270 至 350 亿参数、占用 16 至 21 GB 的模型也不够。后者需要 16 至 24 GB 显存。
14B 模型能在 12 GB 显存下运行吗?+
在 Q4 量化下可以:根据目录,Qwen 3 14B 占用 9 GB,这为 KV 缓存和系统留下了约 2 GB 的空间。Q5(11 GB)过于紧张,Q8(16 GB)则无法运行。请使用 ollama ps 检查模型是否 100% 加载在 GPU 上。
运行LLM,选12 GB还是16 GB?+
如果想运行 200 亿至 240 亿参数的模型,例如 gpt-oss 20B(13 GB)或 Mistral Small 24B(14 GB),并保留一些上下文空间,请选择 16 GB 显存。如果 90 亿至 140 亿参数的模型已能满足需求,继续使用 12 GB 即可。请在本站的价格跟踪页面比较每 GB 显存的价格。
该选哪款 12 GB 显存的显卡?+
首先检查显存容量:RTX 3060 有 12 GB 和 8 GB 两种版本,4070 Ti Super 则有 16 GB。在 12 GB 显存的显卡中,RTX 3060 最便宜,RTX 4070 和 5070 速度最快。当天的价格可在本站的价格追踪页面查看。
300亿参数的MoE模型能完全装入12 GB显存吗?+
不能。MoE 模型每生成一个 token 时只读取部分权重,但仍须完整加载:在 Q4 量化下,Qwen3-Coder 30B-A3B 占用 19 GB,Qwen 3.6 35B-A3B 占用 21 GB。若显存为 12 GB,模型的一部分就会转由 CPU 处理,速度会大幅下降。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。