RTX 3060 12 GB 适合哪个 LLM ?
RTX 3060 12 GB 可以毫不妥协地运行 Q4 量化的 70 亿至 140 亿参数模型:Granite 4.2 8B(5.3 GB)、Qwen3.5 9B(6.6 GB)、Gemma 4 12B(7.6 GB)和 Qwen3 14B(9.3 GB)。显存容量决定模型和上下文的大小,360 GB/s 的带宽决定生成速度的上限:8–9B 模型约为 50 token/秒。超过 14B 时,需要使用 MoE 模型并由 CPU 辅助运行,或配备 16–24 GB 显存。
本指南以显卡为出发点:分析其12 GB显存和360 GB/s带宽的性能,参考第三方实测数据,并指出实际限制(上下文长度、27至32B模型、第二块显卡)。每个模型权重均来自模型页面 Ollama,每个生成速率均标注其来源,因为关于该显卡的公开数据常存在矛盾。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: RTX 5060 Ti 16 GB.
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#RTX 3060 12GB 参数
RTX 3060 12 GB 可完整加载 70 到 140 亿参数的模型(Q4:Granite 4.2 8B(5.3 GB 在 Ollama),Qwen3.5 9B(6.6 GB),Gemma 4 12B(7.6 GB)或 Qwen3 14B(9.3 GB))。并非计算能力决定,而是内存。12 GB GDDR6 决定了模型和上下文的最大尺寸。360 GB/s 的带宽决定了速度,因为显卡每处理一个 token 都需要重新读取大部分权重。第三方测试数据显示,80 到 90 亿参数模型每秒可生成 50 到 65 个 token,140 亿参数模型为 26 到 33 个 token,足以支持聊天或代码助手。270 到 320 亿参数的密集模型超出容量,需要 MoE 架构、第二张显卡或更多 VRAM。
- 架构
- Ampere,3 584 个 CUDA 核心,第三代 Tensor Cores(NVIDIA 规格表)。
- 内存
- 12 GB GDDR6,192位总线。Tom's Hardware测算其峰值带宽可达360 GB/s。
- 电源
- 显卡功耗为170W;NVIDIA标明的系统电源功率为550W。
- Ollama 兼容性
- 计算能力 8.6,Linux 系统需使用 NVIDIA 550 或更高版本的驱动,Windows 系统需使用 551.61 或更高版本的驱动。
- 价格
- 这里不列价格,因为价格每周都会变化:请查看本站的“AI GPU 价格追踪”。
#1. 哪些模型可容纳在12 GB内
估算依据是:模型文件大小,加上上下文缓存,再加上约 1 GB 的运行时余量。表格列出 Ollama 显示的模型权重大小,既包括这张显卡能完整加载的模型,也包括几个大小相近但装不下的模型。不区分显卡的完整列表见专门介绍 12 GB 显存的指南。
| 模型(Ollama 标签) | 模型大小 | 公布的上下文长度 | 能装进12GB显存吗? |
|---|---|---|---|
| Granite 4.2 8B (granite4.2:8b) | 5.3 GB | 128K | 是的,有较大余量 |
| Qwen3.5 9B,Q4_K_M 量化(qwen3.5:9b) | 6.6 GB | 256K | 是的,有较大余量 |
| Gemma 4 12B (gemma4:12b) | 7.6 GB | 256K | 是的,约有 4 GB 的内存余量 |
| Qwen3 14B (qwen3:14b) | 9.3 GB | 40K | 是的,需限制上下文长度 |
| Qwen3.5 9B 采用 Q8_0 量化 (qwen3.5:9b-q8_0) | 11 GB | 256K | 比较勉强:约有 1 GB 余量 |
| Qwen3.5 27B (qwen3.5:27b) | 17 GB | 256K | 否 |
| Gemma 4 26B (gemma4:26b) | 19 GB | 256K | 否 |
| Mistral Small 3.2 24B (mistral-small3.2) | 15 GB | 128K | 否 |
两个陷阱。名称中的数字并不代表模型大小:gemma4:e4b大小为9.6 GB,gemma4:e2b为7.2 GB(在Ollama中),超过12B(7.6 GB)的大小。下载前请确认模型大小。此外,Qwen3.5 9B的Q8_0在技术上可运行,但仅保留约1 GB用于上下文和缓冲区:建议使用Q4_K_M版本,大小为6.6 GB,可释放超过5 GB的内存空间。
#2. 安装 Ollama,并确认全部运行在 GPU 上
- 01检查 NVIDIA 驱动程序Ollama在Linux上要求驱动版本550或更高,在Windows上要求版本551.61或更高。命令nvidia-smi可显示已安装驱动版本及显卡名称。
- 02安装 Ollama在 Windows 和 macOS 上,请使用 ollama.com 的安装程序。在 Linux 上,只需一条命令即可;NVIDIA GPU 会被自动检测到。
- 03启动第一个 12 GB 模型ollama run gemma4:12b télécharge 7,6 Go et lance un modèle qui accepte aussi les images. Pour plus de vitesse, ollama run qwen3.5:9b pèse 6,6 Go.
- 04检查模型的运行位置在第二个终端运行 ollama ps,查看 PROCESSOR 列。期望值为100% GPU。
#3. 已公布的速度与理论上限
每生成一个token,显卡都会从显存中重新读取当前使用的权重。因此,理论速度上限等于带宽除以模型权重的大小:360 GB/s除以5.3 GB,得到Granite 4.2 8B的理论上限约为68 tokens/s;Qwen3.5 9B(6.6 GB)约为55 tokens/s,Gemma 4 12B(7.6 GB)约为47 tokens/s,Qwen3 14B(9.3 GB)约为39 tokens/s。这些都是理论上限,绝不是实测值:公开发布的Qwen3.5 9B速度为49.9 tokens/s(约为上限的90%),Qwen3 14B为33.4 tokens/s(约为上限的86%),这证实了内存是限制速度的因素。
| 模型与量化 | 生成速度(tokens/s) | 来源与测试条件 |
|---|---|---|
| Llama 3.1 8B Instruct, Q4_K_M | 51,3 | LocalScore(Mozilla Builders 项目) |
| Llama 3.1 8B Instruct, Q4_K_M | 64,5 | Tyolab博客,llama.cpp,上下文长度8192,2026年5月 |
| Llama 7B,Q4_0(3.56 GiB) | 75,6 | llama.cpp 社区关于 CUDA GPU 的讨论(llama-bench, WSL2) |
| Qwen3.5 9B,Q4_K_M | 49,9 | Tyolab博客,相同条件 |
| Gemma 4 12B, Q5_K_XL | 约33 | Gemma4All,基于社区测试(llama.cpp,Flash Attention,KV缓存 Q8_0) |
| Qwen3 14B,Q4_K_M | 33,4 | Tyolab 博客,上下文缩减至 4 096 |
| Qwen2.5 14B Instruct,Q4_K_M | 26,6 | LocalScore |
同一模型的数值差异(Llama 3.1 8B 为 51.3 与 64.5 tokens/s)来自测试方法:软件、提示词长度、系统。请只比较同一来源的数值;这些数值都不是本网站实测的。
生成只是体验的一半。LocalScore 测得 Llama 3.1 8B 的提示词处理速度为每秒 1,483 个 token,Qwen2.5 14B 则为每秒 759 个 token。因此,对于一份包含 10,000 个 token 的文档,8B 模型约需等待 7 秒才开始给出回答,14B 模型则约需 13 秒。这个处理过程取决于计算能力,而非带宽。
#4. 35B模型在12GB显存下的情况:MoE模型案例
混合专家(MoE)模型在处理每个 token 时只激活一小部分参数。Qwen3.6 35B-A3B 约激活 30 亿参数,但它在 Ollama 中的模型文件为 23 GB,无法装入 12 GB 显存。llama.cpp 提供的解决办法是 --n-cpu-moe 选项:它将前 N 层专家的权重保留在系统内存中,并让注意力计算继续在 GPU 上进行。
一名用户于 2026 年 9 月 22 日发布了自己的测量结果:RTX 3060 12 GB、Ryzen 5 3600、32 GB DDR4-3200,以及采用 Q4_K_M 量化的 Qwen3.6-35B-A3B(约 21 GB)。他测得,回答短问题时速度为 47 token/s,上下文长度为 12,000 token 时为 45 token/s,为 45,000 token 时为 37 token/s。采用传统的按层分配方式时,同一台机器在 15,000 token 的上下文下速度降至 7.1 token/s(使用 Qwen3-30B-A3B 测量),调整后则为 25.3 token/s。Qwen3.5 和 3.6 系列每四层中只有一层使用传统注意力机制,因此上下文增长时,它们的速度下降幅度较小。
有三点需要注意:这是一个人的测量结果,使用的是 llama.cpp 而非 Ollama;测量以 32 GB 内存为前提;内存速度也会影响结果。他的 DDR4-3200 默认运行在 2400,启用 XMP 或 DOCP 配置后,吞吐量提高了 10% 至 17%。
26 是作者为自己的模型设置的数值:数值越高,释放的显存越多,但生成速度也越慢。请找出能让显存保留约 1 GB 空闲空间的最低数值。
#5. 上下文与 KV 缓存
#上下文长度:12 GB 显存首先遇到的瓶颈
当显存容量低于 24 GiB 时,Ollama 默认分配 4,096 个 token 的上下文,而其文档建议智能体和代码工具至少使用 64,000 个 token。在这两个上下文长度之间,每增加一个 token 都会消耗内存。以架构已公开的 Qwen3 14B 为例:40 层、8 个 KV 头,每个头 128 维。采用 16 位精度时,每个 token 的 KV 缓存占用 2(键和值)× 40 × 8 × 128 × 2 字节,即 160 KiB:16,000 个 token 约需 2.4 GiB,24,000 个 token 约需 3.7 GiB。
9.3 GB 的模型相当于 8.7 GiB,而显存容量为 12 GiB。上下文为 16,000 个 token 时,总占用达到 11.1 GiB:留给运行时缓冲区的空间不足 1 GiB,余量太小。上下文为 24,000 个 token 时,总占用达到 12.3 GiB:模型会加载失败,或有一部分转由 CPU 运行。使用 8 位缓存时,24,000 个 token 的缓存仅占用 1.8 GiB,总占用为 10.5 GiB:可以装下。
#8位KV缓存与Flash Attention
Ollama 在软件和显卡支持时会自动启用 Flash Attention;设置 OLLAMA_FLASH_ATTENTION=1 可强制启用。这是使用量化缓存的前提:根据文档,设置 OLLAMA_KV_CACHE_TYPE=q8_0 后,缓存占用的内存约为 f16 缓存的一半,而精度损失很小。该设置全局生效:所有提供服务的模型都使用同一种缓存类型。
#6. 两块RTX 3060 12 GB:共24 GB显存,但并非两倍速度
两块显卡共提供24GB显存,足以容纳Q4量化的27B至32B稠密模型:Qwen3.5 27B在Ollama中占用17GB。当模型无法容纳在单块显卡上时,Ollama会自动将其分配到所有显卡上。在llama.cpp中,默认按层拆分,以流水线方式逐层依次执行。可并行计算的张量模式被标注为实验性功能。
因此,提升的是容量,而不是速度:每生成一个 token,都要重新读取全部权重,每张卡的带宽为 360 GB/s。对于大小为 20 GB 的 32B 模型,估算的速度上限是 360 除以 20,即约 18 token/秒。据 RunAIHome,RTX 3090 单卡提供 24 GB 显存,带宽为 936 GB/s:同一个模型的速度上限便约为 47 token/秒,是前者的 2.6 倍。两张 170 W 的显卡,仅 GPU 部分就合计 340 W,而 NVIDIA 的 550 W 指的是单张卡。
如果您已拥有显卡并希望达到 24 GB 的容量,此配置是合理的。如果从零开始,建议先对比使用单张 16 GB 或 24 GB 显卡的情况。
#7. RTX 3060 8GB、3060 Ti、4060、5060:12GB显存带来的变化
| 显卡 | VRAM | 内存与总线 | 8B Q4_K_M,tokens/秒 | Gemma 4 12B (7.6 GB) |
|---|---|---|---|---|
| RTX 3060 12 GB | 12 GB | GDDR6,192位 | 51,3 | 可以,同时还能为上下文留出约 4 GB 显存 |
| RTX 3060 8 GB | 8 GB | GDDR6,128 位 | 37,0 | 实际使用中不行(仅有 0.4 GB 余量) |
| RTX 3060 Ti | 8 GB | GDDR6 或 GDDR6X,256 位 | 60,2 | 实际中不可用 |
| RTX 4060 | 8 GB | GDDR6,128 位 | 38,1 | 实际中不可用 |
| RTX 5060 | 8 GB | GDDR7,128位 | — | 实际中不可用 |
| RTX 5060 Ti | 16 GB 或 8 GB | GDDR7,128位 | 51.2(16 GB) | 16GB版本支持 |
RTX 3060 8 GB 并不是 RTX 3060 12 GB 减少内存那么简单:其显存总线从 192 位缩减至 128 位,Tom's Hardware 测得其带宽为 240 GB/s,相比 360 GB/s 降低了 33%。LocalScore 记录其吞吐量为 37.0 tokens/s,相比 51.3 降低了 28%,测试结果基于单一场景,未施加控制条件:RTX 3060 Ti 因其 256 位显存总线表现更优,但其 8 GB 显存使其无法运行 12 或 140 亿参数模型。RTX 5060 通过采用 GDDR7 显存弥补了显存总线较窄的缺陷,显存容量未作调整。仅 RTX 5060 Ti 16 GB 版本在显存容量上超越了 RTX 3060。
#购买 3060 12GB 显卡:何时适合,何时应考虑其他选择
- 如果符合以下条件,建议购买 3060 12 GB 显卡
- 您想购买第一块 GPU,用于 Ollama、运行 7 至 14B 模型、聊天、基于文档的 RAG 或编程辅助,而且容量比速度更重要。
- 以下情况建议选择 16 GB
- 您希望 Gemma 4 12B 能处理长上下文,或者希望运行 14B 模型时有更多余量。RTX 5060 Ti 16 GB 是起步选择;对比页面给出了差距的具体数值。
- 若目标为24 GB,则
- 您的目标是 27B 至 32B 的稠密模型:一张配备 24 GB 显存的显卡可避免将模型拆分到两张卡上,并提供高得多的带宽。
- 遇到以下情况时,应避免购买或先核实
- 商品信息未明确注明显存:8 GB 版本的显存容量和带宽都不及 12 GB 版本。
- 来源:NVIDIA 的 RTX 3060 和 3060 Ti 规格表
- 来源:Ollama 文档,上下文长度
- 来源:Ollama文档,支持的GPU列表
- 来源:llama.cpp,服务器选项(--n-cpu-moe、KV 缓存)
- 数据来源:LocalScore,基于RTX 3060 12 GB的测试结果
#常见问题
RTX 3060 12GB 是否足以在本地运行一个LLM?+
在RTX 3060 12GB上,使用Ollama应优先启动哪个模型?+
RTX 3060 12 GB 显卡每秒能处理多少 token?+
能否在RTX 3060 12GB显存的设备上运行32B或70B规模的模型?+
运行本地 AI 时,两张 RTX 3060 12 GB 能抵得上一张 RTX 3090 吗?+
运行 LLM 应选 RTX 3060 12 GB 还是 RTX 4060 8 GB?+
价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。