入门 14 分钟RTX 30

RTX 3060 12 GB 适合哪个 LLM ?

直接回答

RTX 3060 12 GB 可以毫不妥协地运行 Q4 量化的 70 亿至 140 亿参数模型:Granite 4.2 8B(5.3 GB)、Qwen3.5 9B(6.6 GB)、Gemma 4 12B(7.6 GB)和 Qwen3 14B(9.3 GB)。显存容量决定模型和上下文的大小,360 GB/s 的带宽决定生成速度的上限:8–9B 模型约为 50 token/秒。超过 14B 时,需要使用 MoE 模型并由 CPU 辅助运行,或配备 16–24 GB 显存。

本指南以显卡为出发点:分析其12 GB显存和360 GB/s带宽的性能,参考第三方实测数据,并指出实际限制(上下文长度、27至32B模型、第二块显卡)。每个模型权重均来自模型页面 Ollama,每个生成速率均标注其来源,因为关于该显卡的公开数据常存在矛盾。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5060 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#RTX 3060 12GB 参数

RTX 3060 12 GB 可完整加载 70 到 140 亿参数的模型(Q4:Granite 4.2 8B(5.3 GB 在 Ollama),Qwen3.5 9B(6.6 GB),Gemma 4 12B(7.6 GB)或 Qwen3 14B(9.3 GB))。并非计算能力决定,而是内存。12 GB GDDR6 决定了模型和上下文的最大尺寸。360 GB/s 的带宽决定了速度,因为显卡每处理一个 token 都需要重新读取大部分权重。第三方测试数据显示,80 到 90 亿参数模型每秒可生成 50 到 65 个 token,140 亿参数模型为 26 到 33 个 token,足以支持聊天或代码助手。270 到 320 亿参数的密集模型超出容量,需要 MoE 架构、第二张显卡或更多 VRAM。

架构
Ampere,3 584 个 CUDA 核心,第三代 Tensor Cores(NVIDIA 规格表)。
内存
12 GB GDDR6,192位总线。Tom's Hardware测算其峰值带宽可达360 GB/s。
电源
显卡功耗为170W;NVIDIA标明的系统电源功率为550W。
Ollama 兼容性
计算能力 8.6,Linux 系统需使用 NVIDIA 550 或更高版本的驱动,Windows 系统需使用 551.61 或更高版本的驱动。
价格
这里不列价格,因为价格每周都会变化:请查看本站的“AI GPU 价格追踪”。
→
为什么12 GB 显存比计算速度更重要
NVIDIA 的 RTX 4060 和 5060 均配备 8 GB 显存。Gemma 4 12B 在 Ollama 中占用 7.6 GB:在 8 GB 显存上,只剩 0.4 GB 可供上下文和运行时使用,几乎等于没有余量。在 12 GB 显存上,则还剩约 4 GB。正是这种容量差距,让 3060 12 GB 成为本地 AI 的一个可行显卡选择。

#1. 哪些模型可容纳在12 GB内

估算依据是:模型文件大小,加上上下文缓存,再加上约 1 GB 的运行时余量。表格列出 Ollama 显示的模型权重大小,既包括这张显卡能完整加载的模型,也包括几个大小相近但装不下的模型。不区分显卡的完整列表见专门介绍 12 GB 显存的指南。

Ollama 模型权重大小及能否装入 12 GB 显存(Ollama 默认上下文:4 096 个 token)
模型(Ollama 标签)模型大小公布的上下文长度能装进12GB显存吗?
Granite 4.2 8B (granite4.2:8b)5.3 GB128K是的,有较大余量
Qwen3.5 9B,Q4_K_M 量化(qwen3.5:9b)6.6 GB256K是的,有较大余量
Gemma 4 12B (gemma4:12b)7.6 GB256K是的,约有 4 GB 的内存余量
Qwen3 14B (qwen3:14b)9.3 GB40K是的,需限制上下文长度
Qwen3.5 9B 采用 Q8_0 量化 (qwen3.5:9b-q8_0)11 GB256K比较勉强:约有 1 GB 余量
Qwen3.5 27B (qwen3.5:27b)17 GB256K否
Gemma 4 26B (gemma4:26b)19 GB256K否
Mistral Small 3.2 24B (mistral-small3.2)15 GB128K否

两个陷阱。名称中的数字并不代表模型大小:gemma4:e4b大小为9.6 GB,gemma4:e2b为7.2 GB(在Ollama中),超过12B(7.6 GB)的大小。下载前请确认模型大小。此外,Qwen3.5 9B的Q8_0在技术上可运行,但仅保留约1 GB用于上下文和缓冲区:建议使用Q4_K_M版本,大小为6.6 GB,可释放超过5 GB的内存空间。

#2. 安装 Ollama,并确认全部运行在 GPU 上

  1. 01
    检查 NVIDIA 驱动程序
    Ollama在Linux上要求驱动版本550或更高,在Windows上要求版本551.61或更高。命令nvidia-smi可显示已安装驱动版本及显卡名称。
  2. 02
    安装 Ollama
    在 Windows 和 macOS 上,请使用 ollama.com 的安装程序。在 Linux 上,只需一条命令即可;NVIDIA GPU 会被自动检测到。
  3. 03
    启动第一个 12 GB 模型
    ollama run gemma4:12b télécharge 7,6 Go et lance un modèle qui accepte aussi les images. Pour plus de vitesse, ollama run qwen3.5:9b pèse 6,6 Go.
  4. 04
    检查模型的运行位置
    在第二个终端运行 ollama ps,查看 PROCESSOR 列。期望值为100% GPU。
Linux(Windows:访问ollama.com下载安装程序)
nvidia-smi
curl -fsSL https://ollama.com/install.sh | sh
ollama run gemma4:12b
ollama ps
i
显示值不是「100% GPU」意味着什么
如果PROCESSOR显示的并非100% GPU,说明模型或缓存部分在CPU上运行,导致吞吐量急剧下降。在判断显卡性能不足之前,请先减少上下文长度或将缓存设置为8位(第5节):这是两个最快速的优化手段。

#3. 已公布的速度与理论上限

每生成一个token,显卡都会从显存中重新读取当前使用的权重。因此,理论速度上限等于带宽除以模型权重的大小:360 GB/s除以5.3 GB,得到Granite 4.2 8B的理论上限约为68 tokens/s;Qwen3.5 9B(6.6 GB)约为55 tokens/s,Gemma 4 12B(7.6 GB)约为47 tokens/s,Qwen3 14B(9.3 GB)约为39 tokens/s。这些都是理论上限,绝不是实测值:公开发布的Qwen3.5 9B速度为49.9 tokens/s(约为上限的90%),Qwen3 14B为33.4 tokens/s(约为上限的86%),这证实了内存是限制速度的因素。

已公开的RTX 3060 12 GB生成速度(第三方测量数据,并非本站实测)
模型与量化生成速度(tokens/s)来源与测试条件
Llama 3.1 8B Instruct, Q4_K_M51,3LocalScore(Mozilla Builders 项目)
Llama 3.1 8B Instruct, Q4_K_M64,5Tyolab博客,llama.cpp,上下文长度8192,2026年5月
Llama 7B,Q4_0(3.56 GiB)75,6llama.cpp 社区关于 CUDA GPU 的讨论(llama-bench, WSL2)
Qwen3.5 9B,Q4_K_M49,9Tyolab博客,相同条件
Gemma 4 12B, Q5_K_XL约33Gemma4All,基于社区测试(llama.cpp,Flash Attention,KV缓存 Q8_0)
Qwen3 14B,Q4_K_M33,4Tyolab 博客,上下文缩减至 4 096
Qwen2.5 14B Instruct,Q4_K_M26,6LocalScore

同一模型的数值差异(Llama 3.1 8B 为 51.3 与 64.5 tokens/s)来自测试方法:软件、提示词长度、系统。请只比较同一来源的数值;这些数值都不是本网站实测的。

生成只是体验的一半。LocalScore 测得 Llama 3.1 8B 的提示词处理速度为每秒 1,483 个 token,Qwen2.5 14B 则为每秒 759 个 token。因此,对于一份包含 10,000 个 token 的文档,8B 模型约需等待 7 秒才开始给出回答,14B 模型则约需 13 秒。这个处理过程取决于计算能力,而非带宽。

#4. 35B模型在12GB显存下的情况:MoE模型案例

混合专家(MoE)模型在处理每个 token 时只激活一小部分参数。Qwen3.6 35B-A3B 约激活 30 亿参数,但它在 Ollama 中的模型文件为 23 GB,无法装入 12 GB 显存。llama.cpp 提供的解决办法是 --n-cpu-moe 选项:它将前 N 层专家的权重保留在系统内存中,并让注意力计算继续在 GPU 上进行。

一名用户于 2026 年 9 月 22 日发布了自己的测量结果:RTX 3060 12 GB、Ryzen 5 3600、32 GB DDR4-3200,以及采用 Q4_K_M 量化的 Qwen3.6-35B-A3B(约 21 GB)。他测得,回答短问题时速度为 47 token/s,上下文长度为 12,000 token 时为 45 token/s,为 45,000 token 时为 37 token/s。采用传统的按层分配方式时,同一台机器在 15,000 token 的上下文下速度降至 7.1 token/s(使用 Qwen3-30B-A3B 测量),调整后则为 25.3 token/s。Qwen3.5 和 3.6 系列每四层中只有一层使用传统注意力机制,因此上下文增长时,它们的速度下降幅度较小。

有三点需要注意:这是一个人的测量结果,使用的是 llama.cpp 而非 Ollama;测量以 32 GB 内存为前提;内存速度也会影响结果。他的 DDR4-3200 默认运行在 2400,启用 XMP 或 DOCP 配置后,吞吐量提高了 10% 至 17%。

llama.cpp:专家在 CPU 上运行,注意力在 GPU 上运行
llama-server -m modele-moe-Q4_K_M.gguf -ngl 99 --n-cpu-moe 26 -c 32768 -ctk q8_0 -ctv q8_0

26 是作者为自己的模型设置的数值:数值越高,释放的显存越多,但生成速度也越慢。请找出能让显存保留约 1 GB 空闲空间的最低数值。

#5. 上下文与 KV 缓存

#上下文长度:12 GB 显存首先遇到的瓶颈

当显存容量低于 24 GiB 时,Ollama 默认分配 4,096 个 token 的上下文,而其文档建议智能体和代码工具至少使用 64,000 个 token。在这两个上下文长度之间,每增加一个 token 都会消耗内存。以架构已公开的 Qwen3 14B 为例:40 层、8 个 KV 头,每个头 128 维。采用 16 位精度时,每个 token 的 KV 缓存占用 2(键和值)× 40 × 8 × 128 × 2 字节,即 160 KiB:16,000 个 token 约需 2.4 GiB,24,000 个 token 约需 3.7 GiB。

9.3 GB 的模型相当于 8.7 GiB,而显存容量为 12 GiB。上下文为 16,000 个 token 时,总占用达到 11.1 GiB:留给运行时缓冲区的空间不足 1 GiB,余量太小。上下文为 24,000 个 token 时,总占用达到 12.3 GiB:模型会加载失败,或有一部分转由 CPU 运行。使用 8 位缓存时,24,000 个 token 的缓存仅占用 1.8 GiB,总占用为 10.5 GiB:可以装下。

#8位KV缓存与Flash Attention

Ollama 在软件和显卡支持时会自动启用 Flash Attention;设置 OLLAMA_FLASH_ATTENTION=1 可强制启用。这是使用量化缓存的前提:根据文档,设置 OLLAMA_KV_CACHE_TYPE=q8_0 后,缓存占用的内存约为 f16 缓存的一半,而精度损失很小。该设置全局生效:所有提供服务的模型都使用同一种缓存类型。

Linux:Ollama 服务器,上下文为 16,000 个 token,KV 缓存采用 8 位格式
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 OLLAMA_CONTEXT_LENGTH=16000 ollama serve

#6. 两块RTX 3060 12 GB:共24 GB显存,但并非两倍速度

两块显卡共提供24GB显存,足以容纳Q4量化的27B至32B稠密模型:Qwen3.5 27B在Ollama中占用17GB。当模型无法容纳在单块显卡上时,Ollama会自动将其分配到所有显卡上。在llama.cpp中,默认按层拆分,以流水线方式逐层依次执行。可并行计算的张量模式被标注为实验性功能。

因此,提升的是容量,而不是速度:每生成一个 token,都要重新读取全部权重,每张卡的带宽为 360 GB/s。对于大小为 20 GB 的 32B 模型,估算的速度上限是 360 除以 20,即约 18 token/秒。据 RunAIHome,RTX 3090 单卡提供 24 GB 显存,带宽为 936 GB/s:同一个模型的速度上限便约为 47 token/秒,是前者的 2.6 倍。两张 170 W 的显卡,仅 GPU 部分就合计 340 W,而 NVIDIA 的 550 W 指的是单张卡。

如果您已拥有显卡并希望达到 24 GB 的容量,此配置是合理的。如果从零开始,建议先对比使用单张 16 GB 或 24 GB 显卡的情况。

#7. RTX 3060 8GB、3060 Ti、4060、5060:12GB显存带来的变化

入门级 NVIDIA 显卡:内存(NVIDIA 规格)以及在 Llama 3.1 8B Q4_K_M 下的生成性能(LocalScore)
显卡VRAM内存与总线8B Q4_K_M,tokens/秒Gemma 4 12B (7.6 GB)
RTX 3060 12 GB12 GBGDDR6,192位51,3可以,同时还能为上下文留出约 4 GB 显存
RTX 3060 8 GB8 GBGDDR6,128 位37,0实际使用中不行(仅有 0.4 GB 余量)
RTX 3060 Ti8 GBGDDR6 或 GDDR6X,256 位60,2实际中不可用
RTX 40608 GBGDDR6,128 位38,1实际中不可用
RTX 50608 GBGDDR7,128位—实际中不可用
RTX 5060 Ti16 GB 或 8 GBGDDR7,128位51.2(16 GB)16GB版本支持

RTX 3060 8 GB 并不是 RTX 3060 12 GB 减少内存那么简单:其显存总线从 192 位缩减至 128 位,Tom's Hardware 测得其带宽为 240 GB/s,相比 360 GB/s 降低了 33%。LocalScore 记录其吞吐量为 37.0 tokens/s,相比 51.3 降低了 28%,测试结果基于单一场景,未施加控制条件:RTX 3060 Ti 因其 256 位显存总线表现更优,但其 8 GB 显存使其无法运行 12 或 140 亿参数模型。RTX 5060 通过采用 GDDR7 显存弥补了显存总线较窄的缺陷,显存容量未作调整。仅 RTX 5060 Ti 16 GB 版本在显存容量上超越了 RTX 3060。

!
二手出售信息:只写“RTX 3060”还不够
3060 有 12 GB 和 8 GB 两个版本,而 3060 Ti 只有 8 GB。请要求明确标注 12 GB,并要求提供 nvidia-smi 截图:下面的命令会显示显卡名称及其显存总量。
检查显卡的显存容量
nvidia-smi --query-gpu=name,memory.total --format=csv

#购买 3060 12GB 显卡:何时适合,何时应考虑其他选择

如果符合以下条件,建议购买 3060 12 GB 显卡
您想购买第一块 GPU,用于 Ollama、运行 7 至 14B 模型、聊天、基于文档的 RAG 或编程辅助,而且容量比速度更重要。
以下情况建议选择 16 GB
您希望 Gemma 4 12B 能处理长上下文,或者希望运行 14B 模型时有更多余量。RTX 5060 Ti 16 GB 是起步选择;对比页面给出了差距的具体数值。
若目标为24 GB,则
您的目标是 27B 至 32B 的稠密模型:一张配备 24 GB 显存的显卡可避免将模型拆分到两张卡上,并提供高得多的带宽。
遇到以下情况时,应避免购买或先核实
商品信息未明确注明显存:8 GB 版本的显存容量和带宽都不及 12 GB 版本。

#常见问题

FAQ
RTX 3060 12GB 是否足以在本地运行一个LLM?+
是的,足以运行 70 亿至 140 亿参数的模型,这些模型可以用于聊天、文档摘要和编程辅助。其 12 GB 显存可加载 Q4 量化的 Gemma 4 12B(7.6 GB)或 Qwen3 14B(9.3 GB)。根据已公布的测量结果,这两个模型的速度均约为每秒 33 个 token。但它不足以运行 270 亿至 320 亿参数的稠密模型。
在RTX 3060 12GB上,使用Ollama应优先启动哪个模型?+
首先运行 ollama run gemma4:12b:模型大小为 7.6 GB,标称上下文长度为 256K,支持图像输入,显存约有 4 GB 的余量。若更注重速度,运行 ollama run qwen3.5:9b:模型大小为 6.6 GB,据一项已公布的测量结果,速度可达近 50 tokens/s。然后使用 ollama ps 检查 PROCESSOR 列是否显示 100% GPU。
RTX 3060 12 GB 显卡每秒能处理多少 token?+
已公布的测量结果显示,采用 Q4_K_M 量化的 Llama 3.1 8B 可达到每秒 51–65 个 token,Qwen3.5 9B 约为每秒 50 个 token,14B 模型为每秒 26–33 个 token。理论上限是将 360 GB/s 的带宽除以模型权重大小(以 GB 为单位):Gemma 4 12B 为每秒 47 个 token。这些数值会因软件、上下文和处理器而异。
能否在RTX 3060 12GB显存的设备上运行32B或70B规模的模型?+
采用 Q4 量化的 32B 稠密模型(权重大小为 19 至 20 GB)无法完全装入显存:部分权重会卸载到系统内存,速度随之骤降。70B 模型(约 40 GB)的情况更糟:约 29 GB 的权重需要从内存读取,读取带宽最高为 51 GB/s(DDR4-3200 双通道),因此速度上限约为 1.7 token/秒。Qwen3.6 35B-A3B 等 MoE 模型是例外,但需要 32 GB 内存并使用 llama.cpp。
运行本地 AI 时,两张 RTX 3060 12 GB 能抵得上一张 RTX 3090 吗?+
容量方面,是的:显存总计 24 GB,足以运行采用 Q4 量化的 32B 模型。速度方面,不是:llama.cpp 默认按层拆分模型,并依次执行各层,每生成一个 token 都会以 360 GB/s 的速度重新读取权重。根据 RunAIHome 的数据,RTX 3090 的带宽为 936 GB/s,带宽上限是前者的 2.6 倍。
运行 LLM 应选 RTX 3060 12 GB 还是 RTX 4060 8 GB?+
3060 12 GB:12 GB 对 8 GB 决定了模型大小,Gemma 4 12B(7.6 GB)在仅 8 GB 显存下无余量。4060 功耗更低,显卡功耗为 115 W(NVIDIA 数据为 170 W),但对 LLM 来说并非决定性因素。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。