进阶 11 分钟RTX 30

RTX 3080 / 3080 Ti(10–12 GB)适合运行哪个 LLM ?

直接回答

运行本地大语言模型时,配备 12 GB 显存的 RTX 3080 或 3080 Ti 可以运行 Q8 量化的 Qwen 3.5 9B(10 GB)和 Q4 量化的 Gemma 4 12B(7 GB),并留有余量;运行 7B 模型时,速度约为每秒 140 个 token:RTX 3080 10 GB 在 llama.cpp 测试中测得每秒 139.7 个 token。10 GB 版本仅限于 Q4 量化的 8B 至 9B 模型。这三款显卡都无法将 Q4 量化的 20B 模型(13 GB)完全加载到显存中,必须将一部分放入系统内存。

有三款显卡使用 RTX 3080 这一名称:2020 年 9 月推出的 10 GB 版、2022 年 1 月推出的 12 GB 版,以及 2021 年 6 月推出的 12 GB 3080 Ti。它们采用相同的芯片,但显存不同,而显存决定了您能运行哪些模型。本指南的速度数据依据一项公开测量,容量数据则依据官方规格说明。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5080 16 GB.

迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#用 RTX 3080 和 RTX 3080 Ti 运行本地 LLM:三种版本

配备 12 GB 显存的 RTX 3080 或 3080 Ti 可以流畅运行 Q4 量化的 120 亿参数模型,或 Q8 量化的 90 亿参数模型;10 GB 版本则仅限于 Q4 量化的 70 亿至 90 亿参数模型。根据 QuelLLM 目录,Gemma 4 12B 在 Q4 下占用 7 GB,Q5 下占用 9 GB;Qwen 3.5 9B 在 Q4 下占用 6 GB,Q8 下占用 10 GB,一旦加入上下文,至少需要 12 GB 显存。在速度方面,这些显卡属于前几代产品中最快的一批:根据 llama.cpp 的公开表格,3080 10 GB 运行 Q4_0 量化的 70 亿参数模型时,生成速度为每秒 139.7 个 token,接近 RTX 3060 12 GB(每秒 75.6 个 token)的两倍。因此,为 LLM 选择 RTX 3080 时,决定因素始终是显存容量,而不是速度。

RTX 3080 10 GB
2020年9月,8704个CUDA核心,10GB GDDR6X显存,320位总线,带宽达760GB/s,显卡功耗为320W。
RTX 3080 12 GB
2022年1月,8960个核心,12 GB GDDR6X显存,384位总线,带宽达912 GB/s,功耗350 W,带宽比此前提升约20%。
RTX 3080 Ti
2021年6月,10240个核心,12 GB GDDR6X显存,384位总线,与3080 12 GB型号相同,因此预期带宽一致,功耗350 W。

计算速度上限有助于理解:文本生成时,每生成一个 token 都要读取模型权重,因此带宽决定了最高速度。3080 12 GB 和 Ti 相比 10 GB 版本,带宽提高了 20%;但 3080 Ti 主要增加的是计算核心,这些核心对提示词读取速度的提升大于对生成速度的提升。

#3080 10 GB、12 GB 或 3080 Ti:该如何选择

RTX 3080 的三种型号
标准3080 10 GB3080 12 GB3080 Ti 12 GB
CUDA 核心8 7048 96010 240
内存10 GB GDDR6X12 GB GDDR6X12 GB GDDR6X
总线/带宽320 位 / 760 GB/s384位 / 912 GB/s384 位,预期带宽相同
显卡功耗320 W350 W350 W
基于 Llama 2 7B Q4_0 的生成139.7 tok/s(实测)估算:最多约 167估算:接近 12 GB 版本

对于本地 AI,3080 Ti 和 3080 12 GB 可以互换使用:两者都有 12 GB 显存、相同的总线,生成速度也非常接近。对这两张显卡的速度估算是一个上限,计算方法是将 10 GB 版本测得的效率应用于 912 GB/s 的带宽:实际测量中,总线同样为 384 位的 3090 达到每秒 158.2 个 token。因此,请选择两者中更便宜的一款,不要被核心数量左右。10 GB 版本则因容量而低一个档次:其 10 GB 显存无法容纳 90 亿参数模型的 Q8 量化版本。

#不同内存容量下的兼容模型

哪些模型能装入 10 GB 和 12 GB 显存(模型大小依据 QuelLLM 目录)
模型与量化模型大小3080 10 GB3080 12 GB / Ti
Qwen 3.5 9B 量化为Q46 GB可以,并留有上下文空间是的,支持大量上下文
Gemma 4 12B(Q4 量化)7 GB可以,但上下文长度需适中可以,余量充足
Gemma 4 12B 使用Q5量化9 GB非常勉强可以,但上下文长度需适中
Qwen 3.5 9B Q8 量化版10 GB否可以,但上下文长度有限
Q4 量化的 gpt-oss 20B13 GB否否:超出1 GB

这张表有两点值得注意。首先,与一些人的预期不同,10 GB 显存的 3080 能容纳 Q4 量化的 Gemma 4 12B(7 GB),还剩 3 GB 用于上下文,足以应对中等长度的对话。其次,12 GB 与 16 GB 之间的差距很明显:gpt-oss 20B 这类约 200 亿参数的模型在 Q4 量化下占用 13 GB,无法完全装入这三张显卡中任何一张的显存。如果您的目标是这类模型,就需要一张显存为 16 GB 或以上的显卡;关于 12 GB 显存的指南详细介绍了在恰好 12 GB 显存下能做些什么。

#安装、供电和设置

RTX 3080 和 3080 Ti 都属于 Ollama 列出的计算能力为 8.6 的显卡;Ollama 要求使用 550 或更新版本的驱动。这些显卡有一点需要特别注意:NVIDIA 规格表标注的显卡功耗为 350 W,10 GB 版本为 320 W,并建议配备 750 W 的系统电源。安装显卡前,请检查您的电源,并使用不同的电源线分别连接显卡的供电接口。

  1. 01
    检查电源
    检查电源的额定功率是否达到 750 W,并确认其具备您的显卡型号所需的供电接口。
  2. 02
    安装驱动和Ollama
    安装 550 或更高版本的驱动程序,然后安装 Ollama,再启动您选择的模型。
  3. 03
    设置内存
    在10 GB版本中,启动服务器时设置OLLAMA_FLASH_ATTENTION=1和OLLAMA_KV_CACHE_TYPE=q8_0:文档明确指出,当启用Flash Attention时,K/V缓存可以进行量化。
  4. 04
    检查
    使用 nvidia-smi 监控显卡在负载下的显存使用情况和温度:这些显卡比新款显卡更容易发热。
Linux:使用指定的内存设置启动 Ollama
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#速度:公开测试数据及其外推结果

llama.cpp 的协作基准测试表测量的是 Q4_0 量化的 Llama 2 7B(文件大小为 3.56 GiB,即 3.82 GB)。其中,配备 10 GB 显存的 RTX 3080 生成速度为每秒 139.65 个 token,提示词处理速度为每秒 5 014 个 token。启用 Flash Attention 后,生成速度仍为每秒 139.95 个 token,但提示词处理速度升至每秒 5 570 个 token,约提升 11%。760 GB/s 的带宽理论上可支持接近每秒 199 个 token:实测达到这一上限的 70%。即使采用相同芯片,吞吐量也会受到驱动程序、系统和显卡制造商的影响。

与其他显卡的对比(Llama 2 7B Q4_0,生成)
显卡内存生成速度 (tok/s)
RTX 3060 12 GB12 GB75,6
RTX 3080 10 GB10 GB139,7
RTX 309024 GB158,2

按文件大小进行比例推算,3080 10 GB 在运行 Q4 量化的 Qwen 3.5 9B(6 GB)时,最多可达到约每秒 89 个 token;运行 Q4 量化的 Gemma 4 12B(7 GB)时,最多可达到约每秒 76 个 token。这些是理论上限,并非实测数据。在 3080 12 GB 上,Qwen 3.5 9B 的 Q8 量化版本(10 GB)理论上仍会低于每秒 65 个 token,这个速度已经很充裕。无论哪种情况,这些显卡的生成速度都远超人的阅读速度;限制因素是容量,而非速度。

提示词处理速度是这些显卡的第二大优势。3080 10 GB 的速度为每秒 5,014 个 token,读取一份 10,000 个 token 的文档约需两秒;启用 Flash Attention 后,速度为每秒 5,570 个 token,所需时间略短。这两项理论计算都假设处理速率保持恒定。这大约是 3060 12 GB(每秒 2,138 个 token)的两倍。当多人共用同一台机器时,提示词处理速度的影响更大:每次请求都必须先重新读取自己的上下文,才能生成任何回答,正是在这一环节,与性能较低显卡的差距会进一步拉大。对于处理大篇幅文档的 RAG,或每次请求都要重读大文件的代码助手,这能切实改善使用体验,其效果比生成速度的差距明显得多,因为生成速度本来就已远高于人的阅读速度。

#2026年购买:这些显卡的市场定位

与一张全新的 16 GB 显卡相比,二手 RTX 3080 的优势是价格适中、速度快,但显存不足。配备 24 GB 显存的 3090 实测速度为每秒 158.2 个 token,因此,对于希望运行 200 亿至 300 亿参数模型的用户,它是二手市场中的一个有力选择。二手显卡价格每周都会变化:本站的价格跟踪会记录每款显卡的最低价,以及每 GB 显存的价格,比在这里写一个固定数字更有参考价值。

根据您的目标模型选择对应的显卡
目标模型所需内存适合的显卡
Q4 量化的 8B–9B 模型6 GB模型权重任何 8 GB 显存的显卡
12B 量化到Q4或9B 量化到Q8模型权重占用 7 至 10 GB3080 12 GB 或 Ti,或 3080 10 GB 用于 Q4
Q4 量化的 20B 模型(gpt-oss 20B)13 GB 权重显存为 16 GB 或以上的显卡

#2026 结论

二手 3080 12 GB 或 3080 Ti
如果价格仍明显低于一张显存为 12 至 16 GB 的全新显卡,这会是很好的选择:12 GB 显存、速度快,运行 9B Q8 或 12B Q4 模型后还有余量。
3080 10 GB
适用于 Q4 量化的 80 亿至 120 亿参数模型。无法容纳 Q8 量化的 90 亿参数模型,也没有上下文余量;如果您更看重容量而非速度,12 GB 显存的 RTX 3060 可能更合适。
购买时
检查电源、标注的显存容量是 10 GB 还是 12 GB,以及风扇的状态;这些显卡曾在高温下运行,而且已经使用了好几年。

#常见问题

常见问题
运行 LLM 应选 RTX 3080 10 GB 版还是 12 GB 版?+
若价格相近,建议选择12GB版本:其额外2GB显存可支持Qwen 3.5 9B的Q8(10GB权重)模型,并为Gemma 4 12B提供足够空间;而10GB版本仅能支持Q4下的8-9B模型,或在中等上下文条件下运行Q4的12B模型。其更宽的显存总线额外提供了约20%的带宽。
运行 LLM,选 RTX 3080 Ti 还是 RTX 3090?+
RTX 3090 拥有 24 GB 显存,相比 12 GB 更大,且在 llama.cpp 测试中每秒可处理 158.2 个 token,支持 Q4 格式的 200 到 300 亿参数模型。若仅使用 120 亿参数或更小的模型,RTX 3080 Ti 即可满足。对于这些模型,生成速度保持相近:性能差异主要体现在显存容量上。
RTX 3080 12 GB 是否能运行 gpt-oss 20B?+
无法完全装入显卡显存。目录显示,该模型在 Q4 量化下需要 13 GB,比 3080 12 GB 的显存多 1 GB:模型会分布在显存和系统 RAM 中运行,速度会大幅下降。要全速运行,需要一张配备 16 GB 显存的显卡。
RTX 3080 上每秒可处理多少 token?+
llama.cpp 公开表格显示,Llama 2 7B 在 Q4_0 下,RTX 3080 10GB 的吞吐量为 139.7 tokens/秒。更重的模型会更慢:理论估算中,9B 模型在 Q4 下约为 89 tokens/秒,12B 模型在 Q4 下约为 76 tokens/秒。12GB 和 Ti 版本应稍快一些,但尚未有公开实测数据。
RTX 3080 Ti 需要什么电源?+
NVIDIA 标明该显卡的功耗为 350 W,并建议 RTX 3080 和 RTX 3080 Ti 都使用 750 W 的系统电源。650 W 电源低于这一推荐值。还应准备合适的连接器,并确保机箱通风良好,因为这些显卡在负载下会散发大量热量。
Ollama 能否在 RTX 3080 上运行?+
是的。Ollama 列出了 RTX 3080 和 RTX 3080 Ti 作为计算能力为 8.6 的显卡,并要求使用 550 或更高版本的驱动程序。在 10 GB 版本上,启用 Flash Attention 以及 K/V 缓存的量化以节省长上下文场景下的内存。
RTX 3080在2026年是否还值得购买?+
如果其二手价格仍明显低于显存容量相当的新卡,那就值得购买。它的速度很出色,但关键在于 10 或 12 GB 的显存容量:请查看本站的价格追踪,并与 16 GB 显存的显卡比较后再做决定。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。