RTX 3080 / 3080 Ti(10–12 GB)适合运行哪个 LLM ?
运行本地大语言模型时,配备 12 GB 显存的 RTX 3080 或 3080 Ti 可以运行 Q8 量化的 Qwen 3.5 9B(10 GB)和 Q4 量化的 Gemma 4 12B(7 GB),并留有余量;运行 7B 模型时,速度约为每秒 140 个 token:RTX 3080 10 GB 在 llama.cpp 测试中测得每秒 139.7 个 token。10 GB 版本仅限于 Q4 量化的 8B 至 9B 模型。这三款显卡都无法将 Q4 量化的 20B 模型(13 GB)完全加载到显存中,必须将一部分放入系统内存。
有三款显卡使用 RTX 3080 这一名称:2020 年 9 月推出的 10 GB 版、2022 年 1 月推出的 12 GB 版,以及 2021 年 6 月推出的 12 GB 3080 Ti。它们采用相同的芯片,但显存不同,而显存决定了您能运行哪些模型。本指南的速度数据依据一项公开测量,容量数据则依据官方规格说明。
您正在挑选电脑吗? 按预算推荐 →
本指南的备选购买方案: RTX 5080 16 GB.
迷你 PC 是一台完整的机器:请检查可用内存和引擎兼容性。它不能替代 macOS/MLX 或 CUDA。
移动场景: 本地 AI 选哪款笔记本电脑 →
联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。
#用 RTX 3080 和 RTX 3080 Ti 运行本地 LLM:三种版本
配备 12 GB 显存的 RTX 3080 或 3080 Ti 可以流畅运行 Q4 量化的 120 亿参数模型,或 Q8 量化的 90 亿参数模型;10 GB 版本则仅限于 Q4 量化的 70 亿至 90 亿参数模型。根据 QuelLLM 目录,Gemma 4 12B 在 Q4 下占用 7 GB,Q5 下占用 9 GB;Qwen 3.5 9B 在 Q4 下占用 6 GB,Q8 下占用 10 GB,一旦加入上下文,至少需要 12 GB 显存。在速度方面,这些显卡属于前几代产品中最快的一批:根据 llama.cpp 的公开表格,3080 10 GB 运行 Q4_0 量化的 70 亿参数模型时,生成速度为每秒 139.7 个 token,接近 RTX 3060 12 GB(每秒 75.6 个 token)的两倍。因此,为 LLM 选择 RTX 3080 时,决定因素始终是显存容量,而不是速度。
- RTX 3080 10 GB
- 2020年9月,8704个CUDA核心,10GB GDDR6X显存,320位总线,带宽达760GB/s,显卡功耗为320W。
- RTX 3080 12 GB
- 2022年1月,8960个核心,12 GB GDDR6X显存,384位总线,带宽达912 GB/s,功耗350 W,带宽比此前提升约20%。
- RTX 3080 Ti
- 2021年6月,10240个核心,12 GB GDDR6X显存,384位总线,与3080 12 GB型号相同,因此预期带宽一致,功耗350 W。
计算速度上限有助于理解:文本生成时,每生成一个 token 都要读取模型权重,因此带宽决定了最高速度。3080 12 GB 和 Ti 相比 10 GB 版本,带宽提高了 20%;但 3080 Ti 主要增加的是计算核心,这些核心对提示词读取速度的提升大于对生成速度的提升。
#3080 10 GB、12 GB 或 3080 Ti:该如何选择
| 标准 | 3080 10 GB | 3080 12 GB | 3080 Ti 12 GB |
|---|---|---|---|
| CUDA 核心 | 8 704 | 8 960 | 10 240 |
| 内存 | 10 GB GDDR6X | 12 GB GDDR6X | 12 GB GDDR6X |
| 总线/带宽 | 320 位 / 760 GB/s | 384位 / 912 GB/s | 384 位,预期带宽相同 |
| 显卡功耗 | 320 W | 350 W | 350 W |
| 基于 Llama 2 7B Q4_0 的生成 | 139.7 tok/s(实测) | 估算:最多约 167 | 估算:接近 12 GB 版本 |
对于本地 AI,3080 Ti 和 3080 12 GB 可以互换使用:两者都有 12 GB 显存、相同的总线,生成速度也非常接近。对这两张显卡的速度估算是一个上限,计算方法是将 10 GB 版本测得的效率应用于 912 GB/s 的带宽:实际测量中,总线同样为 384 位的 3090 达到每秒 158.2 个 token。因此,请选择两者中更便宜的一款,不要被核心数量左右。10 GB 版本则因容量而低一个档次:其 10 GB 显存无法容纳 90 亿参数模型的 Q8 量化版本。
#不同内存容量下的兼容模型
| 模型与量化 | 模型大小 | 3080 10 GB | 3080 12 GB / Ti |
|---|---|---|---|
| Qwen 3.5 9B 量化为Q4 | 6 GB | 可以,并留有上下文空间 | 是的,支持大量上下文 |
| Gemma 4 12B(Q4 量化) | 7 GB | 可以,但上下文长度需适中 | 可以,余量充足 |
| Gemma 4 12B 使用Q5量化 | 9 GB | 非常勉强 | 可以,但上下文长度需适中 |
| Qwen 3.5 9B Q8 量化版 | 10 GB | 否 | 可以,但上下文长度有限 |
| Q4 量化的 gpt-oss 20B | 13 GB | 否 | 否:超出1 GB |
这张表有两点值得注意。首先,与一些人的预期不同,10 GB 显存的 3080 能容纳 Q4 量化的 Gemma 4 12B(7 GB),还剩 3 GB 用于上下文,足以应对中等长度的对话。其次,12 GB 与 16 GB 之间的差距很明显:gpt-oss 20B 这类约 200 亿参数的模型在 Q4 量化下占用 13 GB,无法完全装入这三张显卡中任何一张的显存。如果您的目标是这类模型,就需要一张显存为 16 GB 或以上的显卡;关于 12 GB 显存的指南详细介绍了在恰好 12 GB 显存下能做些什么。
#安装、供电和设置
RTX 3080 和 3080 Ti 都属于 Ollama 列出的计算能力为 8.6 的显卡;Ollama 要求使用 550 或更新版本的驱动。这些显卡有一点需要特别注意:NVIDIA 规格表标注的显卡功耗为 350 W,10 GB 版本为 320 W,并建议配备 750 W 的系统电源。安装显卡前,请检查您的电源,并使用不同的电源线分别连接显卡的供电接口。
- 01检查电源检查电源的额定功率是否达到 750 W,并确认其具备您的显卡型号所需的供电接口。
- 02安装驱动和Ollama安装 550 或更高版本的驱动程序,然后安装 Ollama,再启动您选择的模型。
- 03设置内存在10 GB版本中,启动服务器时设置OLLAMA_FLASH_ATTENTION=1和OLLAMA_KV_CACHE_TYPE=q8_0:文档明确指出,当启用Flash Attention时,K/V缓存可以进行量化。
- 04检查使用 nvidia-smi 监控显卡在负载下的显存使用情况和温度:这些显卡比新款显卡更容易发热。
#速度:公开测试数据及其外推结果
llama.cpp 的协作基准测试表测量的是 Q4_0 量化的 Llama 2 7B(文件大小为 3.56 GiB,即 3.82 GB)。其中,配备 10 GB 显存的 RTX 3080 生成速度为每秒 139.65 个 token,提示词处理速度为每秒 5 014 个 token。启用 Flash Attention 后,生成速度仍为每秒 139.95 个 token,但提示词处理速度升至每秒 5 570 个 token,约提升 11%。760 GB/s 的带宽理论上可支持接近每秒 199 个 token:实测达到这一上限的 70%。即使采用相同芯片,吞吐量也会受到驱动程序、系统和显卡制造商的影响。
| 显卡 | 内存 | 生成速度 (tok/s) |
|---|---|---|
| RTX 3060 12 GB | 12 GB | 75,6 |
| RTX 3080 10 GB | 10 GB | 139,7 |
| RTX 3090 | 24 GB | 158,2 |
按文件大小进行比例推算,3080 10 GB 在运行 Q4 量化的 Qwen 3.5 9B(6 GB)时,最多可达到约每秒 89 个 token;运行 Q4 量化的 Gemma 4 12B(7 GB)时,最多可达到约每秒 76 个 token。这些是理论上限,并非实测数据。在 3080 12 GB 上,Qwen 3.5 9B 的 Q8 量化版本(10 GB)理论上仍会低于每秒 65 个 token,这个速度已经很充裕。无论哪种情况,这些显卡的生成速度都远超人的阅读速度;限制因素是容量,而非速度。
提示词处理速度是这些显卡的第二大优势。3080 10 GB 的速度为每秒 5,014 个 token,读取一份 10,000 个 token 的文档约需两秒;启用 Flash Attention 后,速度为每秒 5,570 个 token,所需时间略短。这两项理论计算都假设处理速率保持恒定。这大约是 3060 12 GB(每秒 2,138 个 token)的两倍。当多人共用同一台机器时,提示词处理速度的影响更大:每次请求都必须先重新读取自己的上下文,才能生成任何回答,正是在这一环节,与性能较低显卡的差距会进一步拉大。对于处理大篇幅文档的 RAG,或每次请求都要重读大文件的代码助手,这能切实改善使用体验,其效果比生成速度的差距明显得多,因为生成速度本来就已远高于人的阅读速度。
#2026年购买:这些显卡的市场定位
与一张全新的 16 GB 显卡相比,二手 RTX 3080 的优势是价格适中、速度快,但显存不足。配备 24 GB 显存的 3090 实测速度为每秒 158.2 个 token,因此,对于希望运行 200 亿至 300 亿参数模型的用户,它是二手市场中的一个有力选择。二手显卡价格每周都会变化:本站的价格跟踪会记录每款显卡的最低价,以及每 GB 显存的价格,比在这里写一个固定数字更有参考价值。
| 目标模型 | 所需内存 | 适合的显卡 |
|---|---|---|
| Q4 量化的 8B–9B 模型 | 6 GB模型权重 | 任何 8 GB 显存的显卡 |
| 12B 量化到Q4或9B 量化到Q8 | 模型权重占用 7 至 10 GB | 3080 12 GB 或 Ti,或 3080 10 GB 用于 Q4 |
| Q4 量化的 20B 模型(gpt-oss 20B) | 13 GB 权重 | 显存为 16 GB 或以上的显卡 |
#2026 结论
- 二手 3080 12 GB 或 3080 Ti
- 如果价格仍明显低于一张显存为 12 至 16 GB 的全新显卡,这会是很好的选择:12 GB 显存、速度快,运行 9B Q8 或 12B Q4 模型后还有余量。
- 3080 10 GB
- 适用于 Q4 量化的 80 亿至 120 亿参数模型。无法容纳 Q8 量化的 90 亿参数模型,也没有上下文余量;如果您更看重容量而非速度,12 GB 显存的 RTX 3060 可能更合适。
- 购买时
- 检查电源、标注的显存容量是 10 GB 还是 12 GB,以及风扇的状态;这些显卡曾在高温下运行,而且已经使用了好几年。
#常见问题
运行 LLM 应选 RTX 3080 10 GB 版还是 12 GB 版?+
运行 LLM,选 RTX 3080 Ti 还是 RTX 3090?+
RTX 3080 12 GB 是否能运行 gpt-oss 20B?+
RTX 3080 上每秒可处理多少 token?+
RTX 3080 Ti 需要什么电源?+
Ollama 能否在 RTX 3080 上运行?+
RTX 3080在2026年是否还值得购买?+
- 来源:llama.cpp 在 CUDA 上的性能表格
- 来源:NVIDIA 的 RTX 3080 和 RTX 3080 Ti 规格表
- 来源:Ollama 支持的 NVIDIA 显卡
- 来源:Ollama FAQ(Flash Attention,K/V缓存)
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。