首页 › 目录 › RTX 3080 Ti (12 GB) 上的最佳 LLM(2026)

RTX 3080 Ti (12 GB) 上的最佳 LLM(2026)

◆ 本地 AI — 1 小时即可在你的电脑上拥有私密、免费的 ChatGPT · 24 欧元 · 或以 49 欧元购买所有套件 →

排名更新于 09/10/2026

RTX 3080 Ti(12 GB GDDR6X,912 GB/s)在所有 12 GB 消费级显卡中拥有最高的显存带宽。运行 Qwen 3 14B Q4 时可达 55–65 tok/s,比 RTX 4070 运行同一模型更快。

本地 AI 的优惠和替代方案

RTX 3080 Ti :可选购的本地 AI 替代方案 — RTX 5060 Ti 16 GB :

如何根据预算选择电脑?看看我们推荐的 800 至 3,500 欧元价位的电脑 →

联盟链接——哪个LLM可能从购买中获得佣金,您无需承担额外费用,这不会影响排名(排名独立制定)。作为亚马逊合作伙伴,哪个LLM会从符合条件的购买中获益。

排名

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8B 参数 · Apache 2.0 · 131 072 tokens ctx

Dense 8B Apache 2.0,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。MMLU 73.84,HumanEval 85.37。发布于 2026 年 4 月 29 日。

排名原因 Dense 8B Apache 2.0,支持 12 种语言(含法语),131k 上下文,GQA 32Q/8KV。MMLU 73.84,HumanEval 85.37。发布于 2026 年 4 月 29 日。
# HuggingFace : ibm-granite/granite-4.1-8b
在RTX 3080 Ti上
Q8
9 GB · 35 tok/s
2

🇺🇸 Gemma 4 12B

Google · 12B 参数 · Apache 2.0 · 262 144 tokens ctx

Gemma 4 12B(Google):稠密多模态模型(文本、视觉、音频),256k 上下文,Q4 约 7 GB VRAM。Apache 2.0,多语言支持。

排名原因 Gemma 4 12B(Google):稠密多模态模型(文本、视觉、音频),256k 上下文,Q4 约 7 GB VRAM。Apache 2.0,多语言支持。
# HuggingFace : google/gemma-4-12B
在RTX 3080 Ti上
Q5_K_M
9 GB · 28 tok/s
3

🇨🇳 Qwen 3 14B

Alibaba · 14B 参数 · Apache 2.0 · 131 072 tokens ctx

采用混合思考的 14B 稠密模型。在 STEM/代码方面与 Qwen 2.5 32B Base 持平。

排名原因 采用混合思考的 14B 稠密模型。在 STEM/代码方面与 Qwen 2.5 32B Base 持平。
ollama run qwen3:14b
在RTX 3080 Ti上
Q5_K_M
11 GB · 20 tok/s
4

🇺🇸 Granite 4.2 8B

IBM · 8B 参数 · Apache 2.0 · 128 000 tokens ctx

Granite 4.2 8B(IBM):Apache 2.0 稠密模型,128k 上下文,Q4 量化约需 4.6 GB 显存。面向企业级多语言聊天、代码和推理。

排名原因 Granite 4.2 8B(IBM):Apache 2.0 稠密模型,128k 上下文,Q4 量化约需 4.6 GB 显存。面向企业级多语言聊天、代码和推理。
ollama pull granite4.2
在RTX 3080 Ti上
Q8
9 GB · 50 tok/s
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B 参数 · Apache 2.0 · 16 000 tokens 上下文

OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。

排名原因 OLMo 3 7B 的「thinking」SFT 微调:逐步推理,16k 上下文,Q4 约需 4.2 GB 显存。100% 开放,Apache 2.0 许可证。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
在RTX 3080 Ti上
Q8
8 GB · 50 tok/s
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B 参数 · MIT · 128 000 tokens ctx

GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。

排名原因 GLM 5.3(智谱):7B 稠密模型,专攻代码与推理,128k 上下文,Q4 量化约需 4.1 GB 显存。轻量级,可在配备 6–8 GB 显存的 GPU 上运行,采用 MIT 许可证。
ollama pull glm-5.3
在RTX 3080 Ti上
Q8
7 GB · 50 tok/s
7

🇺🇸 Phi-4 Reasoning 14B

Microsoft · 14B 参数 · MIT · 上下文长度:32,768 tokens

采用MIT许可的14B推理模型。在Microsoft公布的AIME24/25评测中,以R1-Distill-Llama-70B五分之一的参数量取得了更高分数。

排名原因 采用MIT许可的14B推理模型。在Microsoft公布的AIME24/25评测中,以R1-Distill-Llama-70B五分之一的参数量取得了更高分数。
ollama run phi4-reasoning:14b
在RTX 3080 Ti上
Q5_K_M
11 GB · 20 tok/s

对比表

名次 模型 Params Q4 VRAM 上下文 许可证 在RTX 3080 Ti上
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 35 tok/s · Q8
#2 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 28 tok/s · Q5_K_M
#3 Qwen 3 14B 14B 9 GB 131 072 Apache 2.0 20 tok/s · Q5_K_M
#4 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 50 tok/s · Q8
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 50 tok/s · Q8
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 50 tok/s · Q8
#7 Phi-4 Reasoning 14B 14B 9 GB 32 768 MIT 20 tok/s · Q5_K_M
本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

免费备忘录

在你的机器上运行哪个代码模型?

接收速查表 显存 → 最佳代码模型 → Ollama 命令 (一屏即可查看,可直接复制粘贴)。再使用本地 Copilot 套件,搭建真正可用的运行环境。

本地副驾驶套件 — 可直接粘贴使用的 Ollama + Cline + Aider 配置、调校好的 Modelfiles、故障排除、可终身使用的在线空间 →

无垃圾邮件。1 次点击即可退订。你的数据保留在我们这里(绝不转售)。

排名方法论

筛选条件:Q4_K_M ≤ 11 GB。额外提供 7-14B 模型。12 GB 消费级显存下带宽达 912 GB/s,创纪录

考虑的标准:

  • Q4_K_M ≤ 11 GB
  • Qwen 3 14B Q4,速度为 60 token/秒
  • GDDR6X 带宽高达创纪录的 912 GB/s
  • 12 GB 最佳速度

评分完全透明:请参阅 我们的方法论 ,了解 VRAM/每秒令牌数的计算详情。

常见问题

3080 Ti:在 12 GB 显存显卡中,带宽创纪录?

是的——912 GB/s 对比 4070 Ti 的 504 GB/s,5070 的 672 GB/s。对于利用带宽的 7-14B 模型(FP16 / Q5+),3080 Ti 在 12 GB 显存下仍然是最快的。参见 guide.

3080 Ti 与 4070 Ti Super 哪个更好?

3080 Ti = 12 GB + 912 GB/s。4070 Ti Super = 16 GB + 672 GB/s。追求运行 14B 模型的速度时,选择 3080 Ti;希望运行 24B 模型(Mistral Small)时,选择 4070 Ti Super。参见 4070 Ti Super.

3080 Ti 二手 ~450-500 欧:划算吗?

若追求 7–14B 模型的运行速度,是的。但二手 3090 约 650 €,只需多花 30% 就能获得 24 GB 显存,对运行 LLM 来说好得多。参见 RTX 3090.

3080 Ti 上的 LLM 最佳配置?

Qwen 3 14B Q4(~8 GB)达55-65个token/s,Mistral Nemo 12B Q5(~9 GB)达45个token/s。代码和聊天表现优秀。

深入了解

QuelLLM 套件 按用途分类的参考指南
所有套件,终身使用 — 49 €