入门 11 分钟RTX 30

RTX 3070 / 3070 Ti(8 GB)显卡上适合的LLM ?

直接回答

RTX 3070 或 3070 Ti 提供 8 GB VRAM:在 Q4 量化下,它能在 VRAM 中保留最多 80 亿至 90 亿参数的模型(Granite 4.2 8B 为 5.3 GB,Qwen 3.5 9B 为 6.6 GB),但无法容纳 120 亿参数及以上的模型。3070 Ti 的带宽为 608 GB/s,高于 448 GB/s,在相同容量下生成速度更快。没有已发布的测量数据:吞吐量均为估算值。

RTX 3070和3070 Ti配备8GB显存,运行80亿参数模型仍算不错,但显存容量是它们的限制。本指南列出了真正能装入显存的模型及其精确文件大小、基于带宽估算的生成速度、上下文长度限制,以及与相近显卡的差距。您还将了解到何时该升级到12GB或16GB显存。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-29·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: RTX 5060 Ti 16 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#用 RTX 3070 和 RTX 3070 Ti 运行本地 LLM:8 GB 显存能做什么

对于本地 LLM,RTX 3070 或 3070 Ti 的价值在于其 8 GB 显存,而这一容量决定了一切:最多 80 亿至 90 亿参数的 Q4 量化模型可以放得下,120 亿参数及以上的模型则放不下。根据 Ollama 模型库,Granite 4.2 8B 大小为 5.3 GB,Qwen3 8B 为 5.2 GB,Qwen 3.5 9B 为 6.6 GB;Qwen3 14B(9.3 GB)和 gpt-oss 20B(14 GB)都超出了显卡的显存容量。3070 Ti 的显存带宽为 608 GB/s,而 3070 为 448 GB/s,因此前者生成速度更快,但显存容量相同。

内存
8 GB 显存,256 位总线:3070 使用 GDDR6,带宽为 448 GB/s;3070 Ti 使用 GDDR6X,带宽为 608 GB/s,数据依据维基百科的表格和 NVIDIA。
计算
根据维基百科,3070 显卡拥有 5888 个 CUDA 核心,3070 Ti 拥有 6144 个 CUDA 核心。
功耗
根据 NVIDIA 的规格,3070 的显卡功耗为 220 W,所需电源功率为 650 W;3070 Ti 的显卡功耗为 290 W,所需电源功率为 750 W。所需电源功率高于有时看到的 550 W。

#能装入 8 GB 显存的模型

权重大小取自 Ollama 模型库中的文件,查阅日期为 2026 年 9 月 29 日。余量是指 8 GB 显存中,扣除模型权重后、尚未计入上下文、缓存和引擎缓冲区时剩余的空间;如果这张显卡还负责驱动您的屏幕,余量也必须满足显示所需的显存。

适用于 RTX 3070 / 3070 Ti 的模型(Ollama 文件,除非另有说明,否则均为 Q4 量化)
模型Ollama 文件毛利率结论
Qwen 3.5 4B3.4 GB4.6 GB余量充足,可以使用长上下文
Qwen3 8B5.2 GB2.8 GB舒适
Granite 4.2 8B5.3 GB2.7 GB舒适
Qwen 3.5 9B6.6 GB1.4 GB可运行,需限制上下文
Gemma 4 12B7.6 GB0.4 GB没有剩余空间:无法容纳实用的上下文
Qwen3 14B9.3 GB缺少 1.3 GB无法容纳
gpt-oss 20B14 GB缺少6 GB无法容纳

最稳妥的起点是一个 80 亿参数的模型:Granite 4.2 8B 或 Qwen3 8B 可为上下文留出近 3 GB 空间。Qwen 3.5 9B 是实际使用中的上限:1.4 GB 的余量足以支持简短对话,但不足以处理长文档。本地 RAG 会额外引入一个嵌入模型:bge-m3 在 Ollama 中占用 1.2 GB,与 Granite 4.2 8B 合计占用 6.5 GB,剩余 1.5 GB 可供其他部分使用。

#在 RTX 3070 上安装 Ollama

  1. 01
    检查驱动程序
    在终端中运行 nvidia-smi:驱动版本需为 550 或以上(Windows 下为 551.61),且显存总容量应显示为约 8 GB。
  2. 02
    安装 Ollama
    请从官方网站安装 Ollama。本地 API 的监听地址为 http://localhost:11434。
  3. 03
    运行模型
    运行 ollama run granite4.2:8b:下载 5.3 GB 仅需一次。
  4. 04
    检查分配情况
    在第二个终端中执行 ollama ps:Processeur 列应显示 100% GPU。若显示 CPU/GPU 混合分配,则说明模型或上下文超出了显存容量,部分内容被转移到了系统内存中。
  5. 05
    调整上下文
    通过 OLLAMA_CONTEXT_LENGTH 设置上下文长度,然后再次运行 ollama ps。启动服务器时,将 OLLAMA_FLASH_ATTENTION 设置为 1,将 OLLAMA_KV_CACHE_TYPE 设置为 q8_0,以节省显存。
基本命令
ollama run granite4.2:8b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#吞吐速度:根据带宽可以预期怎样的表现

没有任何主流基准测试网站发布 RTX 3070 的测量结果,因此以下数值是估算值,而非实测数据。该方法基于生成速度受带宽限制这一事实:理论上限约等于带宽除以模型权重的大小。对于 Granite 4.2 8B(5.3 GB),448 ÷ 5.3 得出 3070 上约每秒 85 个 token,608 ÷ 5.3 得出 3070 Ti 上约每秒 115 个 token。对于 Qwen 3.5 9B(6.6 GB),理论上限分别为每秒 68 和 92 个 token。

llama.cpp 的社区排行榜可以将这些理论上限换算为大致的性能量级。运行 Llama 2 7B Q4_0 时,RTX 3060 Ti 8 GB 是一款采用 256 位总线、与 3070 接近的显卡,未启用 Flash Attention 时每秒生成 92.23 个 token,启用后为 96.50 个。RTX 3060 12 GB 的带宽为 360 GB/s,两种情况下的生成速度分别为每秒 75.57 和 76.92 个 token:速度比(1.22)与带宽比(448 ÷ 360 = 1.24)接近。因此,3070 的生成速度应该接近 3060 Ti,运行 7B 模型时约为每秒 90 至 95 个 token;3070 Ti 则预计高出约 35%,即每秒 120 至 130 个 token。这些都是估算值。

生成速度估算(以每秒令牌计,理论上限,RTX 3070 / 3070 Ti)
模型Ollama 文件3070 的理论上限(448 GB/s)3070 Ti 上限(608 GB/s)
Qwen 3.5 4B3.4 GB132179
Granite 4.2 8B5.3 GB85115
Qwen 3.5 9B6.6 GB6892
Gemma 4 12B7.6 GB5980

根据其他来源对显卡的测量,实际吞吐量通常约为这些上限的 70% 至 80%:因此,Granite 4.2 8B 在 3070 上预计可达到每秒 55 至 65 个 token。无论确切数值是多少,这些速度都超过了人类阅读速度:3070 的限制在于显存容量,而非速度。

#8 GB显存的限制:上下文、RAG和大型模型

Ollama 根据显存容量设置默认上下文长度:其文档指出,显存低于 24 GiB 时默认使用 4k 个 token,并建议智能体、网页搜索和代码工具至少使用 64000 个 token。在 8 GB 显存上,使用 80 亿参数模型时想达到 64000 个 token 的上下文并不现实:KV 缓存会存储每个 token 的注意力键和值,消耗剩余的内存空间。根据 Ollama 的常见问题解答,对缓存使用 q8_0 量化可将其内存占用降至 f16 的约一半,精度损失非常小:这是应首先启用的设置。

12B 至 24B 参数的模型
Gemma 4 12B(7.6 GB)没有为上下文留下空间;Qwen3 14B(9.3 GB)和gpt-oss 20B(14 GB)则无法装入显存。这些模型会将超出显存的部分卸载到系统内存,速度随之下降。
长上下文
使用 Qwen 3.5 9B 时,1.4 GB 的剩余容量很快就会耗尽:请将上下文长度保持在几千个 token,并留意 ollama ps 的输出。
多阶段RAG
Granite 4.2 8B 和 bge-m3 占用 6.5 GB:添加重排序模型或第二个模型将超出容量。
Fine-tuning
据Unsloth介绍,使用4位QLoRA时,30亿参数模型的绝对最低内存需求为3.5GB,80亿参数模型为6GB:8B模型也只能勉强装下,批大小需设为1,且上下文要短。

要将显存占用控制在 8 GB 以下,一个简单方法只需三项设置。首先,选择模型文件大小能留出至少 2 GB 余量的模型:Granite 4.2 8B 或 Qwen3 8B。其次,启用 q8_0 量化缓存和 Flash Attention;Flash Attention 官方仓库注明它兼容 3070 等 Ampere 架构 GPU。最后,分阶段增加上下文长度,从 4 000 到 8 000,再到 16 000 个 token,每一步都重新运行 ollama ps:一旦显示有部分计算由 CPU 承担,就退回上一个阶段。这样逐步增加,可以避免在对话进行到一半时才发现已经达到限制。

#3070 与其他 8 至 16 GB 显存显卡的对比

用于本地 LLM 的同级及相近显卡(NVIDIA、Hardware Corner)
显卡内存带宽它所实现的改变
RTX 30708 GB GDDR6448 GB/s80至90亿参数的模型
RTX 3070 Ti8 GB GDDR6X608 GB/s相同显存,更快生成
RTX 3060 12 GB12 GB GDDR6360 GB/s还能运行120至140亿参数的模型
RTX 4060 Ti 16 GB16 GB288 GB/s还能运行 gpt-oss 20B,但速度更慢

该表格凸显了权衡关系。3060 12GB 的带宽比 3070 低 20%,但显存多出 4GB:它能够支持 Qwen3 14B(9.3GB),而 3070 无法支持。4060 Ti 16GB 增加了对 200 亿参数模型的支持,其带宽为 288 GB/s,这使其在处理小模型时速度较慢。对于 LLM 来说,一旦目标模型超过 7.5GB,容量的重要性就超过速度。

#结论:保留、替换或不购买

如何根据你的情况做决定
情况决策数字依据
您已拥有 3070 显卡,希望运行 8B 模型保留它Granite 4.2 8B:5.3 GB,估算速度约60 token/s
您想要一个 12B 到 14B 的模型升级至 12 或 16 GBQwen3 14B占用9.3GB,3070显卡有8GB显存
您需要 20B 模型或较长的上下文显存为 16 GB 或以上的显卡gpt-oss 20B 体积为 14 GB
你正在犹豫选择3070还是3070 Ti选择最便宜的选项相同显存容量,608 对 448 GB/s
您正在寻找用于入门的显卡与3060 12GB进行对比带宽相近,内存容量更大

3070 对于 80 亿参数模型来说是一张还算可以的显卡,仅此而已。它仍可作为入门显卡使用:Ollama 支持该显卡,且 80 亿参数模型在该显卡上的回复速度比人的阅读速度更快。如果您计划使用编程智能体或处理长文档,则它不适用,因为这些任务所需的上下文超出了 8 GB 显存所能容纳的范围。如果您已经拥有该显卡,它足以用于探索本地 LLM。如果您仅为这一用途选择显卡,请优先考虑容量:能装下的更大模型,比速度更快的小模型更有价值。关于当日价格,请参阅我们的价格追踪页面,该页面每周两次记录每张显卡的最低价格。

#常见问题

FAQ
在 RTX 3070 上运行哪个 LLM?+
先从 Granite 4.2 8B(5.3 GB)或 Qwen3 8B(5.2 GB)开始:它们能为上下文留下近 3 GB 的显存空间。Qwen 3.5 9B(6.6 GB)是上限,可留下 1.4 GB 的余量。对于 Q4 量化下超过 90 亿参数的模型,显存无法完全容纳,部分模型数据会放入系统内存。
RTX 3070 能运行 140 亿或 240 亿参数的模型吗?+
不行。Qwen3 14B 在 Ollama 中占用 9.3 GB,比显卡的显存容量多 1.3 GB,而 240 亿参数的模型(15 GB)或 gpt-oss 20B(14 GB)所需容量接近这张显卡显存的两倍。它们无法全部装入显存,部分会转移到系统内存中,速度随之大幅下降。运行 14B 模型至少需要 12 GB 显存。
运行 LLM,该选 RTX 3070 还是 RTX 3060 12 GB?+
对于 LLM,3060 12 GB 通常是最佳选择:多出的 4 GB 允许运行 Qwen3 14B(9.3 GB)。3070 的带宽为 448 GB/s,而 3060 为 360 GB/s:理论上生成速度快约四分之一,但 8 GB 显存将其限制在 80 至 90 亿参数的模型。
3070 和 3070 Ti 在运行 LLM 时有何区别?+
显存容量同样为 8 GB,但 3070 Ti 使用的 GDDR6X 显存带宽为 608 GB/s,而 GDDR6 为 448 GB/s,带宽高出 36%。生成速度受带宽限制,因此理论上也会按相同比例提升。根据 NVIDIA 的数据,Ti 的功耗为 290 W,而普通版为 220 W。
RTX 3070 Ti需要什么电源?+
NVIDIA标明,3070 Ti所需的系统电源为750 W(显卡功耗290 W),3070为650 W(显卡功耗220 W)。这些是厂商针对整台PC给出的数值:550 W电源低于这一推荐值,但对于功耗较低的PC而言,仍可能够用。
在 RTX 3070 上能否对模型进行微调?+
可以用 QLoRA 微调小模型。根据 Unsloth,3B 模型至少需要 3.5 GB,8B 模型至少需要 6 GB:在 8 GB 显存下,8B 勉强能运行,但批量大小只能设为 1,且上下文要短。14B 模型需要 8.5 GB,无法装入显存。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。