进阶 11 分钟RTX 50

在RTX 5070(12 GB)上运行哪个LLM ?

直接回答

RTX 5070 配备 12 GB GDDR7 显存,带宽为 672 GB/s:它可将大小不超过约 10 GB 的所有模型完整加载到显存中,包括 Qwen 3.5 9B(6.6 GB)和 Gemma 4 12B(7.7 至 8 GB),并为上下文留出充足空间。它无法将 Mistral Small 24B 或 gpt-oss 20B 完整加载到显存中,这两个模型的大小均为 14 GB。运行大小为 5.3 GB 的模型时,其理论速度上限约为 127 tokens/s;购买前应牢记,12 GB 是它的显存容量上限。

RTX 5070 是 Blackwell 这一代中速度最快的 12 GB 显存显卡,带宽为 672 GB/s。它面临的挑战不是速度,而是容量:12 GB 足以容纳 4B 到 12B 的模型,但不足以容纳更大的模型。本指南将用具体数值说明哪些模型能装入显存、哪些会超出容量,如何为上下文调整 Ollama 设置,以及何时配备 16 GB 显存的 5070 Ti 值得购买。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试
推荐硬件

针对此配置: RTX 5070 12 GB.

按预算比较所有选项,从 800 到 3 500 欧元 →

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#用 RTX 5070 运行本地 LLM:12 GB GDDR7 能做什么

RTX 5070 可以轻松加载 4B 至 12B 的 Q4 量化模型。根据 Ollama 模型库的数据,Qwen 3.5 9B 的大小为 6.6 GB,Gemma 4 12B 为 7.7 至 8 GB:两者都能装入 12 GB 显存,并为上下文留下 4 至 5 GB 的余量;使用量化的 K/V 缓存时,可支持 16 000 个 token 或更长的上下文。不过,该显卡无法加载任何大小为 14 GB 的模型:Mistral Small 24B 和 gpt-oss 20B 都超过了 12 GB。它的速度非常适合交互使用:192 位总线提供 672 GB/s 的带宽。因此,5070 适合常见用途,但一旦追求质量更高的模型,就会遇到明确的上限。

架构
据 NVIDIA 介绍,采用 Blackwell 架构,配备 6,144 个 CUDA 核心和第五代 Tensor Core。
内存
12 GB GDDR7 显存,192位总线,根据维基百科数据,带宽为672 GB/s。
功耗
总图形功耗250 W;NVIDIA 表示整台电脑的最低电源需求为650 W。
首发价格
549美元,根据维基百科,发布于2025年3月5日。

#哪些模型能装入 12 GB 显存

RTX 5070 上的模型(Ollama 中的大小,仅计模型权重)
模型大小12 GB 显存的剩余空间结论
Granite 4.2 8B5.3 GB6.7 GB上下文非常长
Qwen 3.5 9B6.6 GB5.4 GB舒适
Gemma 4 12B7.7 至 8.0 GB4 到 4.3 GB运行较为轻松,可使用 16,000 token 的上下文
Mistral Small 24B14 GB负向无法装入显存
Qwen 3.5 27B17 GB负向无法装入显存

该网站的参考标准是 Q4 量化下每十亿参数约 0.6 GB,仅计算权重。在 12 GB 显存下,如果上下文较短,实际极限约为 140 亿至 160 亿参数;如果您希望处理长文档,则约为 120 亿参数。对于 8B 至 9B 的模型,其余量远高于常规上下文所需。

#安装 Ollama 并检查显卡

  1. 01
    NVIDIA 驱动程序
    Ollama 要求使用 550 或更新版本的 NVIDIA 驱动程序。对于 RTX 50,请安装 NVIDIA 提供的最新驱动程序,并使用 nvidia-smi 检查。
  2. 02
    安装 Ollama
    下载适用于您系统的安装程序:CUDA已内置。
  3. 03
    运行模型
    尝试运行 ollama run gemma4:12b 以测试显存极限,或运行 ollama run qwen3.5:9b 以使用更轻量的模型。
  4. 04
    检查
    运行 ollama ps 命令:PROCESSOR 列应显示 100% GPU

#可以期待多快的速度:这是上限,而非实测结果

此处列出的生成速度均非本站实测值。生成速度上限等于内存带宽除以模型权重大小。第三方公开测试(2024 年 5 月,使用 llama.cpp 运行 Q4_K_M 量化的 LLaMA 3 8B)在 RTX 4080 上测得 106 tokens/s,而其理论上限为 156 tokens/s,约为上限的 68%。以 70% 作为粗略估算依据,可得出以下短上下文场景的估算值。

RTX 5070 上的理论生成速度上限(带宽为 672 GB/s)
模型 (Q4)模型大小上限估算为 70 %
Granite 4.2 8B5.3 GB127 tokens/s约 89 tokens/s
Qwen 3.5 9B6.6 GB102 tokens/s约71 tokens/s
Gemma 4 12B7.7 GB87 tokens/s约61 tokens/s

这些速度上限远高于人类的阅读速度:5070 运行这些模型时绝不会慢。它受限的是容量,而不是速度。随着上下文变长,估算速度会下降;处理提示词对计算资源的要求高于对内存的要求。

#在 12 GB 显存下管理上下文

运行 Gemma 4 12B 时剩余的 4 GB 显存空间,在长上下文下很快就会用完。Ollama 将 K/V 缓存量化为 q8_0 后,内存占用约为默认格式 f16 的一半;根据其文档,精度损失非常小,但这需要启用 Flash Attention。正是这一设置让 12B 模型能够处理长文档。

Ollama 服务器设置(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

如果您要为多人提供服务,有一点容易踩坑:根据 Ollama 的 FAQ,多条并行请求会使预留的上下文容量相应增加。一个在单用户使用时能装入显存的模型,供三人使用时可能超出显存容量。

#用 12 GB 实际能做什么

十二吉字节相比8GB改变了使用方式。一个9B模型足以支持16000个token的上下文以及一个小型嵌入模型,这是个人RAG系统舒适配置。一个12B模型在写作和综合生成方面提供更高质量的响应,但上下文容量会相应受限。代码助手仅需8B至12B模型和针对性的片段,而无需一次性加载完整的模型。

在RTX 5070(12 GB)显卡上的使用场景
用途实际可行吗?推荐配置
日常聊天是,使用起来非常轻松Qwen 3.5 9B 或 Gemma 4 12B
长文档摘要可以,上下文长度为 16,000 个 tokenGemma 4 12B,K/V 缓存采用 q8_0
基于你的文件进行 RAG是Qwen 3.5 9B 和轻量级嵌入模型
代码助手可以,使用 8B 至 12B 的模型。有针对性的摘录,8 192 个 token 的上下文
14 GB及以上模型否准备 16 GB 显存

9B 还是 12B 的选择取决于具体任务。9B 模型留有更多余量,适合长上下文场景;12B 模型能力更强,但每GB的上下文都会消耗更多资源。建议从满足需求的最小模型开始,只有在质量要求明确时才升级到 12B。

#当 5070 显卡已无法满足需求时

有三个信号表明您需要更多内存:您想使用 14B 至 24B 的模型,例如 Mistral Small 24B 或 gpt-oss 20B;您需要在 12B 模型上使用超过 16,000 个 token 的上下文;或者您要同时加载生成模型、嵌入模型和重排序模型。在这些情况下,问题不在于 5070 的速度,下一档选择是 5070 Ti、5080 或配备 24 GB 显存的显卡。

#12 GB 显存无法加载哪些模型

大小超过 12 GB 的模型(按 Ollama 中的大小)
模型大小后果
Mistral Small 24B14 GB有 2 GB 超出显存容量,需卸载到系统内存
Qwen 3.5 27B17 GB明显超出
Qwen 3.5 35B24 GB超出能力范围:至少需要 24 GB VRAM
70B 模型,Q4 量化约40 GB超出配备 12 GB 显存的消费级 GPU 的承载范围

模型超出显存容量时不会崩溃:部分权重会从系统内存读取,而生成速率会明显下降,因为 PCIe 链路的速度远低于 GDDR7。因此,在 12 GB 显存上运行一个 14 GB 的模型可以用于测试,但不适合日常使用。对于这些模型,请选择 16 GB 或更大的显存。

#在同一张显卡上玩游戏和运行 LLM

RTX 5070 经常同时用于这两种用途。只要模型仍驻留在内存中,就会占用显存,而近期推出的游戏也需要数 GB 显存:在 12 GB 显存上,两者一起很快就会超出容量。规则很简单:启动游戏前先将模型从内存中卸载,游戏结束后再重新加载。Ollama 会在一段时间没有活动后释放内存,ollama ps 则显示哪些模型仍处于加载状态。如果您希望游戏期间也能随时使用助手,优先选择一个 4B 小模型。

#改选二手 4070 Ti Super?

这个问题经常出现:该选一张配备 16 GB 显存的二手 RTX 4070 Ti Super,还是一张配备 12 GB 显存的全新 RTX 5070?对于 LLM,容量更重要:16 GB 显存能加载 14 GB 的模型,而 5070 无法容纳。5070 仍具有保修、较低功耗(250 W)和 GDDR7 显存的优势。如果您的模型能装入 12 GB 显存,全新 5070 是合理的选择;否则,应优先考虑容量。相关专题指南详细介绍了 4070 Ti Super。

#5070 或 5070 Ti:12 GB 或 16 GB

RTX 5070 和 RTX 5070 Ti:对LLM的影响
标准RTX 5070RTX 5070 Ti
内存12GB GDDR7,192位16 GB GDDR7,256 位
带宽672 GB/s896 GB/s
CUDA 核心6 1448 960
图形性能250 W300 W
最低电源需求650 W750 W
14 GB模型否是的,有2GB余量

RTX 5070 Ti带来两项改进:额外4GB显存,支持Mistral Small 24B和gpt-oss 20B,以及带宽提升33%。首发建议售价为5070款549美元,5070 Ti款749美元,相差200美元。若您的模型在12GB以内,5070即可满足;若目标为14GB模型,这一差价是值得的投资。购买前请参考价格追踪以作比较。

#2026 结论

以下情况适合买 5070
您的模型规模为4B至12B,且希望达到Blackwell的生成速度。该模型在此类任务中表现非常出色。
以下情况下优先选择5070 Ti
您想探索14至24B参数的模型:16GB的显存是关键所在。
注意同时运行游戏和 LLM 的情况
一款较新的游戏和一个已加载的模型会共享这 12 GB 显存:启动其中一个之前,请先关闭另一个。

总的来说,5070 是一款速度很快的显卡,唯一的缺点是显存只有 12 GB。如果这个上限目前不影响您,那么只要您继续使用 4B 到 12B 的模型,未来几个月它也不会影响您;如果这个上限让您受限,最好现在就为更大的显存容量多花些钱。

#常见问题

FAQ
RTX 5070 12 GB 能否运行 70B 模型?+
不能。一个 Q4 量化的 70B 模型,仅权重就约为 40 GB,是该显卡 12 GB 显存容量的三倍多。即使将部分模型权重卸载到系统内存,生成速度也会极其缓慢。使用 12 GB 显存时,请选择 4B 至 12B 的模型;运行 70B 模型则至少需要准备 48 GB 内存。
在 RTX 5070 上每秒能处理多少 token?+
此处未发布任何可靠的测量结果。理论上限是将 672 GB/s 的带宽除以模型大小:对于 Granite 4.2 8B(5.3 GB),约为 127 tokens/s;按这一上限的 70% 计算,则接近 89 tokens/s。这是估算值,会随着上下文变长而下降。
12 GB 是否足以满足 2026 年专业使用需求?+
如果使用 4B 至 12B 参数的模型进行聊天、摘要、RAG 或信息提取,那么足够。若用于高质量写作,或在大型代码仓库上使用代码助手,大小为 14 GB 或以上的 14B 至 24B 模型会超出这张显卡的容量:请准备 16 GB 显存。
RTX 5070 是否同时支持 DLSS 4 和 LLM?+
两者都能在这张显卡上运行,但会共享 12 GB 显存。新近推出的游戏会占用相当一部分显存:请在启动游戏前加载模型,或在玩游戏期间关闭模型。LLM 与游戏不应在只有 12 GB 显存的情况下同时运行。
RTX 5070需要多大的电源?+
NVIDIA 标明显卡的总图形功耗为 250 W,整台 PC 的电源额定功率至少应为 650 W。优质的 650 W 电源即可满足要求;550 W 则低于推荐值。还请检查您所用显卡型号的连接器。
如何确认显存能装下模型?+
加载完成后,运行ollama ps:PROCESSOR列应显示100% GPU。若出现CPU/GPU的分配,则说明部分模型被加载到系统内存中,这将显著降低生成速度。此时请减少上下文长度,启用q8_0的K/V缓存,或选择更小的模型。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。