入门 12 分钟GPU

本地LLM需要什么GPU?RTX 4070至5090,Mac (2026)

直接回答

对于本地 LLM,第一标准是 VRAM(而非游戏原始性能),其次是每秒 token 数,最后是功耗。一张二手 RTX 3090(24 GB VRAM)凭借更大的内存,尽管架构较旧,在本地 AI 方面可能胜过一张全新的 RTX 4070。

GPU是决定本地AI体验最关键的组件。但您并不需要与游戏玩家相同的GPU:对于LLM而言,最关键的是显存(VRAM),其次是每秒处理的token数量,然后是功耗。本指南梳理了2026年各厂商的GPU产品(NVIDIA、AMD、Apple Silicon、Intel Arc),提供按预算的实际配置建议,并解释为何二手RTX 3090可能优于全新RTX 4070。

您正在挑选电脑吗? 按预算推荐 →

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
推荐硬件

本指南的备选购买方案: Mac mini M5 Pro(24 GB / 512 GB).

为什么选择它?我们的完整资料: Mac mini M5 Pro(24 GB / 512 GB) →

按预算比较所有选项,从 800 到 3 500 欧元 →

预算有限: RTX 5060 · 大型模型: RTX 5090 · Mac Studio.

移动场景: 本地 AI 选哪款笔记本电脑 →

联盟链接——可能产生佣金,但您无需额外付费。作为亚马逊合作伙伴,QuelLLM 将从符合条件的购买中获利。

#VRAM,绝对王者

LLM 必须在显存中完整加载才能以全速运行。一旦模型超出系统内存,速度将下降 10 倍。因此,您能运行的模型大小由显存决定,而非 GPU 的算力。

8 GB
Qwen 3.5 9B(6.6 GB)。使用体验舒适,长上下文受内存容量限制。入门级。
12 GB
Qwen 3.5 9B 在 Q8 量化下(11 GB)可轻松运行,24B 模型在 Q4 量化下也能容纳。性价比的最佳平衡点。
16 GB
可从容运行 24B 模型(Devstral、Mistral Small),也能运行 gpt-oss 20B 或采用 Q4 量化的 27B 模型。是很好的折中选择。
24 GB
Qwen 3.8 27B(18 GB)可轻松容纳,此外还有面向编程的 30B-A3B MoE 模型,以及采用 Q4 量化的 35B 模型。
48 GB +
可轻松运行 Q4 量化的 70B 模型,可进行 LoRA 微调,也可并行运行多个模型。
→
黄金法则
在预算相同的情况下,始终选择显存容量最大的 GPU,即使其原始 token 生成速率略低。对于大语言模型,一块二手 3090 24 GB 显卡比一块全新 4070 12 GB 显卡更有优势,尽管两者相差一代。

#明确自身需求

偶尔聊天,简单任务
Qwen 3.5 9B = ~7 GB VRAM 足够。RTX 4060 Ti 16 GB,RTX 3060 12 GB,Arc A770 16 GB。
开发(自动补全 + 聊天)
搭配使用 Qwen2.5-Coder 7B 基础模型进行 FIM 自动补全,以及 Devstral 24B 进行聊天。建议配备 16–20 GB 显存。
专业用途的 RAG、长文档
32k以上的上下文,额外占用4-6 GB显存,建议至少配备16 GB显存。
微调,实验
至少需要 24 GB(RTX 3090/4090)。对于 7B 模型的真实全量微调,建议使用 48 GB(A6000、RTX 6000 Ada)。
为 10 人团队提供服务
单机使用 RTX 4090 或 A6000,或采用 2× RTX 4090 张量并行部署 70B 模型

#NVIDIA — 2026年有哪些选择

RTX 3060 12GB(约250欧元)
经济型选择。支持 CUDA,配备 12 GB 显存,运行 Q4 量化的 7B 和 13B 模型时性能不错。是值得推荐的入门级选择。
RTX 4060 Ti 16 GB(约450欧元)
非常适合 LLM:16 GB 显存,功耗低(160 W)。单论性能不如 3090,但更省电。
RTX 4070 Super 12 GB(约 600 欧元)
计算性能出色,但 12 GB 显存是限制。如果您也玩游戏,这是个不错的选择。
RTX 3090 24 GB(约 700 欧元,二手)
⭐ 市场上最佳的 VRAM/欧元性价比。存在 2 年,但 24 GB 能创造奇迹。功耗较高(350 W)。
RTX 4090 24GB(二手,价格不固定)
2023–2025 年最佳消费级 GPU。性能强,配备 24 GB 显存。2026 年库存稀缺,优先选择 RTX 5090。
RTX 5080 16 GB / RTX 5090 32 GB(≈1 500至1 850欧元 / ≈5 700欧元,2026年9月底)
2025 年这一代产品。5090 拥有 32 GB 显存,是 LLM 用户梦寐以求的显卡。
RTX A6000 48 GB(专业版,约 4500 欧元)
48 GB 显存可用于运行 Q6 量化的 70B 模型,或微调 13B 模型。适合能通过工作收回设备成本的专业用户。

#AMD — ROCm 迎头赶上

RX 7600 XT 16 GB(约 350 欧元)
AMD 入门级显卡。以一张 3060 的价格获得 16 GB 显存。ROCm 官方支持。
RX 7800 XT 16 GB(约550欧元)
性能与 4070 相当,ROCm 稳定,性价比出色。
RX 7900 XTX 24 GB(约900欧元)
以远低于二手3090的价格获得24 GB显存。适合能接受ROCm复杂性的用户。
RX 9070 XT 16 GB(≈ 1 070 欧元,2026年9月末)
新一代RDNA 4(2025年)。ROCm方面仍待评估。
!
ROCm:仍然不如 CUDA 流畅
2026 年,ROCm 可以用于 LLM 推理,但适用范围仍不如 CUDA 广。某些边缘场景(如非常规量化格式、新近推出的后端)无法运行。需要做好耐心折腾的准备。

#Apple 芯片 — 特殊情况

Mac M 系列没有独立 GPU,而是采用统一内存:GPU 可以访问全部 RAM。一台配备 64 GB 内存的 Mac 可以为大语言模型分配 48 GB,足以运行一个 70B 模型。

Mac mini M6 16 GB(1 049 欧元)
最低可用配置(Mac mini M4已不再销售全新机)。7B模型运行良好。功耗极低(推理时为20 W)。
Mac mini M5 Pro 24 GB(1 999 欧元,可在 Apple 选配 48–64 GB 内存)
用于 LLM 时性价比极高(取代 M4 Pro)。48 GB 配置中,约 36 GB 分配给 GPU:足以从容容纳一个 Q6 量化的 32B 模型。
MacBook Pro M4 Max 64 GB(约 4000 欧元)
笔记本电脑 + Q4 量化的 70B LLM。使用体验相当于配备 RTX 4090 的台式机,同时兼具便携性。
Mac Studio M5 Ultra 96 GB(起售价 6 599 欧元,Apple 2026 年 9 月底的价格)
顶级之选。在 96 GB 内存中,LLM 可使用约 72 GB;内存容量更大的机型可使用更多。能够以 Q8 量化运行当前最大的开放权重模型,或并行运行多个 Qwen 3.8 27B。
→
Mac = 完整的LLM工作站
Mac Studio Ultra 比游戏 PC 耗电更少,而且没有噪声。对于专业办公室或居家办公,它是一套搭配合理的完整方案——而组装一台配备 4090 显卡的 PC,还需要机箱、1000 W 电源和散热设备。

#Intel Arc——需要折腾的冷门选择

Arc A770 16 GB(约300欧元)
16 GB 显存,价格仅 300 欧元。性能低于 NVIDIA/AMD 对应型号,但显存/欧元性价比无可匹敌。
Arc B580 12 GB(约 430 欧元,2026年9月底)
新一代 Battlemage。性能显著提升,前景广阔。
i
通过 Vulkan
使用 Vulkan 编译的 llama.cpp 在 Arc 上运行效果极佳。oneAPI 也是可选方案。文档少于 NVIDIA,但社区正在增长。

#具体预算

300欧元——仅用于起步
二手 RTX 3060 12 GB,或 Arc A770 16 GB。运行 7B–13B 模型没有问题。
700欧元——最佳平衡点
二手 RTX 3090 24 GB 显卡。每欧元可获得的显存容量最多。能运行任何 32B 模型,以及 Q4 量化的 70B 模型。
1500 欧元 — 专业使用更从容
购买全新的 RTX 5070 Ti 16 GB 显卡(约 1,250 至 1,400 欧元),加装到一台已配备 64 GB 内存的电脑上。
3000 欧元 — LLM 工作站
配备RTX 5080 16 GB的完整PC(约1500至1850欧元/卡)或Mac Studio M5 Max 36 GB(2999欧元)。要加载70B模型,需使用Ryzen AI Max+ 395 128 GB的迷你PC(约3300欧元,具体型号可达4000欧元)。适合每天持续进行此类开发的开发者。
6600 欧元及以上——顶级配置
Mac Studio M5 Ultra(96 GB及以上,起价6,599欧元)或PC 2×RTX 5090(两卡约11,400欧元,2026年9月底);适用于小团队的LLM服务器。

#选择全新还是二手?

全新
有保修、采用最新一代硬件、提供长期驱动程序支持。适合计划在 3 至 5 年内摊销的专业用途投资。
二手显卡(RTX 3090、4090)
可节省 30–40%。用于 LLM 的显卡不像挖矿显卡那样损耗严重(大多数显卡在负载下运行的时间较短)。
二手显卡检查
进行 24 小时推理烧机测试,监控温度(不得超过 80°C),确认散热垫未被更换,最好有原始购买发票。
专业用途采购
全新的 RTX A6000 或 L40。提供 3 年保修,价格为专业级,性能与消费级显卡相同。适合可对硬件成本计提折旧的用户。

价格变动迅速:我们每周一和周四追踪本地 AI 显卡的最低价格,并列出每 GB VRAM 的价格。

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。