本地部署LLM:逐步指南 (2026)
在本地部署一个大语言模型需要三个条件:一台具备足够RAM或VRAM的机器,以支持目标模型的规模;一个运行工具——LM Studio无需终端,Ollama通过命令行,或专家用户使用llama.cpp;以及一个与硬件相匹配的初始量化模型。在一台较新的设备上,首次实现本地可用的聊天功能大约需要10到15分钟,模型下载后无需再连接互联网。
您想直接在 PC 或 Mac 上运行 AI,但各种工具和模型的名称看起来都差不多,不知道从哪里开始?本指南为您提供选择之前所需的整体概览:检查电脑能否胜任、比较三种安装方法、选出第一个模型,并避开影响首次体验的错误。如果您想深入了解某个具体问题,每一步都附有通往更详细专题指南的链接。
#检查您的设备:RAM、VRAM 和模型大小
在选择工具之前,真正需要考虑的问题是:您的机器能为模型分配多少内存?模型名称中的“7B”或“32B”表示其参数数量,但真正决定所需空间的是量化版本——为了让模型装入内存而进行压缩,代价是少量精度损失。Q4 量化(通常标记为 Q4_K_M)是入门时的标准折中方案:与模型的原始权重相比,它大幅降低了内存需求,而带来的质量损失在实际使用中通常不易察觉。
- 8 GB 内存,无专用GPU
- 约 3-4B 参数的轻量模型,采用 Q4 量化:适用于基础使用,响应较慢但功能正常。
- 16 GB内存(CPU)或8 GB显存(GPU)
- 最舒适的入门选择,可运行 Q4 量化的 7B–8B 模型——这是首次正式使用时最常见的格式。
- 12 GB 显存
- 有余量可用来运行最高 14B 的模型,不会有特别的问题。
- 24 GB 显存(或 Mac 上 32-48 GB 统一内存)
- 采用 Q4 量化的 32B 模型可以较为轻松地运行。
- 64GB及以上内存或统一内存
- 约 70B 的模型也能运行了,但需要在 CPU 和 GPU 之间进行部分卸载,生成速度会明显变慢。
#选择方法:LM Studio、Ollama 或 llama.cpp
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
有三条路径可以本地运行大语言模型。它们并不相互排斥,而是基于不同的理念——选择主要取决于您对终端操作的熟悉程度,以及您计划在模型安装后如何使用它。
- LM Studio — 无需使用终端
- 带有完整图形界面的桌面应用程序,内置模型搜索和可视化 GPU 设置。这是初次接触的最直接选择,适用于 Windows、macOS(Apple Silicon)和 Linux。
- Ollama — 命令行终端和 API
- 一键安装,支持命令行管理的模型库,默认启用兼容OpenAI的本地API服务器。若计划进行脚本编写、自动化操作或集成第三方工具,这是最自然的选择。
- llama.cpp — 适合专家使用
- 许多其他工具在幕后使用的推理引擎,LM Studio 也在其中。从源码编译,可精细控制每个参数,没有用户界面——适合希望理解或优化每个细节的人。
总结:您不希望打开任何终端 → LM Studio。您希望从脚本、自动化或应用程序调用模型 → Ollama。您希望理解或调整每个编译参数,或在非标准硬件上运行模型 → llama.cpp。
#快速安装:分步操作
以下是三种方式各自的简要安装步骤。这里旨在提供整体概览,让您能在几分钟内开始使用;如果您需要包括截图在内的完整细节,每个工具都有专门的指南。
使用 LM Studio(无需使用终端):
- 011. 下载安装程序从 LM Studio 的官方网站获取与您系统相匹配的版本
- 022. 打开模型搜索首次启动时,请打开搜索选项卡(快捷键 Ctrl/Cmd+Shift+M)以浏览目录。
- 033. 选择合适的模型应用在下载前会显示 VRAM 兼容性预估:请优先选择标注与您的设备兼容的模型。
- 044. 加载模型并进行对话打开 Chat 标签页,从顶部菜单加载已下载的模型,然后提出您的第一个问题。
使用 Ollama(终端和 API):
- 011. 安装 OllamaLinux 系统下的官方脚本,Windows 和 macOS 下提供 .exe 或 .dmg 安装包。安装完成后,桌面应用程序将自动启动。
- 022. 启动首个模型在终端中,执行ollama run suivie命令即可下载模型并直接在终端启动聊天
- 033. 聊天或连接第三方工具继续在终端中操作,或将兼容 OpenAI 的应用程序连接到本地 API 服务器(默认端口为 11434)。
- 044. 管理已安装的模型可随时通过专用管理命令列出、修改或删除您的模型。
使用llama.cpp(专家级):
- 011. 编译二进制文件克隆仓库并根据您的硬件(CPU、CUDA、Metal 或 ROCm)进行编译。
- 022. 下载 GGUF 模型从 Hugging Face 下载 GGUF 格式的文件,选择适合当前可用内存的量化方案。
- 033. 启动聊天二进制程序指定已下载的 GGUF 文件,并按您的选择设置上下文参数和将计算卸载到 GPU 的参数。
- 044. 调整模型在 GPU 与 CPU 之间的分配(offload)逐层调整GPU与CPU之间的分配,以在您的配置上找到最佳的速度/内存平衡点。
#下载首个模型
选择第一个模型时,关键在于您的机器能轻松将多大的模型装入内存,而不是模型的名气。下面提供适合不同配置的可靠参考。
- 低端设备(8-16 GB 内存,无专用 GPU)
- 一个约 3–4B 的通用小模型,采用 Q4 量化:即使仅用 CPU 运行也很快,完全足以用于聊天、总结或翻译短文本。
- 8-12 GB 显存
- 一个 7-8B 的 Q4_K_M 模型,例如 Qwen3 8B 或 Mistral:日常使用中最常见的质量与速度的平衡方案。
- 16-24 GB 显存
- 一个 14B 模型;如果你的显存容量接近这个范围的上限,也可以选择经 Q4 量化的 32B 模型,例如最大版本的 Gemma:用于推理或编程时有更大的发挥空间。
- 您尚未确定具体用途
- 先从小模型开始。验证一个轻量模型能否正确回答只需几分钟;首次试用成功后,再尝试更大的模型。
#需要避免的常见错误
大多数关于本地 AI 的负面初次体验,其实源于配置不当,而非工具或模型本身存在真实问题。以下是首次在本地安装 LLM 时最常见的陷阱,以及如何快速识别它们。
- 模型过大,超出 VRAM 容量
- 模型会溢出到系统 RAM,甚至在加载时崩溃。回答会变得非常缓慢,或出现内存错误。请选择小一档的模型,或将量化位数降低一档。
- 随机选择量化方式
- 为了“用上最好的”而下载可用版本中体积最大的那个,往往会导致内存容纳不下。请从 Q4_K_M 开始,只有在内存余量确实允许时,才选择更高精度的版本。
- 风扇高速运转,回复迟迟不出
- 第一次运行大型模型时,这是正常现象:推理会给 GPU 或 CPU 带来很高的负载。如果您觉得速度太慢,说明模型对您的机器来说过大,而不是有什么错误需要修复。
- 先把所有内容下载下来再测试
- 最好先验证小模型能否正常工作并给出正确响应,再下载几十GB的大型模型。
#接下来呢?RAG、代码助手、API
一旦安装并运行首个模型,根据您的使用场景,将自然衍生出多种应用:与您的文档进行对话、在编辑器中集成代码助手,或将本地API服务器暴露给您的脚本和应用程序。
- 与您的文档对话(RAG)
- LM Studio 提供内置的 RAG 功能,可直接使用。在 Ollama 下,需搭配第三方工具如 Open WebUI 或专用流程才能获得类似效果。
- 为您的代码编辑器提供 AI 辅助
- Ollama 或 LM Studio 的 OpenAI 兼容 API 服务器可以连接到 Cline 等扩展,以实现 100% 本地化的编码辅助。
- 通过 API 实现自动化
- 两个工具均暴露一个兼容 OpenAI 的本地服务器,可直接在任何已设计为使用该 API 的脚本或应用程序中复用,无需修改客户端代码。
#常见问题
在本地安装LLM是合法且免费的吗?+
启动所需的最低配置是什么?+
是否可以在没有显卡的情况下本地安装一个 LLM?+
需要预留多少磁盘空间?+
初学者应选择哪个模型?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。