用本地 AI 替代 ChatGPT:迁移指南 (2026)
可以,适用于大多数常见用途:写作、摘要、翻译、编程以及围绕您的文档进行问答。迁移只需四个步骤:安装 Ollama,添加 Open WebUI 这样的界面,选择一个能装入您可用内存的模型,然后导入您的 ChatGPT 聊天记录。本地无法达到的是规模最大的前沿模型的水平;对于那些能体现它们优势的任务,请保留它们作为备用方案。
不再使用 ChatGPT 并不意味着放弃原有习惯。聊天界面、历史记录、预设助手、文件分析、网页搜索和语音功能都可以在本地实现。本指南逐项列出各功能的本地对应方案,说明如何根据您的内存情况选择模型,并详细介绍如何迁移您的对话记录。
#您能获得什么,又会失去什么
在本地,您的对话和文件始终保留在您的设备上:不会通过第三方服务传输,模型下载后即可离线运行。无需订阅,也无消息数量限制:成本仅来自硬件和电力消耗。您可以自主选择模型、参数设置和指令。但相应地,您将无法自动访问那些体积庞大的顶尖模型(无法在个人设备上运行),以及部分开箱即用的功能:移动应用、流畅语音、与您的账户连接的智能代理。性能与成本的量化对比详见我们的指南《本地 AI 与 ChatGPT 对比》。
| ChatGPT功能 | 对应的本地功能 | 需要了解的内容 |
|---|---|---|
| 带历史记录的聊天 | Open WebUI、LM Studio、Jan、Msty | Open WebUI 将对话保存在 Docker 卷中 |
| 导入您的历史对话 | Open WebUI 的 Import Chats 功能 | 会自动识别 ChatGPT 格式 |
| 自定义GPT | Open WebUI 的自定义模型 | 指令、工具和知识打包一体 |
| 内存 | Open WebUI 的记忆功能 | 在不同对话之间保留的事实 |
| 文件附件、文档分析 | 知识库(RAG) | 模型的上下文长度有限:详见下文 |
| 网络搜索 | Open WebUI 的网页搜索功能、SearXNG | 引用来源;取决于所配置的引擎 |
| 语音 | Open WebUI的语音识别与语音合成 | 延迟高于云端服务 |
| 图像 | ComfyUI 或 Stable Diffusion | 与文本模型独立的模型和 GPU |
| 顶尖模型 | 没有完全对应的替代方案 | 保留 API 或订阅作为备用 |
#根据您的内存选择模型
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
原则是选择采用 Q4 量化后,连同上下文的内存开销在内,仍能在您的显存或统一内存中留有余量地运行的最大模型。QuelLLM 目录列出了每个模型在 Q4 量化下仅权重所占的内存;下方数字就来自该目录。请在此基础上加上 KV 缓存,并预留 20% 的余量;上下文窗口指南解释了计算方法。
| 可用内存 | 可用模型 | Q4 量化后的模型大小 | 用途 |
|---|---|---|---|
| 8 GB | Qwen 3.5 9B | 约6 GB | 写作、摘要、常见问题 |
| 12 GB | Gemma 4 12B | 约 7 GB | 通用助手,并为上下文留有余量 |
| 16 GB | Mistral Small 3.2 24B 或 gpt-oss 20B | 14 到 13 GB | 推理与更长的上下文 |
| 24 GB | Qwen 3.8 27B | 约 16 GB | 要求较高的日常使用、编程 |
| 32 GB | Qwen 3.6 35B-A3B (MoE) | 约21 GB | 相对于模型大小,吞吐量较高;支持长上下文 |
| 64 GB及以上 | Llama 3.3 70B 或 gpt-oss 120B | 40至70 GB | 接近主流云模型的质量 |
#找回聊天界面
- Open WebUI
- 最接近ChatGPT的网页界面:支持历史记录、系统提示、文件上传、网络搜索、记忆功能和自定义模型。可连接Ollama或任何兼容OpenAI的API
- LM Studio
- 一款可下载模型并提供聊天功能的桌面应用:无需使用终端即可入门的最快途径。
- Jan
- 一个简洁的桌面应用,注重隐私,支持聊天和模型管理
- Msty
- 为Mac、Windows和Linux提供精心设计的界面,支持多个模型并列显示。
首次安装时,LM Studio或Jan就足够了。如果需要多人使用,或您想要记忆功能、自定义模型或导入历史记录,请选择Open WebUI。
#导入您的 ChatGPT 历史记录
Open WebUI 可直接读取 ChatGPT 的导出文件,无需预先转换:文档明确指出,格式 ChatGPT 可被自动检测并转换。您的对话将追加到已有内容中,每次导入都会获得一个新标识符;重复导入同一文件将导致重复项。因此,请确保仅导入一次,并在导入前检查文件内容。
- 01向 ChatGPT 请求导出数据在 ChatGPT 中,打开“设置”,进入“数据控制”(Data controls),再选择“导出数据”(Export data)和“请求导出”。您会收到一封包含下载链接的邮件;界面中的具体名称取决于界面语言。
- 02解压归档文件解压收到的文件,找到 conversations.json,其中包含对话历史。
- 03备份Open WebUI导入前,请通过「设置 > 数据控制 > 导出对话」导出您现有的 Open WebUI 对话,以便恢复到导入前的状态。
- 04导入在 Open WebUI 中:左下角用户名,设置,数据控制,导入对话,然后选择 conversations.json。标签名称会根据语言不同而变化。
- 05检查打开一些旧对话:消息应按顺序显示。导入的对话中显示的模型不一定与原始模型一致。
#安装软件栈:Ollama、Open WebUI 和一个模型
以下步骤假定已经为 Open WebUI 安装了 Docker。如果不用 Docker,LM Studio 或 Jan 可以用一个应用替代整套方案。
- 01安装 Ollama请按照适用于您操作系统的安装指南操作。Ollama 默认监听 http://localhost:11434。
- 02下载模型请根据上表选择模型,例如使用 ollama pull 命令,后接模型名称。下载前请确认模型大小。
- 03启动Open WebUI官方文档提供了一条Docker命令,用于挂载卷以保存您的数据,并让它能够访问宿主机上的Ollama。
- 04设置上下文显存低于24 GiB时,Ollama使用的上下文长度约为4,000个token,因此长文档会被截断。请根据可用内存增加上下文长度。
卷选项可在更新时保留您的对话记录,而密钥应一次设定并保持不变:文档说明,如果密钥不固定,每次重新创建容器都会使用户退出登录。请将 your-secret-key 替换为生成的值,例如使用 openssl rand -hex 32 生成。随后即可通过您机器的 3000 端口访问界面。
#逐一恢复您原有的使用方式
- 聊天、写作、翻译
- 模型加载后即可使用。质量取决于模型大小:9B模型足以处理邮件,27B及以上模型更适合长篇且细腻的文本。
- 分析您的文档
- Open WebUI、AnythingLLM 或 PrivateGPT 的知识库会检索有用的段落,而不是将全部内容发送给模型。一旦您的文档超出上下文窗口,这就是合适的方法。
- Coder
- Cline 或 Continue 等扩展模块连接至 Ollama。Ollama 建议编码工具至少使用 64,000 个上下文 token。
- 重新打造您的 GPTs
- 将每个 GPT 重新构建为一个定制模型:整合系统指令、工具和知识。请从 ChatGPT 复制您的指令。
- 上网搜索
- 启用Open WebUI的网页搜索功能,或连接SearXNG,使模型能够引用来源信息。
#何时保留 ChatGPT 或云端API作为备用
有三种情况值得保留云端服务:针对难题进行很长时间的推理、任务需要数十万个 token 的上下文,或在移动设备上持续使用语音交互。混合方案效果良好:涉及保密信息或重复性的任务在本地处理,例外情况才使用云端,而且绝不向云端粘贴敏感数据。Open WebUI 支持在连接 Ollama 的同时接入外部服务提供商,并将两个模型并排比较,有助于判断本地模型是否足以满足您的具体需求。
#安全迁移:先并行测试
第一天不要取消任何订阅。最稳妥的做法是让两个工具并行使用一到两周,只要结果很重要,就向两者提出相同的问题。记录本地助手表现不佳的情况:这些情况会表明,您是否需要更大的模型、更大的上下文窗口、更好的提示词,或者,坦白说,某些用途是否应继续留在云端。
- 01第1天和第2天:安装与测试安装这套软件,加载适合您内存容量的模型,然后从您的 ChatGPT 历史记录中选取五段典型对话并重新测试。
- 02第 3 至第 7 天:将本地模型与 ChatGPT 配合使用日常任务都使用本地 AI;只有在本地 AI 的回答不够用时才求助于 ChatGPT,并记录原因。
- 03第2周:导入与重新创建一次性导入您的历史记录,将最常用的 GPTs 重新创建为自定义模型,并在需要时开启网页搜索。
- 04阶段结束:作出决定统计您不得不重新使用云端服务的次数。如果很少发生,就可以取消订阅;否则,请保留订阅,或改用按使用量计费的 API。
#迁移后常见的失望之处
- 上下文限制导致您的文档被截断
- 在显存少于24 GiB的显卡上,Ollama默认使用约4000个token的上下文窗口:粘贴到聊天中的长PDF会被截断,且没有明显警告。请在内存容量允许的范围内增大上下文窗口。
- 模型过小或压缩过度
- 使用2位量化的3B或7B模型,会让人觉得本地AI效果不佳。在下结论之前,请先尝试更大的模型,并避免使用低于4位的量化。
- 速度较慢的推理模型
- 有些模型在回答前会长时间思考,要等数十秒才能得到答案。日常对话请选择非推理模型。
- 为 ChatGPT 编写的提示词
- 本地模型对模糊指令的遵循能力较弱。请在系统提示中明确指定角色、输出格式和响应语言。
#仍会从您的设备传出的内容
本地运行并不意味着与外界完全隔绝。Open WebUI 的网页搜索会将您的查询发送给配置的搜索引擎;Ollama 标签以 cloud 结尾的模型会在供应商的服务器上运行,例如 Ollama 模型库中的 kimi-k3:cloud;此外,Open WebUI 允许您在连接 Ollama 的同时接入外部供应商,使用该供应商时,您的消息会发送给它。要真正保护隐私,请关闭这些选项,或仅在单独的配置中使用它们,并在处理敏感文档前检查已安装的模型列表。
真的能用本地 AI 替代 ChatGPT 吗?+
如何获取我的 ChatGPT 对话记录?+
哪种界面最像 ChatGPT?+
在16 GB内存下应选择哪个模型?+
我的自定义 GPTs 呢?+
这真的免费吗?+
#深入了解
- 5 分钟安装 Ollama
- Open WebUI 搭配 Ollama:完整指南
- 本地 AI 与 ChatGPT 的对比
- 理解上下文窗口
- 使用 Ollama 实现本地 RAG,无需写代码
- SearXNG:本地模型的网页搜索
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。