进阶 11 分钟迁移

用本地 AI 替代 ChatGPT:迁移指南 (2026)

直接回答

可以,适用于大多数常见用途:写作、摘要、翻译、编程以及围绕您的文档进行问答。迁移只需四个步骤:安装 Ollama,添加 Open WebUI 这样的界面,选择一个能装入您可用内存的模型,然后导入您的 ChatGPT 聊天记录。本地无法达到的是规模最大的前沿模型的水平;对于那些能体现它们优势的任务,请保留它们作为备用方案。

不再使用 ChatGPT 并不意味着放弃原有习惯。聊天界面、历史记录、预设助手、文件分析、网页搜索和语音功能都可以在本地实现。本指南逐项列出各功能的本地对应方案,说明如何根据您的内存情况选择模型,并详细介绍如何迁移您的对话记录。

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试

#您能获得什么,又会失去什么

在本地,您的对话和文件始终保留在您的设备上:不会通过第三方服务传输,模型下载后即可离线运行。无需订阅,也无消息数量限制:成本仅来自硬件和电力消耗。您可以自主选择模型、参数设置和指令。但相应地,您将无法自动访问那些体积庞大的顶尖模型(无法在个人设备上运行),以及部分开箱即用的功能:移动应用、流畅语音、与您的账户连接的智能代理。性能与成本的量化对比详见我们的指南《本地 AI 与 ChatGPT 对比》。

在 ChatGPT 中使用的功能及其本地等效方案
ChatGPT功能对应的本地功能需要了解的内容
带历史记录的聊天Open WebUI、LM Studio、Jan、MstyOpen WebUI 将对话保存在 Docker 卷中
导入您的历史对话Open WebUI 的 Import Chats 功能会自动识别 ChatGPT 格式
自定义GPTOpen WebUI 的自定义模型指令、工具和知识打包一体
内存Open WebUI 的记忆功能在不同对话之间保留的事实
文件附件、文档分析知识库(RAG)模型的上下文长度有限:详见下文
网络搜索Open WebUI 的网页搜索功能、SearXNG引用来源;取决于所配置的引擎
语音Open WebUI的语音识别与语音合成延迟高于云端服务
图像ComfyUI 或 Stable Diffusion与文本模型独立的模型和 GPU
顶尖模型没有完全对应的替代方案保留 API 或订阅作为备用

#根据您的内存选择模型

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

原则是选择采用 Q4 量化后,连同上下文的内存开销在内,仍能在您的显存或统一内存中留有余量地运行的最大模型。QuelLLM 目录列出了每个模型在 Q4 量化下仅权重所占的内存;下方数字就来自该目录。请在此基础上加上 KV 缓存,并预留 20% 的余量;上下文窗口指南解释了计算方法。

根据可用内存推荐的模型(QuelLLM 目录,Q4 量化,仅权重)
可用内存可用模型Q4 量化后的模型大小用途
8 GBQwen 3.5 9B约6 GB写作、摘要、常见问题
12 GBGemma 4 12B约 7 GB通用助手,并为上下文留有余量
16 GBMistral Small 3.2 24B 或 gpt-oss 20B14 到 13 GB推理与更长的上下文
24 GBQwen 3.8 27B约 16 GB要求较高的日常使用、编程
32 GBQwen 3.6 35B-A3B (MoE)约21 GB相对于模型大小,吞吐量较高;支持长上下文
64 GB及以上Llama 3.3 70B 或 gpt-oss 120B40至70 GB接近主流云模型的质量
i
MoE 模型的运作方式不同
像 Qwen 3.6 35B-A3B 这样的多专家模型,需要足以容纳全部 350 亿参数的内存,但每个 token 只激活其中 30 亿参数,因此生成速度比同等规模的稠密模型快得多。参见 MoE 模型指南。

#找回聊天界面

Open WebUI
最接近ChatGPT的网页界面:支持历史记录、系统提示、文件上传、网络搜索、记忆功能和自定义模型。可连接Ollama或任何兼容OpenAI的API
LM Studio
一款可下载模型并提供聊天功能的桌面应用:无需使用终端即可入门的最快途径。
Jan
一个简洁的桌面应用,注重隐私,支持聊天和模型管理
Msty
为Mac、Windows和Linux提供精心设计的界面,支持多个模型并列显示。

首次安装时,LM Studio或Jan就足够了。如果需要多人使用,或您想要记忆功能、自定义模型或导入历史记录,请选择Open WebUI。

#导入您的 ChatGPT 历史记录

Open WebUI 可直接读取 ChatGPT 的导出文件,无需预先转换:文档明确指出,格式 ChatGPT 可被自动检测并转换。您的对话将追加到已有内容中,每次导入都会获得一个新标识符;重复导入同一文件将导致重复项。因此,请确保仅导入一次,并在导入前检查文件内容。

  1. 01
    向 ChatGPT 请求导出数据
    在 ChatGPT 中,打开“设置”,进入“数据控制”(Data controls),再选择“导出数据”(Export data)和“请求导出”。您会收到一封包含下载链接的邮件;界面中的具体名称取决于界面语言。
  2. 02
    解压归档文件
    解压收到的文件,找到 conversations.json,其中包含对话历史。
  3. 03
    备份Open WebUI
    导入前,请通过「设置 > 数据控制 > 导出对话」导出您现有的 Open WebUI 对话,以便恢复到导入前的状态。
  4. 04
    导入
    在 Open WebUI 中:左下角用户名,设置,数据控制,导入对话,然后选择 conversations.json。标签名称会根据语言不同而变化。
  5. 05
    检查
    打开一些旧对话:消息应按顺序显示。导入的对话中显示的模型不一定与原始模型一致。

#安装软件栈:Ollama、Open WebUI 和一个模型

以下步骤假定已经为 Open WebUI 安装了 Docker。如果不用 Docker,LM Studio 或 Jan 可以用一个应用替代整套方案。

  1. 01
    安装 Ollama
    请按照适用于您操作系统的安装指南操作。Ollama 默认监听 http://localhost:11434。
  2. 02
    下载模型
    请根据上表选择模型,例如使用 ollama pull 命令,后接模型名称。下载前请确认模型大小。
  3. 03
    启动Open WebUI
    官方文档提供了一条Docker命令,用于挂载卷以保存您的数据,并让它能够访问宿主机上的Ollama。
  4. 04
    设置上下文
    显存低于24 GiB时,Ollama使用的上下文长度约为4,000个token,因此长文档会被截断。请根据可用内存增加上下文长度。
通过 Docker 运行 Open WebUI(命令来自官方文档)
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=your-secret-key --name open-webui --restart always ghcr.io/open-webui/open-webui:main

卷选项可在更新时保留您的对话记录,而密钥应一次设定并保持不变:文档说明,如果密钥不固定,每次重新创建容器都会使用户退出登录。请将 your-secret-key 替换为生成的值,例如使用 openssl rand -hex 32 生成。随后即可通过您机器的 3000 端口访问界面。

#逐一恢复您原有的使用方式

聊天、写作、翻译
模型加载后即可使用。质量取决于模型大小:9B模型足以处理邮件,27B及以上模型更适合长篇且细腻的文本。
分析您的文档
Open WebUI、AnythingLLM 或 PrivateGPT 的知识库会检索有用的段落,而不是将全部内容发送给模型。一旦您的文档超出上下文窗口,这就是合适的方法。
Coder
Cline 或 Continue 等扩展模块连接至 Ollama。Ollama 建议编码工具至少使用 64,000 个上下文 token。
重新打造您的 GPTs
将每个 GPT 重新构建为一个定制模型:整合系统指令、工具和知识。请从 ChatGPT 复制您的指令。
上网搜索
启用Open WebUI的网页搜索功能,或连接SearXNG,使模型能够引用来源信息。

#何时保留 ChatGPT 或云端API作为备用

有三种情况值得保留云端服务:针对难题进行很长时间的推理、任务需要数十万个 token 的上下文,或在移动设备上持续使用语音交互。混合方案效果良好:涉及保密信息或重复性的任务在本地处理,例外情况才使用云端,而且绝不向云端粘贴敏感数据。Open WebUI 支持在连接 Ollama 的同时接入外部服务提供商,并将两个模型并排比较,有助于判断本地模型是否足以满足您的具体需求。

#安全迁移:先并行测试

第一天不要取消任何订阅。最稳妥的做法是让两个工具并行使用一到两周,只要结果很重要,就向两者提出相同的问题。记录本地助手表现不佳的情况:这些情况会表明,您是否需要更大的模型、更大的上下文窗口、更好的提示词,或者,坦白说,某些用途是否应继续留在云端。

  1. 01
    第1天和第2天:安装与测试
    安装这套软件,加载适合您内存容量的模型,然后从您的 ChatGPT 历史记录中选取五段典型对话并重新测试。
  2. 02
    第 3 至第 7 天:将本地模型与 ChatGPT 配合使用
    日常任务都使用本地 AI;只有在本地 AI 的回答不够用时才求助于 ChatGPT,并记录原因。
  3. 03
    第2周:导入与重新创建
    一次性导入您的历史记录,将最常用的 GPTs 重新创建为自定义模型,并在需要时开启网页搜索。
  4. 04
    阶段结束:作出决定
    统计您不得不重新使用云端服务的次数。如果很少发生,就可以取消订阅;否则,请保留订阅,或改用按使用量计费的 API。

#迁移后常见的失望之处

上下文限制导致您的文档被截断
在显存少于24 GiB的显卡上,Ollama默认使用约4000个token的上下文窗口:粘贴到聊天中的长PDF会被截断,且没有明显警告。请在内存容量允许的范围内增大上下文窗口。
模型过小或压缩过度
使用2位量化的3B或7B模型,会让人觉得本地AI效果不佳。在下结论之前,请先尝试更大的模型,并避免使用低于4位的量化。
速度较慢的推理模型
有些模型在回答前会长时间思考,要等数十秒才能得到答案。日常对话请选择非推理模型。
为 ChatGPT 编写的提示词
本地模型对模糊指令的遵循能力较弱。请在系统提示中明确指定角色、输出格式和响应语言。

#仍会从您的设备传出的内容

本地运行并不意味着与外界完全隔绝。Open WebUI 的网页搜索会将您的查询发送给配置的搜索引擎;Ollama 标签以 cloud 结尾的模型会在供应商的服务器上运行,例如 Ollama 模型库中的 kimi-k3:cloud;此外,Open WebUI 允许您在连接 Ollama 的同时接入外部供应商,使用该供应商时,您的消息会发送给它。要真正保护隐私,请关闭这些选项,或仅在单独的配置中使用它们,并在处理敏感文档前检查已安装的模型列表。

FAQ
真的能用本地 AI 替代 ChatGPT 吗?+
对于大多数日常用途,可以:写作、摘要、翻译、编程以及针对您文档的问答,使用 90 亿至 300 亿参数的模型都能取得良好效果。难度极高的推理任务仍只有最大的云端模型能够胜任。在取消订阅之前,请先用您自己的实际案例进行测试。
如何获取我的 ChatGPT 对话记录?+
在 ChatGPT 中,通过“设置”→“数据控制”→“导出数据”请求导出。您会通过电子邮件收到一个包含 conversations.json 的压缩包。在 Open WebUI 中使用“导入对话”功能导入该文件,系统会自动识别格式。只导入一次,否则会产生重复内容。
哪种界面最像 ChatGPT?+
Open WebUI 功能最全面:支持历史记录、文件上传、网页搜索、记忆功能、自定义模型以及直接导入 ChatGPT 导出文件。LM Studio 和 Jan 安装更简单,无需 Docker 或终端,但团队协作和个性化功能较少。
在16 GB内存下应选择哪个模型?+
根据 QuelLLM 目录,Mistral Small 3.2 24B 和 gpt-oss 20B 经 Q4 量化后可以装入内存,权重分别约占 14 GB 和 13 GB。这给上下文留下的余量很小:请限制上下文窗口,或选择参数量为 90 亿至 120 亿的模型用于长上下文场景。
我的自定义 GPTs 呢?+
它们无法原样导出。请复制它们的指令,在 Open WebUI 中将每个助手重新创建为自定义模型,并关联您的知识文件。每个助手的这项工作需要几分钟,之后您还可以选择底层模型,而 ChatGPT 不允许这样做。
这真的免费吗?+
所提及的软件大多免费且开源,您也无需订阅。仍需考虑硬件、电费以及搭建所花的时间。如果您目前的设备只能加载小型模型,那么效果会比 ChatGPT 更有限。

#深入了解

这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。