Jan:ChatGPT 的开源替代品,100% locale
Jan (jan.ai) 是一款采用 AGPL 许可证的自由桌面应用,外观类似 ChatGPT,但完全在您的机器上运行。无需账号,不依赖云端,也没有隐藏的遥测——只需安装一个二进制程序,再加载开放权重模型。本 Jan AI 本地运行教程涵盖安装、首次对话、兼容 OpenAI 的 API 服务器,以及与 LM Studio 和 Msty 的坦诚对比。
#为什么是Jan?
在竞争拥挤的桌面 LLM 客户端市场中,Jan 有三个与众不同的特点。首先,它是真正的开源软件:代码托管在 GitHub 上(menloresearch/jan),采用 AGPL-3.0 许可证,构建可复现。LM Studio 和 Msty 虽然免费,但都是闭源软件。如果您重视一直在自己设备上运行的二进制程序的透明度,Jan 是这三者中唯一满足这一条件的。
其次,Jan 将离线优先理念贯彻得非常彻底。它在启动时不会发起任何网络请求。没有自动更新检查,没有遥测,也不会以其他名义偷偷向厂商服务器回传信息。模型仅在需要时从 Hugging Face 下载,仅此而已。您可以在与外部网络物理隔离的机器上使用它,而不会影响其正常运行。
第三,架构设计简洁:Jan 是一个基于 Electron 的前端,位于 Cortex 之上,Cortex 是一个独立的推理引擎(原名为 Nitro)。Cortex 采用 llama.cpp 作为后端,并提供 REST API。因此,您可以仅使用 Cortex 服务而无需 Jan 前端,或者将其他客户端直接连接到 Cortex。这比 LM Studio 更模块化,后者是单体架构。
#先决条件
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
- 系统
- Windows 10/11 (x64),macOS 12+(Intel 或 Apple Silicon),Linux(deb、AppImage 或 rpm)。
- RAM
- 最低需要 8 GB(2B–3B 模型),16 GB 用起来更宽裕(8–9B Q4 模型),若想运行 24B 及更大的模型,则需要 32 GB 或更多。
- 磁盘空间
- Jan + Cortex 需预留 5 GB,每个模型则根据大小占用 2 到 40 GB。建议在 SSD 上单独创建专用目录。
- GPU(可选但推荐)
- NVIDIA 支持 Windows/Linux 的 CUDA,Apple 芯片自动启用 Metal。无 GPU 时,Jan 可在 CPU 上运行——速度较慢,但对小模型仍可正常使用。
#1. 安装
从官方网站下载安装程序。Jan 定位为一键安装程序——无需命令行操作,也无需管理 Python 依赖。
- 01启动安装程序双击 .exe(Windows)、.dmg(macOS)或 .AppImage(Linux)文件。在 Linux 上,必要时使用 chmod +x Jan-*.AppImage 使 AppImage 可执行。
- 02首次启动Jan会创建其数据目录(macOS/Linux为~/jan,Windows为%APPDATA%\Jan)。模型、对话和配置均存储于此。若希望将其置于SSD二级盘,请提前考虑。
- 03检查Cortex启动时,Jan 会在后台启动 Cortex 服务。如果弹出防火墙窗口,请允许本地连接(Cortex 监听的是 127.0.0.1,不对网络开放)。
- 04OnboardingJan 推荐一个启动模型(通常为小型 Qwen 或 Granite)。您可接受并用2分钟测试,或跳过以在Hub中自行选择。
#2. 首个模型
Jan 内置了一个连接 Hugging Face 的模型中心,提供已准备好并经过测试的 GGUF 版本。打开左侧边栏中的 "Hub" 选项卡即可查看模型目录。
入门时,可根据您的 VRAM 从以下三个法语表现可靠的选项中选择:
- 轻量配置(8 GB 内存,无 GPU)
- Granite 4.2 3B Q4_K_M(约 2.2 GB)。资源需求很低,足以用于聊天、总结短文本和头脑风暴。在 CPU 上运行时,每秒生成的 token 数也不错。更轻量的选择:Qwen 3.5 2B(约 1.9 GB)。
- 标准配置(16 GB RAM,GPU 6-8 GB)
- Qwen 3.5 9B Q4_K_M(约 6.6 GB)。这是 2026 年 8 GB 显存配置的首选:256k 上下文、视觉能力,并且在法语和英语之间取得了出色平衡,适合大多数日常用途。
- 宽裕配置(32 GB 内存,GPU 显存 12 GB 及以上)
- Gemma 4 12B(多模态,约 7.6 GB),或采用 Q4_K_M 量化的 Mistral Small 24B(约 14 GB,法语表现良好)。推理能力明显优于 8–9B 模型。
点击模型页面的「Download」按钮。Jan 显示下载进度并将 GGUF 文件保存至 data 文件夹。下载完成后,按钮变为「Use」——点击即可将模型加载到内存中。
#3. 上手操作
Jan 的界面沿用了 ChatGPT 的设计风格:左侧是对话侧边栏,中央是聊天区域,右侧是随当前操作变化的设置面板。要高效使用它,需要了解以下三点:
- Threads
- 每次对话都是一个独立的“Thread”,各自分配一个模型。您可以同时打开多个 Thread(方便比较 7B 和 14B 模型对同一问题的回答)。
- 助手
- Assistants 选项卡:设置系统提示词、温度参数和预先指定的模型,创建不同的角色。这样可以方便地分别设置“代码助手”(Qwen3-Coder,温度 0.2)和“写作助手”(Mistral Small,温度 0.8)。
- 生成参数
- 右侧面板——温度、top-p、top-k、最大 token 数、频率惩罚。这些参数可针对每个对话单独修改。上下文窗口(n_ctx)在 Settings → My Models 中按模型设置。
#4. 扩展与Cortex
Jan 采用扩展架构。其核心组件本身即为内部扩展(如 Inference Cortex Extension、Model Extension 等),未来可实现模块替换。对于用户而言,第三方扩展生态尚不如 VS Code 成熟,但部分扩展仍值得尝试:
- 替代推理引擎
- 除默认的 Cortex/llama.cpp 外,您还可以启用指向远程 OpenAI 兼容端点的扩展(Ollama,vLLM,甚至 OpenAI 云服务,前提是您愿意脱离本地环境)。
- 独立部署的Cortex
- Cortex 随 Jan 一起提供,但也可以独立运行。cortex run qwen3.5:2b 在命令行界面中启动时,会在默认端口上启动一个服务,无需 Jan 的前端。适用于脚本化运行或在无头服务器上部署。
- Model Hub 可配置
- 您可以通过修改 Hub 设置来添加自定义模型源(私有 HF 仓库、内部镜像)。这在企业中很实用,方便分发内部微调的模型。
#5. API 服务器模式
Jan 的服务器模式在本地网络上提供兼容 OpenAI 的 API。这让 Jan 从简单的聊天客户端变成真正的后端,可供您的脚本、n8n 自动化流程,或通过 Continue.dev 实现的 VS Code 编程助手使用。
- 01启用服务器Settings → Local API Server。勾选“Start Local API Server”。Jan 会以服务器模式启动 Cortex,默认端口为 1337(可调整)。
- 02选择通过服务调用的模型所有已下载的模型都可通过 API 调用。每个模型都有一个标识符,可用于请求中的 "model" 字段(可在 My Models 的 ID 列中查看)。
- 03使用 curl 进行快速测试通过一次标准的 /v1/chat/completions 调用,检查服务器是否响应。调用语法与 OpenAI 相同。
#Jan与LM Studio与Msty的对比
这三款应用是本地 LLM 的桌面客户端,具备简洁的用户界面和本地 API 服务。细节决定成败。
- Jan
- 开源(AGPL),严格遵循离线优先原则,采用模块化架构,以 Cortex 为独立引擎。模型目录比 LM Studio 更有限。非常适合追求自由软件和可审计性的用户。
- LM Studio
- 闭源但免费。三者中Hugging Face模型目录最丰富(可直接在HF上搜索)。支持MCP、Mac上的原生MLX和多token预测。功能更多,但不透明。
- Msty
- 闭源,采用免费增值模式(Aurum 版本付费)。最适合 RAG:文档工作区、分屏聊天(并排比较两个模型)、Knowledge Stacks。纯聊天方面相对较弱,更偏向于“个人智能体”。
#故障排除
- 模型无法加载 / 内存不足
- 检查可用的 VRAM/RAM。在 Settings → My Models → [模型] → Edit Parameters 中,调低 n_gpu_layers,减少分配到 GPU 上的模型层数。或者改用体积更小的量化版本(用 Q4_K_S 代替 Q4_K_M,或使用 IQ3_M)。
- 每秒生成的 token 数很低
- 确认 GPU 确实在被使用:使用 NVIDIA GPU 时,在生成过程中打开 nvidia-smi,您应当看到 Jan 或 cortex-server 占用显存。在 Apple Silicon 上,Metal 默认启用,无需设置。
- Cortex无法启动(Windows)
- 缺少 Visual C++ 运行库。请从 Microsoft 下载并安装 vc_redist x64。同时请确认没有其他进程占用端口 1337(如有需要,请在设置中更改端口)
- Linux:AppImage 无法启动
- 请安装libfuse2(在Ubuntu 22.04+上执行sudo apt install libfuse2)。调试时,请从终端启动AppImage以查看错误信息。
- 模型下载进度卡在99%
- 关闭后重新启动。Jan会继续下载。如果问题仍然存在,请从Hugging Face手动下载GGUF文件,并通过Settings → My Models → Import导入。
- 尽管提示语为法语,仍返回英文回答
- 模型能力不足,无法在双语使用中保持一致。请在助手中添加明确的系统提示「始终用法语回答」,或切换到法语能力扎实的模型(Mistral Small 24B、Qwen 3.5、Gemma 4)。
#深入了解
根据您接下来想前往的方向选择:
- 将Jan与其直接竞争对手进行对比
- « Ollama vs LM Studio vs Jan vs GPT4All » 提供了详细对比表,帮助您根据自身需求选择合适的工具。
- 理解 Q4/Q5/Q8 量化技术
- ‘选择量化方式(Q4、Q5、Q8、FP16)’说明了质量与内存之间的权衡——在Jan的Hub中选择时非常有用。
- 基于您的文档进行 RAG
- Jan 缺乏成熟可靠的原生 RAG 功能。《无需编写代码,用 Ollama 实现本地 RAG(Open WebUI、AnythingLLM)》介绍了无需编写代码的替代方案,这些方案也能连接 Jan 的 API 服务器。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。