入门 10 分钟界面

Jan:ChatGPT 的开源替代品,100% locale

Jan (jan.ai) 是一款采用 AGPL 许可证的自由桌面应用,外观类似 ChatGPT,但完全在您的机器上运行。无需账号,不依赖云端,也没有隐藏的遥测——只需安装一个二进制程序,再加载开放权重模型。本 Jan AI 本地运行教程涵盖安装、首次对话、兼容 OpenAI 的 API 服务器,以及与 LM Studio 和 Msty 的坦诚对比。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为什么是Jan?

在竞争拥挤的桌面 LLM 客户端市场中,Jan 有三个与众不同的特点。首先,它是真正的开源软件:代码托管在 GitHub 上(menloresearch/jan),采用 AGPL-3.0 许可证,构建可复现。LM Studio 和 Msty 虽然免费,但都是闭源软件。如果您重视一直在自己设备上运行的二进制程序的透明度,Jan 是这三者中唯一满足这一条件的。

其次,Jan 将离线优先理念贯彻得非常彻底。它在启动时不会发起任何网络请求。没有自动更新检查,没有遥测,也不会以其他名义偷偷向厂商服务器回传信息。模型仅在需要时从 Hugging Face 下载,仅此而已。您可以在与外部网络物理隔离的机器上使用它,而不会影响其正常运行。

第三,架构设计简洁:Jan 是一个基于 Electron 的前端,位于 Cortex 之上,Cortex 是一个独立的推理引擎(原名为 Nitro)。Cortex 采用 llama.cpp 作为后端,并提供 REST API。因此,您可以仅使用 Cortex 服务而无需 Jan 前端,或者将其他客户端直接连接到 Cortex。这比 LM Studio 更模块化,后者是单体架构。

i
一句话总结
Jan = 精心打磨的 Electron 界面 + Cortex(llama.cpp 引擎)+ Hugging Face 模型商店。可以把它想象成一个始终不离开您 Wi-Fi 网络的“桌面版 ChatGPT”。

#先决条件

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
系统
Windows 10/11 (x64),macOS 12+(Intel 或 Apple Silicon),Linux(deb、AppImage 或 rpm)。
RAM
最低需要 8 GB(2B–3B 模型),16 GB 用起来更宽裕(8–9B Q4 模型),若想运行 24B 及更大的模型,则需要 32 GB 或更多。
磁盘空间
Jan + Cortex 需预留 5 GB,每个模型则根据大小占用 2 到 40 GB。建议在 SSD 上单独创建专用目录。
GPU(可选但推荐)
NVIDIA 支持 Windows/Linux 的 CUDA,Apple 芯片自动启用 Metal。无 GPU 时,Jan 可在 CPU 上运行——速度较慢,但对小模型仍可正常使用。
→
显存的合理参考值
Q4_K_M是Jan默认的量化格式。该格式下:3B≈2 GB显存 · 7B≈5 GB · 14B≈9 GB · 32B≈19 GB · 70B≈40 GB。当模型大小超过显存容量时,Jan会将部分模型加载到内存中(导致每秒token处理速度急剧下降)

#1. 安装

从官方网站下载安装程序。Jan 定位为一键安装程序——无需命令行操作,也无需管理 Python 依赖。

官方网站
https://jan.ai
!
始终从 jan.ai 或官方 GitHub 仓库下载
官方仓库位于github.com/menloresearch/jan(原janhq/jan)。请仅从官方网站或GitHub签名的发布版本下载Jan。需警惕在第三方网站上流传的预编译fork版本。
  1. 01
    启动安装程序
    双击 .exe(Windows)、.dmg(macOS)或 .AppImage(Linux)文件。在 Linux 上,必要时使用 chmod +x Jan-*.AppImage 使 AppImage 可执行。
  2. 02
    首次启动
    Jan会创建其数据目录(macOS/Linux为~/jan,Windows为%APPDATA%\Jan)。模型、对话和配置均存储于此。若希望将其置于SSD二级盘,请提前考虑。
  3. 03
    检查Cortex
    启动时,Jan 会在后台启动 Cortex 服务。如果弹出防火墙窗口,请允许本地连接(Cortex 监听的是 127.0.0.1,不对网络开放)。
  4. 04
    Onboarding
    Jan 推荐一个启动模型(通常为小型 Qwen 或 Granite)。您可接受并用2分钟测试,或跳过以在Hub中自行选择。

#2. 首个模型

Jan 内置了一个连接 Hugging Face 的模型中心,提供已准备好并经过测试的 GGUF 版本。打开左侧边栏中的 "Hub" 选项卡即可查看模型目录。

入门时,可根据您的 VRAM 从以下三个法语表现可靠的选项中选择:

轻量配置(8 GB 内存,无 GPU)
Granite 4.2 3B Q4_K_M(约 2.2 GB)。资源需求很低,足以用于聊天、总结短文本和头脑风暴。在 CPU 上运行时,每秒生成的 token 数也不错。更轻量的选择:Qwen 3.5 2B(约 1.9 GB)。
标准配置(16 GB RAM,GPU 6-8 GB)
Qwen 3.5 9B Q4_K_M(约 6.6 GB)。这是 2026 年 8 GB 显存配置的首选:256k 上下文、视觉能力,并且在法语和英语之间取得了出色平衡,适合大多数日常用途。
宽裕配置(32 GB 内存,GPU 显存 12 GB 及以上)
Gemma 4 12B(多模态,约 7.6 GB),或采用 Q4_K_M 量化的 Mistral Small 24B(约 14 GB,法语表现良好)。推理能力明显优于 8–9B 模型。

点击模型页面的「Download」按钮。Jan 显示下载进度并将 GGUF 文件保存至 data 文件夹。下载完成后,按钮变为「Use」——点击即可将模型加载到内存中。

→
导入您已有的GGUF模型
如果您已有本地GGUF文件(通过huggingface-cli下载,或从已安装的Ollama/LM Studio中获取),可通过Settings → My Models → Import将其导入Jan。Jan不会复制文件,只会引用原文件。

#3. 上手操作

Jan 的界面沿用了 ChatGPT 的设计风格:左侧是对话侧边栏,中央是聊天区域,右侧是随当前操作变化的设置面板。要高效使用它,需要了解以下三点:

Threads
每次对话都是一个独立的“Thread”,各自分配一个模型。您可以同时打开多个 Thread(方便比较 7B 和 14B 模型对同一问题的回答)。
助手
Assistants 选项卡:设置系统提示词、温度参数和预先指定的模型,创建不同的角色。这样可以方便地分别设置“代码助手”(Qwen3-Coder,温度 0.2)和“写作助手”(Mistral Small,温度 0.8)。
生成参数
右侧面板——温度、top-p、top-k、最大 token 数、频率惩罚。这些参数可针对每个对话单独修改。上下文窗口(n_ctx)在 Settings → My Models 中按模型设置。
i
对话以明文存储
默认情况下,Jan 会将你的对话线程存储在 data 文件夹内的可读 JSON 文件中。无加密。若处理敏感数据,请对磁盘进行加密(LUKS、FileVault、BitLocker)或将 Jan 的数据文件夹置于加密卷中。

#4. 扩展与Cortex

Jan 采用扩展架构。其核心组件本身即为内部扩展(如 Inference Cortex Extension、Model Extension 等),未来可实现模块替换。对于用户而言,第三方扩展生态尚不如 VS Code 成熟,但部分扩展仍值得尝试:

替代推理引擎
除默认的 Cortex/llama.cpp 外,您还可以启用指向远程 OpenAI 兼容端点的扩展(Ollama,vLLM,甚至 OpenAI 云服务,前提是您愿意脱离本地环境)。
独立部署的Cortex
Cortex 随 Jan 一起提供,但也可以独立运行。cortex run qwen3.5:2b 在命令行界面中启动时,会在默认端口上启动一个服务,无需 Jan 的前端。适用于脚本化运行或在无头服务器上部署。
Model Hub 可配置
您可以通过修改 Hub 设置来添加自定义模型源(私有 HF 仓库、内部镜像)。这在企业中很实用,方便分发内部微调的模型。
使用 Cortex 命令行,无需 Jan
# Lancer le serveur Cortex seul
cortex start

# Lister les modèles disponibles
cortex models list

# Charger et servir un modèle
cortex run qwen3.5:9b-gguf-q4-km

#5. API 服务器模式

Jan 的服务器模式在本地网络上提供兼容 OpenAI 的 API。这让 Jan 从简单的聊天客户端变成真正的后端,可供您的脚本、n8n 自动化流程,或通过 Continue.dev 实现的 VS Code 编程助手使用。

  1. 01
    启用服务器
    Settings → Local API Server。勾选“Start Local API Server”。Jan 会以服务器模式启动 Cortex,默认端口为 1337(可调整)。
  2. 02
    选择通过服务调用的模型
    所有已下载的模型都可通过 API 调用。每个模型都有一个标识符,可用于请求中的 "model" 字段(可在 My Models 的 ID 列中查看)。
  3. 03
    使用 curl 进行快速测试
    通过一次标准的 /v1/chat/completions 调用,检查服务器是否响应。调用语法与 OpenAI 相同。
兼容OpenAI的API测试
curl http://localhost:1337/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:9b-gguf-q4-km",
    "messages": [{"role": "user", "content": "Bonjour, qui es-tu ?"}],
    "temperature": 0.7
  }'
!
服务器默认本地监听
Jan 绑定在 127.0.0.1 上,因此无法从网络访问。若要与其他设备(团队、家庭)共享,需在设置中将绑定地址修改为 0.0.0.0 —— 但此时必须增加认证(至少使用基本认证的反向代理),Jan 本身不支持原生认证。
使用 OpenAI SDK 的 Python 客户端
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1337/v1",
    api_key="jan-local",  # n'importe quelle string, Jan ne vérifie pas
)

response = client.chat.completions.create(
    model="qwen3.5:9b-gguf-q4-km",
    messages=[
        {"role": "system", "content": "Tu réponds toujours en français."},
        {"role": "user", "content": "Explique-moi ce qu'est un LLM en deux phrases."},
    ],
)
print(response.choices[0].message.content)

#Jan与LM Studio与Msty的对比

这三款应用是本地 LLM 的桌面客户端,具备简洁的用户界面和本地 API 服务。细节决定成败。

Jan
开源(AGPL),严格遵循离线优先原则,采用模块化架构,以 Cortex 为独立引擎。模型目录比 LM Studio 更有限。非常适合追求自由软件和可审计性的用户。
LM Studio
闭源但免费。三者中Hugging Face模型目录最丰富(可直接在HF上搜索)。支持MCP、Mac上的原生MLX和多token预测。功能更多,但不透明。
Msty
闭源,采用免费增值模式(Aurum 版本付费)。最适合 RAG:文档工作区、分屏聊天(并排比较两个模型)、Knowledge Stacks。纯聊天方面相对较弱,更偏向于“个人智能体”。
→
如何选择
如果您想要可核查的开源软件和简单易用的体验,选 Jan。如果您想要尽可能多的模型和高级设置,选 LM Studio。如果您想无需编程就能对自己的文档使用 RAG,选 Msty。选择其中任何一个都不妨碍您使用其他工具——它们甚至可以同时运行(使用不同端口)。

#故障排除

模型无法加载 / 内存不足
检查可用的 VRAM/RAM。在 Settings → My Models → [模型] → Edit Parameters 中,调低 n_gpu_layers,减少分配到 GPU 上的模型层数。或者改用体积更小的量化版本(用 Q4_K_S 代替 Q4_K_M,或使用 IQ3_M)。
每秒生成的 token 数很低
确认 GPU 确实在被使用:使用 NVIDIA GPU 时,在生成过程中打开 nvidia-smi,您应当看到 Jan 或 cortex-server 占用显存。在 Apple Silicon 上,Metal 默认启用,无需设置。
Cortex无法启动(Windows)
缺少 Visual C++ 运行库。请从 Microsoft 下载并安装 vc_redist x64。同时请确认没有其他进程占用端口 1337(如有需要,请在设置中更改端口)
Linux:AppImage 无法启动
请安装libfuse2(在Ubuntu 22.04+上执行sudo apt install libfuse2)。调试时,请从终端启动AppImage以查看错误信息。
模型下载进度卡在99%
关闭后重新启动。Jan会继续下载。如果问题仍然存在,请从Hugging Face手动下载GGUF文件,并通过Settings → My Models → Import导入。
尽管提示语为法语,仍返回英文回答
模型能力不足,无法在双语使用中保持一致。请在助手中添加明确的系统提示「始终用法语回答」,或切换到法语能力扎实的模型(Mistral Small 24B、Qwen 3.5、Gemma 4)。

#深入了解

根据您接下来想前往的方向选择:

将Jan与其直接竞争对手进行对比
« Ollama vs LM Studio vs Jan vs GPT4All » 提供了详细对比表,帮助您根据自身需求选择合适的工具。
理解 Q4/Q5/Q8 量化技术
‘选择量化方式(Q4、Q5、Q8、FP16)’说明了质量与内存之间的权衡——在Jan的Hub中选择时非常有用。
基于您的文档进行 RAG
Jan 缺乏成熟可靠的原生 RAG 功能。《无需编写代码,用 Ollama 实现本地 RAG(Open WebUI、AnythingLLM)》介绍了无需编写代码的替代方案,这些方案也能连接 Jan 的 API 服务器。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。