入门 11 分钟界面

Msty:优雅的本地 LLM 界面(Mac、Windows、 Linux)

Msty 是一款桌面应用,将用户体验放在首位,让您在本地运行大语言模型(LLM)。Open WebUI 需要 Docker,LM Studio 则侧重推理引擎;相比之下,Msty 通过一个安装程序就能提供这些功能:并列使用本地模型和云端模型(OpenAI、Claude、Gemini)、通过 Knowledge Stacks 实现原生 RAG、工作区,以及用于比较两个模型的分屏聊天。本指南介绍如何在 Mac、Windows 和 Linux 上安装并充分使用 Msty,满足深入使用本地 LLM 的需求。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为何选择 Msty

Msty(msty.app)面向一类特定用户:希望使用界面简洁的图形应用,无需 Docker 或命令行,同时又需要超越简单聊天的实用功能。三大差异化特点概括了这款工具。

一切功能集成于单一应用
内置推理引擎(基于llama.cpp)、可连接已安装Ollama的客户端,以及云端连接器——无需自行搭建整套技术栈。
Knowledge Stacks
RAG原生支持,无需额外代码。可直接拖放PDF、Markdown文件、整个文件夹,甚至URL,Msty会自动完成分块、嵌入和检索。
Workspaces 和 Split Chat
支持多个隔离的工作空间(个人、工作、研发),并可在同一视图中并行向2至4个模型提出相同问题。
i
商业模式
Msty 采用免费增值模式。免费版涵盖了绝大多数使用场景(本地聊天、云端、基础 Knowledge Stacks、双模型分屏聊天)。付费的 Aurum 版本解锁无限分屏聊天、高级提示词库以及一些专业选项。根据软件发布方的政策,两个版本均不包含对话遥测。

#先决条件

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
OS
macOS 11+ (Apple Silicon 或 Intel),Windows 10/11 (x64),Linux x64 (AppImage 和 .deb/.rpm 包)
最低 RAM 要求
3B 模型采用 Q4_K_M 量化时需 8 GB 内存,7B 需 16 GB,14B 配备 32 GB 可较轻松地运行,若希望运行 32B,则考虑 64 GB。
GPU
可选但推荐。NVIDIA 配合 CUDA,AMD 配合 ROCm/Vulkan,Apple 芯片配合 Metal — Msty 会自动检测并使用。
存储
根据模型数量,预留 10–50 GB 存储空间。GGUF Q4 文件的大小从 2 GB(3B)到 40 GB(70B)不等。
→
不同规模模型在 Q4 量化下的显存需求
采用 Q4_K_M 量化(Msty 的默认设置)时:3B≈2 GB · 7B≈5 GB · 14B≈9 GB · 32B≈19 GB · 70B≈40 GB。当模型所需容量超过您的显存容量时,Msty 会将部分模型卸载到系统内存中——仍可使用,但速度较慢(从每秒 50 个 token 降至每秒 5 个 token)。

#1. 安装

Msty 只能从官方网站下载。目前还无法通过包管理器安装(Homebrew 和 winget 都不支持),因此更容易核实下载来源。

官方网站
https://msty.app
!
仅从msty.app下载
发布方(Sapling Inc.)未通过官方商店进行签名。请务必核实网址——第三方有时会分发经过修改的版本。官方网站为 msty.app,而非 msty.io 或其他变体。
  1. 01
    下载安装程序
    访问 msty.app 并选择您的操作系统。提供三种版本:Online(精简版,仅适用于云端)、Local(推荐版,内置推理引擎)和 Local + GPU(包含为 Windows 打包的 CUDA 驱动)。
  2. 02
    安装(Mac)
    打开 .dmg 文件,将 Msty 拖入 Applications 文件夹,首次启动时右键点击 → 打开(Gatekeeper)。macOS 会要求确认,因为该应用未经过 App Store 公证。
  3. 03
    安装(Windows)
    运行 .exe 文件。如果您拥有较新的 NVIDIA 显卡,请选择 GPU 版本——它包含 CUDA 运行时,可避免手动配置驱动程序。否则,使用 Local CPU/Vulkan 版本即可。
  4. 04
    Linux 上安装
    AppImage:执行 chmod +x Msty-*.AppImage,然后运行 ./Msty-*.AppImage。.deb:执行 sudo dpkg -i msty_*.deb。.rpm:执行 sudo rpm -i msty-*.rpm。使用 AppImage 时,某些发行版可能需要 libfuse2。
  5. 05
    首次启动
    Msty会创建自己的数据目录(Mac上为~/Library/Application Support/Msty,Windows上为%APPDATA%\Msty,Linux上为~/.config/Msty)。模型、对话和Knowledge Stacks均存储于此。

#2. 首个本地模型

Msty 提供入门引导流程,可一键下载一个小型入门模型。您也可以直接从其模型目录中选择。根据您的硬件,以下是三个适合用法语入门的可靠选项:

低配(8 GB RAM,无 GPU)
Qwen 3.5 2B Q4_K_M(约 1.9 GB)或 Granite 4.2 3B(约 2.2 GB)。仅用 CPU 运行也可行,非常适合聊天、头脑风暴和总结短文本。
标准配置(16 GB RAM,GPU 6-8 GB)
Qwen 3.5 9B Q4_K_M(约 6.6 GB),具备 256k 上下文和视觉能力。日常法语/英语多用途使用的最佳折中选择。
较宽裕的配置(32 GB 内存,GPU 显存 12–24 GB)
Mistral Small 24B(≈14 GB)或 Qwen 3.8 27B 在 Q4_K_M 量化下(≈18 GB)。推理能力明显提升,体验已接近云端水平。

下载时,打开左侧边栏中的 Local AI Models 选项卡,然后点击 Browse and Download Online Model。Msty 会跳转到 Hugging Face,并筛选出兼容的 GGUF 版本。界面会显示下载进度,下载完成后即可选择该模型。

→
复用您的 Ollama 模型
如果您的设备上已经安装了 Ollama,Msty 会自动检测现有模型,并让您通过其界面使用这些模型——无需复制文件。这是一个低调的入口,可让您从 Ollama CLI 平稳过渡到真正的图形界面。

#3. 云端与本地并排使用

这是 Msty 的一项优势:您可以添加自己的云端 API 密钥(OpenAI、Anthropic、Google、OpenRouter、Groq、Mistral 云服务等),并在使用本地模型的同一个界面中使用这些云端模型。为新对话选择模型时,只需使用一个下拉菜单,其中同时列出云端模型和本地模型。

  1. 01
    添加云服务提供商
    Settings → Remote Model Providers → Add。粘贴您的 API 密钥。Msty 将密钥存储在本地(操作系统钥匙串可用时,由其加密)。
  2. 02
    选择对话模型
    在聊天栏中,模型选择器会显示您的所有模型:Local(带房屋图标)、Cloud(带服务商图标)。您可以在对话过程中切换模型,Msty 会保留上下文。
  3. 03
    设置规则
    Settings → Default Model可用于设置默认模型。小技巧:将本地模型设为默认后,想把请求发送到云端时就必须明确选择——这有助于保护隐私。
!
隐私:小心习惯性使用云端服务
统一选择器带来的便利也有代价:您很容易误将敏感提示词发送给 OpenAI 或 Anthropic。如果您处理机密数据,请创建一个未配置任何云服务提供商的专用工作区(参见下一节),或在这种使用场景下移除 API 密钥。

#4. 自定义工作区

Msty 中的工作区是一个隔离空间,各自拥有独立的对话、Knowledge Stacks、默认模型和已启用的服务提供商。具体而言,为每种使用场景创建一个工作区。

Perso
本地 7B 模型,不使用云端,基于您个人 Markdown 笔记的 Knowledge Stacks,语气随意的提示词。
工作
本地 14B 模型 + 云端 Claude,用于处理繁重任务;Knowledge Stack 基于内部文档(操作流程、运行手册)构建。
研发/沙箱环境
启用多个模型进行实验,频繁使用 split chat,不使用 Knowledge Stack。
机密
不使用任何云服务提供商,仅使用本地模型,Knowledge Stack 在操作系统层面加密,用于处理客户或人力资源数据。

创建:左侧边栏 → Workspaces 图标 → New Workspace。每个工作区都有自己的图标和颜色,有助于避免选错上下文(进而选错模型或目标位置)。

#5. Knowledge Stacks(原生RAG)

Knowledge Stacks 是 Msty 的核心功能。这是一个完整的 RAG 解决方案,无需任何配置:Msty 负责分块处理,使用本地模型(默认为 mxbai-embed-large)生成嵌入向量,存储于嵌入式向量数据库中,并在用户提问时自动将相关段落注入 LLM 的上下文

  1. 01
    创建 Knowledge Stack
    侧边栏 → Knowledge Stacks → New Stack。为其命名(例如:“法律文档”)。
  2. 02
    添加来源
    拖放文件(PDF、DOCX、MD、TXT、CSV、JSON)或整个文件夹。您也可以添加 URL(Msty 会抓取该页面)、YouTube 视频的转录文本,甚至通过 URL 添加 GitHub 仓库。
  3. 03
    等待索引完成
    Msty 显示进度:文本提取、分块(默认每块约 500 个 token)、嵌入生成。处理 100 个 PDF 文件,根据 GPU 不同,耗时约为 5 到 15 分钟。
  4. 04
    在对话中启用
    在聊天界面底部的Knowledge Stack图标处点击 → 选择要使用的知识栈。您可以同时启用多个知识栈。Msty会在每个回答下方显示所使用的来源,并提供直达原始段落的链接。
→
嵌入模型及法语质量
默认情况下,Msty 使用 mxbai-embed-large,它处理法语的效果尚可。对于纯法语内容,切换到 Solon-embeddings 这样的法语模型或多语言模型 bge-m3,可以提升质量。设置路径:Settings → Knowledge Stacks → Embedding Model。所有操作都在本地完成。
i
需了解的局限性
Msty 的 RAG 在 10 到 500 个文档时表现优异。超过此数量(10k 以上文档,混合 BM25 检索、自定义重排序)时,专用堆栈(Qdrant + LlamaIndex,或 AnythingLLM)仍更灵活。Msty 优化了用户体验,而非检索规模。

#6. Split Chat 与比较

Split Chat 可让您在同一窗口中向 2 个模型(免费版)或最多 4 个模型(Aurum)提出同一个问题,模型的回答会以并排的列显示。非常适合调校新模型,或在两个候选模型之间做出选择,无需重新编写提示词。

  1. 01
    启用 Split Chat
    在对话中,点击顶部栏中的 Split 按钮(列图标),将出现第二列,该列拥有独立的模型选择器。
  2. 02
    配置每一列
    每列对应一个模型、一个温度参数和一个系统提示。您可以将本地的Qwen 3.5 9B与云端Claude Haiku在相同问题上进行对比。
  3. 03
    同步或独立对话
    默认情况下,您输入的每条消息都会发送到两个对话栏。您可以取消勾选 Sync,让两边的对话各自发展(例如,某条回复激发了一个您只想在其中一个分支中深入探讨的想法)。
一个有用的对比示例
Prompt :
"Rédige un email professionnel poli pour refuser une réunion non urgente."

Colonne 1 : Qwen 3.5 9B local, température 0.7
Colonne 2 : Mistral Small 24B local, température 0.7

→ Comparaison directe du niveau de français, du ton, de la longueur,
de la pertinence des formules. Décide quel modèle
devient le défaut pour l'usage "rédaction".

#Msty vs Open WebUI vs LM Studio

三者都是大语言模型的图形界面,但各有侧重点。

Msty
一体化桌面应用,闭源免费增值模式。一键安装。最适合:无代码 RAG(Knowledge Stacks)、云端与本地混合、工作区、分屏聊天。在多用户或服务器部署方面灵活性较低。
Open WebUI
自托管 Web 应用,开源(BSD),推荐使用 Docker。原生支持多用户(身份认证、角色),RAG 可配置,可通过网络内的任意浏览器访问。最适合:团队或家庭部署、完全掌控系统、服务器托管。
LM Studio
闭源但免费的桌面应用。Hugging Face 模型目录最丰富,在 Mac 上原生支持 MLX,支持 MCP 和多 token 预测。最适合:测试大量模型、追求纯粹的性能、使用高级设置。提供简单的 RAG 功能(Chat with Documents),但集成程度不如 Knowledge Stacks。
→
如何在三者之间选择
如果您想要聊天和本地 RAG,无需编程,又希望用户体验精致流畅:选 Msty。如果您想在网络上为多个用户部署:选 Open WebUI。如果您想探索模型,并充分发挥推理引擎的能力:选 LM Studio。这些工具也可以组合使用——Msty 可以调用另一台机器上由 Open WebUI 提供的 Ollama 服务。

#故障排除

模型无法加载(OOM)
VRAM/RAM 不足。Settings → Local AI → [模型] → Advanced:调低 n_gpu_layers(将更少的层交由 GPU 运行)或 n_ctx(上下文窗口)。否则,改用占用空间更小的量化版本(Q4_K_S、IQ3_M)。
每秒令牌数较低
检查 GPU 使用情况:使用 nvidia-smi(NVIDIA)、rocm-smi(AMD),或 Activity Monitor GPU(Mac)。如果 GPU 使用率为 0%,说明 Msty 正在 CPU 上运行——请检查驱动程序,并确认在 Windows 上使用的是 Local + GPU 版本。
Knowledge Stack 仍停留在 0%
建立索引需要先下载嵌入模型。在 Settings → Knowledge Stacks → Embedding Model 中,确认 mxbai-embed-large(或您选择的模型)的状态为 Downloaded,否则点击 Download。
云服务提供商返回 401 错误
API 密钥无效或已过期。请在服务提供商的控制台中检查。对于 OpenAI,请确保账户中有可用余额(没有余额的密钥会返回 401 或 429 状态码)。
Linux:AppImage 无法启动
安装 libfuse2(在 Ubuntu 22.04+ 上执行 sudo apt install libfuse2)。从终端运行 AppImage 以查看具体错误信息。
更新后丢失对话
数据存放在 Msty 文件夹中(Mac 上位于 Application Support 下,Windows 上位于 AppData 下,Linux 上位于 .config 下)。请检查是否有系统清理工具清空了这个文件夹。建议定期备份这个文件夹。

#深入了解

根据您希望发展的方向:

将 Msty 与替代方案进行对比
《Ollama vs LM Studio vs Jan vs GPT4All》和《LM Studio vs Ollama:2026 年该选哪个》全面介绍了本地模型界面。
让 RAG 突破 Knowledge Stacks 的能力限制
《无需编程,用 Ollama 实现本地 RAG(Open WebUI、AnythingLLM)》介绍了当 Msty 内置 RAG 的能力不足时可采用的替代方案。
为Msty选择合适的模型
“选择量化方式(Q4、Q5、Q8、FP16)”有助于在 Msty 模型目录中权衡质量与显存占用。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。