Msty:优雅的本地 LLM 界面(Mac、Windows、 Linux)
Msty 是一款桌面应用,将用户体验放在首位,让您在本地运行大语言模型(LLM)。Open WebUI 需要 Docker,LM Studio 则侧重推理引擎;相比之下,Msty 通过一个安装程序就能提供这些功能:并列使用本地模型和云端模型(OpenAI、Claude、Gemini)、通过 Knowledge Stacks 实现原生 RAG、工作区,以及用于比较两个模型的分屏聊天。本指南介绍如何在 Mac、Windows 和 Linux 上安装并充分使用 Msty,满足深入使用本地 LLM 的需求。
#为何选择 Msty
Msty(msty.app)面向一类特定用户:希望使用界面简洁的图形应用,无需 Docker 或命令行,同时又需要超越简单聊天的实用功能。三大差异化特点概括了这款工具。
- 一切功能集成于单一应用
- 内置推理引擎(基于llama.cpp)、可连接已安装Ollama的客户端,以及云端连接器——无需自行搭建整套技术栈。
- Knowledge Stacks
- RAG原生支持,无需额外代码。可直接拖放PDF、Markdown文件、整个文件夹,甚至URL,Msty会自动完成分块、嵌入和检索。
- Workspaces 和 Split Chat
- 支持多个隔离的工作空间(个人、工作、研发),并可在同一视图中并行向2至4个模型提出相同问题。
#先决条件
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
- OS
- macOS 11+ (Apple Silicon 或 Intel),Windows 10/11 (x64),Linux x64 (AppImage 和 .deb/.rpm 包)
- 最低 RAM 要求
- 3B 模型采用 Q4_K_M 量化时需 8 GB 内存,7B 需 16 GB,14B 配备 32 GB 可较轻松地运行,若希望运行 32B,则考虑 64 GB。
- GPU
- 可选但推荐。NVIDIA 配合 CUDA,AMD 配合 ROCm/Vulkan,Apple 芯片配合 Metal — Msty 会自动检测并使用。
- 存储
- 根据模型数量,预留 10–50 GB 存储空间。GGUF Q4 文件的大小从 2 GB(3B)到 40 GB(70B)不等。
#1. 安装
Msty 只能从官方网站下载。目前还无法通过包管理器安装(Homebrew 和 winget 都不支持),因此更容易核实下载来源。
- 01下载安装程序访问 msty.app 并选择您的操作系统。提供三种版本:Online(精简版,仅适用于云端)、Local(推荐版,内置推理引擎)和 Local + GPU(包含为 Windows 打包的 CUDA 驱动)。
- 02安装(Mac)打开 .dmg 文件,将 Msty 拖入 Applications 文件夹,首次启动时右键点击 → 打开(Gatekeeper)。macOS 会要求确认,因为该应用未经过 App Store 公证。
- 03安装(Windows)运行 .exe 文件。如果您拥有较新的 NVIDIA 显卡,请选择 GPU 版本——它包含 CUDA 运行时,可避免手动配置驱动程序。否则,使用 Local CPU/Vulkan 版本即可。
- 04Linux 上安装AppImage:执行 chmod +x Msty-*.AppImage,然后运行 ./Msty-*.AppImage。.deb:执行 sudo dpkg -i msty_*.deb。.rpm:执行 sudo rpm -i msty-*.rpm。使用 AppImage 时,某些发行版可能需要 libfuse2。
- 05首次启动Msty会创建自己的数据目录(Mac上为~/Library/Application Support/Msty,Windows上为%APPDATA%\Msty,Linux上为~/.config/Msty)。模型、对话和Knowledge Stacks均存储于此。
#2. 首个本地模型
Msty 提供入门引导流程,可一键下载一个小型入门模型。您也可以直接从其模型目录中选择。根据您的硬件,以下是三个适合用法语入门的可靠选项:
- 低配(8 GB RAM,无 GPU)
- Qwen 3.5 2B Q4_K_M(约 1.9 GB)或 Granite 4.2 3B(约 2.2 GB)。仅用 CPU 运行也可行,非常适合聊天、头脑风暴和总结短文本。
- 标准配置(16 GB RAM,GPU 6-8 GB)
- Qwen 3.5 9B Q4_K_M(约 6.6 GB),具备 256k 上下文和视觉能力。日常法语/英语多用途使用的最佳折中选择。
- 较宽裕的配置(32 GB 内存,GPU 显存 12–24 GB)
- Mistral Small 24B(≈14 GB)或 Qwen 3.8 27B 在 Q4_K_M 量化下(≈18 GB)。推理能力明显提升,体验已接近云端水平。
下载时,打开左侧边栏中的 Local AI Models 选项卡,然后点击 Browse and Download Online Model。Msty 会跳转到 Hugging Face,并筛选出兼容的 GGUF 版本。界面会显示下载进度,下载完成后即可选择该模型。
#3. 云端与本地并排使用
这是 Msty 的一项优势:您可以添加自己的云端 API 密钥(OpenAI、Anthropic、Google、OpenRouter、Groq、Mistral 云服务等),并在使用本地模型的同一个界面中使用这些云端模型。为新对话选择模型时,只需使用一个下拉菜单,其中同时列出云端模型和本地模型。
- 01添加云服务提供商Settings → Remote Model Providers → Add。粘贴您的 API 密钥。Msty 将密钥存储在本地(操作系统钥匙串可用时,由其加密)。
- 02选择对话模型在聊天栏中,模型选择器会显示您的所有模型:Local(带房屋图标)、Cloud(带服务商图标)。您可以在对话过程中切换模型,Msty 会保留上下文。
- 03设置规则Settings → Default Model可用于设置默认模型。小技巧:将本地模型设为默认后,想把请求发送到云端时就必须明确选择——这有助于保护隐私。
#4. 自定义工作区
Msty 中的工作区是一个隔离空间,各自拥有独立的对话、Knowledge Stacks、默认模型和已启用的服务提供商。具体而言,为每种使用场景创建一个工作区。
- Perso
- 本地 7B 模型,不使用云端,基于您个人 Markdown 笔记的 Knowledge Stacks,语气随意的提示词。
- 工作
- 本地 14B 模型 + 云端 Claude,用于处理繁重任务;Knowledge Stack 基于内部文档(操作流程、运行手册)构建。
- 研发/沙箱环境
- 启用多个模型进行实验,频繁使用 split chat,不使用 Knowledge Stack。
- 机密
- 不使用任何云服务提供商,仅使用本地模型,Knowledge Stack 在操作系统层面加密,用于处理客户或人力资源数据。
创建:左侧边栏 → Workspaces 图标 → New Workspace。每个工作区都有自己的图标和颜色,有助于避免选错上下文(进而选错模型或目标位置)。
#5. Knowledge Stacks(原生RAG)
Knowledge Stacks 是 Msty 的核心功能。这是一个完整的 RAG 解决方案,无需任何配置:Msty 负责分块处理,使用本地模型(默认为 mxbai-embed-large)生成嵌入向量,存储于嵌入式向量数据库中,并在用户提问时自动将相关段落注入 LLM 的上下文
- 01创建 Knowledge Stack侧边栏 → Knowledge Stacks → New Stack。为其命名(例如:“法律文档”)。
- 02添加来源拖放文件(PDF、DOCX、MD、TXT、CSV、JSON)或整个文件夹。您也可以添加 URL(Msty 会抓取该页面)、YouTube 视频的转录文本,甚至通过 URL 添加 GitHub 仓库。
- 03等待索引完成Msty 显示进度:文本提取、分块(默认每块约 500 个 token)、嵌入生成。处理 100 个 PDF 文件,根据 GPU 不同,耗时约为 5 到 15 分钟。
- 04在对话中启用在聊天界面底部的Knowledge Stack图标处点击 → 选择要使用的知识栈。您可以同时启用多个知识栈。Msty会在每个回答下方显示所使用的来源,并提供直达原始段落的链接。
#6. Split Chat 与比较
Split Chat 可让您在同一窗口中向 2 个模型(免费版)或最多 4 个模型(Aurum)提出同一个问题,模型的回答会以并排的列显示。非常适合调校新模型,或在两个候选模型之间做出选择,无需重新编写提示词。
- 01启用 Split Chat在对话中,点击顶部栏中的 Split 按钮(列图标),将出现第二列,该列拥有独立的模型选择器。
- 02配置每一列每列对应一个模型、一个温度参数和一个系统提示。您可以将本地的Qwen 3.5 9B与云端Claude Haiku在相同问题上进行对比。
- 03同步或独立对话默认情况下,您输入的每条消息都会发送到两个对话栏。您可以取消勾选 Sync,让两边的对话各自发展(例如,某条回复激发了一个您只想在其中一个分支中深入探讨的想法)。
#Msty vs Open WebUI vs LM Studio
三者都是大语言模型的图形界面,但各有侧重点。
- Msty
- 一体化桌面应用,闭源免费增值模式。一键安装。最适合:无代码 RAG(Knowledge Stacks)、云端与本地混合、工作区、分屏聊天。在多用户或服务器部署方面灵活性较低。
- Open WebUI
- 自托管 Web 应用,开源(BSD),推荐使用 Docker。原生支持多用户(身份认证、角色),RAG 可配置,可通过网络内的任意浏览器访问。最适合:团队或家庭部署、完全掌控系统、服务器托管。
- LM Studio
- 闭源但免费的桌面应用。Hugging Face 模型目录最丰富,在 Mac 上原生支持 MLX,支持 MCP 和多 token 预测。最适合:测试大量模型、追求纯粹的性能、使用高级设置。提供简单的 RAG 功能(Chat with Documents),但集成程度不如 Knowledge Stacks。
#故障排除
- 模型无法加载(OOM)
- VRAM/RAM 不足。Settings → Local AI → [模型] → Advanced:调低 n_gpu_layers(将更少的层交由 GPU 运行)或 n_ctx(上下文窗口)。否则,改用占用空间更小的量化版本(Q4_K_S、IQ3_M)。
- 每秒令牌数较低
- 检查 GPU 使用情况:使用 nvidia-smi(NVIDIA)、rocm-smi(AMD),或 Activity Monitor GPU(Mac)。如果 GPU 使用率为 0%,说明 Msty 正在 CPU 上运行——请检查驱动程序,并确认在 Windows 上使用的是 Local + GPU 版本。
- Knowledge Stack 仍停留在 0%
- 建立索引需要先下载嵌入模型。在 Settings → Knowledge Stacks → Embedding Model 中,确认 mxbai-embed-large(或您选择的模型)的状态为 Downloaded,否则点击 Download。
- 云服务提供商返回 401 错误
- API 密钥无效或已过期。请在服务提供商的控制台中检查。对于 OpenAI,请确保账户中有可用余额(没有余额的密钥会返回 401 或 429 状态码)。
- Linux:AppImage 无法启动
- 安装 libfuse2(在 Ubuntu 22.04+ 上执行 sudo apt install libfuse2)。从终端运行 AppImage 以查看具体错误信息。
- 更新后丢失对话
- 数据存放在 Msty 文件夹中(Mac 上位于 Application Support 下,Windows 上位于 AppData 下,Linux 上位于 .config 下)。请检查是否有系统清理工具清空了这个文件夹。建议定期备份这个文件夹。
#深入了解
根据您希望发展的方向:
- 将 Msty 与替代方案进行对比
- 《Ollama vs LM Studio vs Jan vs GPT4All》和《LM Studio vs Ollama:2026 年该选哪个》全面介绍了本地模型界面。
- 让 RAG 突破 Knowledge Stacks 的能力限制
- 《无需编程,用 Ollama 实现本地 RAG(Open WebUI、AnythingLLM)》介绍了当 Msty 内置 RAG 的能力不足时可采用的替代方案。
- 为Msty选择合适的模型
- “选择量化方式(Q4、Q5、Q8、FP16)”有助于在 Msty 模型目录中权衡质量与显存占用。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。