入门 9 分钟界面

LM Studio 在 Linux 上:Ubuntu、Debian、Arch、Fedora (2026)

LM Studio 在 Linux 上以 ~600 MB 的 AppImage 形式提供,包含图形界面、连接 Hugging Face 的模型商店、llama.cpp 推理引擎以及兼容 OpenAI 的服务器。无需系统安装、无需后台服务、无需添加软件仓库——仅需一个可执行文件即可。本指南涵盖安装流程、GGUF 模型下载、本地服务器启动以及 Linux 系统特有的陷阱(权限、FUSE、GPU)。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Ubuntu 24.04 上测试
i
简而言之
LM Studio 在 Linux 上以约 600 MB 的 AppImage 形式提供:无需系统安装,没有守护进程,只有一个可执行文件。· 三步即可:下载文件、赋予其执行权限(chmod +x),然后运行。· 前提条件:较新的发行版,配备 glibc 2.35+;Ubuntu 22.04 及更高版本还需要 libfuse2 软件包。· AppImage 会自动检测 GPU(根据显卡使用 CUDA、ROCm 或 Vulkan)以加速推理。

#为什么在 Linux 上使用 LM Studio

在 Linux 上,运行本地 LLM 时通常会首先想到 Ollama:systemd 守护进程、简洁的命令行界面,默认监听 localhost:11434。它非常适合服务器。LM Studio 则面向另一种场景:带图形界面的桌面工作环境。

提供完整界面,无需终端
聊天,Hugging Face 模型浏览器,下载管理器,采样设置:全部通过图形界面完成。如果您希望快速测试多个模型后再进入生产环境,此工具非常有用。
一键部署兼容OpenAI的服务器
Developer 选项卡提供一个使用 OpenAI 协议的端点:http://localhost:1234/v1。任何 SDK(openai-python、LangChain、Continue.dev)都能直接调用,无需修改一行代码。
无需系统级安装
AppImage 在用户空间运行。无需 sudo,无需安装包,无需第三方仓库。对于 DSI 加锁或非标准发行版的设备,这非常宝贵。
原生 GGUF 格式
LM Studio 仅读取 GGUF(llama.cpp 的格式)。这与 Ollama 底层使用的格式相同,因此 100% 的流行模型均可用。
i
LM Studio 与 Ollama 可以很好地共存
完全可以同时使用两者。让 Ollama 作为守护进程运行,供您的脚本和集成调用;用 LM Studio 进行交互式聊天和探索新模型。它们使用不同的端口(11434 和 1234),互不干扰。

#先决条件

本地 AI 套件

LM Studio 已经能在你的 Linux 系统上运行。接下来,本地 AI 套件会继续提供帮助:其中介绍了 LM Studio 的高级设置(第 5 章),还提供了在遇到问题时按症状排查的诊断树——运行缓慢、显卡未被使用、模型把内容全忘了(第 14 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
较新的 Linux 发行版
Ubuntu 22.04+、Fedora 38+、Debian 12+、Arch 或其衍生版本。LM Studio 已在主流发行版上测试,但 AppImage 具有可移植性,可在其他系统(如 openSUSE、Linux Mint、Pop!_OS)上运行。
glibc 2.35+
AppImage 包含图形依赖项,但不包含 glibc。如果您使用的是非常老旧的发行版(如 CentOS 7、Debian 10),则无法运行。
FUSE
AppImage使用FUSE实现只读挂载。大多数发行版默认已安装。在Ubuntu 22.04+上,需显式安装libfuse2包。
至少 8 GB RAM
用于运行 Q4 量化的 7B 模型。16 GB 内存用起来更宽裕;运行 14B 模型,或同时保持 IDE 打开,则需要 32 GB 或更多内存。
GPU(可选但推荐)
NVIDIA 显卡需配备较新的驱动程序(CUDA 12+),AMD 显卡需搭配 ROCm 6.x,Intel Arc 则通过 Vulkan 运行。没有 GPU 时,也可以在 CPU 上运行——3B 模型能用,7B 模型则较慢。
!
Ubuntu 22.04 和 FUSE
Ubuntu 22.04 已不再默认提供 libfuse2,这会导致许多 AppImage 无法运行,并出现类似 "dlopen(): error loading libfuse.so.2" 这样难以理解的错误信息。启动 LM Studio 前,请先用 sudo apt install libfuse2 安装该软件包。

#1. 下载AppImage

官方网站会自动检测您的操作系统并推荐合适的版本。请确保您是从 lmstudio.ai 下载的——存在一些可疑的镜像站点。

官方网站
https://lmstudio.ai
  1. 01
    下载.AppImage文件
    二进制文件大小在500至700 MB之间,包含llama.cpp、Electron UI以及完整运行时。根据惯例,可将其放置在~/Applications/或~/.local/bin/目录下——实际上可存放在任意位置,AppImage为自包含格式。
  2. 02
    使其可执行
    使用 chmod +x 命令。否则,该文件只是一个无法执行的归档文件。
  3. 03
    Lancez-le
    在文件管理器中双击启动,或通过命令行启动。首次启动时,LM Studio 会将其内容解压到 ~/.cache/AppImage/——这是正常现象,此后只会在每次更新时再次发生。
CLI快速安装
mkdir -p ~/Applications
cd ~/Applications
# Remplacez le nom par celui du fichier téléchargé
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImage
→
将 LM Studio 添加至应用程序菜单
安装 appimaged 或 AppImageLauncher:这些工具会自动检测 ~/Applications/ 目录中的 AppImage 文件,并创建 .desktop 入口,使其像原生应用一样出现在您的菜单中。AppImageLauncher 还能管理更新。

#2. 首次启动

首次启动时,LM Studio 会要求选择界面模式:User(仅聊天)、Power User(聊天 + 设置)、Developer(全部功能,包括服务器)。Power User 足以用于探索;之后若要使用本地服务器,可以通过 Settings → UI Mode 切换到 Developer。

左侧边栏中设有以下视图:

Chat
类似 ChatGPT 的主界面。您 90% 的使用时间都会在这里度过。
Discover
模型商店。实时搜索 Hugging Face,并根据检测到的显存容量显示硬件兼容性指示(Full GPU Offload / Partial / Likely too large)。
My Models
您已下载的所有模型,包括其大小和量化方式。便于清理管理。
Developer
本地OpenAI兼容服务器。仅在Power User或Developer模式下可见。

#3. 下载 GGUF 模型

LM Studio仅支持GGUF格式(llama.cpp的二进制格式,为GGML的继任者)。如果模型在Hugging Face上存在但没有GGUF版本,则无法直接加载。绝大多数热门模型(Qwen 3.5,Gemma 4,Mistral,Granite 4.2,DeepSeek,gpt-oss)均拥有由社区维护的GGUF版本。

  1. 01
    打开 Discover 并搜索一个模型
    首次尝试时,请输入 Qwen 3.5 9B 或 Granite 4.2 8B——它们是 2026 年 6–8 GB 显存档位中稳妥的选择。LM Studio 会列出可用的 GGUF 版本,通常由 bartowski、unsloth 或 lmstudio-community 发布。
  2. 02
    查看兼容性标签
    每个变体右侧都有一个绿色、橙色或红色的指示标记:Full GPU Offload 表示整个模型都能装入您的 VRAM。Partial 表示模型的一部分会放入系统 RAM(速度较慢)。Likely too large 表示模型很可能过大,不必考虑。
  3. 03
    选择量化方式
    Q4_K_M 是大多数情况下的最佳选择(质量损失小,约占 FP16 大小的 50%)。如果额外有 30-40% 的 VRAM,可选择 Q5_K_M。若拥有充足空间,Q8_0 可提供最高质量。仅在微调或对比时使用 FP16。
  4. 04
    点击 Download
    7B 模型的大小为 4 至 8 GB,具体取决于量化方式。下载在后台进行,您可以同时启动多个下载任务。
→
模型存储位置
默认情况下,LM Studio 将模型存放在 ~/.cache/lm-studio/models/ 目录下。在 Linux 上,该目录可能迅速增大(几个模型就可能占用 50–200 GB)。如果您的 /home 位于容量较小的 SSD 上,请通过 Settings → Model Directory 将该目录移到容量更大的磁盘上。

模型下载完成后,返回 Chat,在顶部下拉菜单中选择该模型,将 GPU offload 滑块调到可选的最大值,然后点击 Load model。根据模型大小和磁盘速度,加载需要 5 至 30 秒。

#4. 在1234端口启动本地服务器

正是在这里,LM Studio 的功能超越了单纯的图形聊天界面。Developer 选项卡提供了一个 HTTP 服务器,使用的协议与 OpenAI API 完全相同。任何 OpenAI 客户端(openai-python、LangChain、LlamaIndex、Continue.dev)都可以直接调用它,无需修改代码,只需更改基础 URL。

  1. 01
    切换到 Developer 模式
    Settings → UI Mode → Developer。Developer 选项卡(终端图标)会出现在侧边栏中。
  2. 02
    选择一个模型
    菜单位于 Developer 选项卡顶部。模型必须已下载。如果显存足够,可以同时加载多个模型。
  3. 03
    调整 Context Length 和 GPU Offload
    在 VRAM 允许的范围内,将 GPU offload 设置为最大值。默认上下文长度 4096 对大多数场景已足够;若用于 RAG 或长文档处理,则可提升至 8192 或 16384。
  4. 04
    点击 Start Server
    服务器默认监听 127.0.0.1:1234。如果 1234 端口已被占用,可以在旁边的设置中更改端口。
测试服务器
# Liste des modèles chargés
curl http://localhost:1234/v1/models

# Une complétion chat minimale
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [
      {"role":"user","content":"Capitale de l'\''Italie ?"}
    ],
    "temperature": 0.2
  }'

在Python端,使用官方OpenAI客户端即可。API密钥可以是任意字符串——LM Studio不会对其进行验证。

Python 客户端
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # placeholder, non vérifié
)

resp = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Tu réponds en une phrase."},
        {"role": "user",   "content": "Qu'est-ce qu'un GGUF ?"},
    ],
    stream=True,
)

for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="", flush=True)
i
实时日志
Developer 选项卡实时显示 Server Logs:每个传入请求、生成耗时以及 token 数量。这对于调试集成至关重要。

若要让团队的其他电脑通过局域网访问服务器,请在服务器设置中将 Host 从 127.0.0.1 改为 0.0.0.0。注意:LM Studio 不提供原生身份验证。在共享网络上,请在服务器前部署带有基本身份验证(basic auth)的 Caddy 或 Nginx,或者通过防火墙限制访问。

#5. Linux 下的 GPU 加速

这是在 Linux 上使用 LM Studio 时最容易踩坑的问题。AppImage 内置多个后端(CPU、CUDA、ROCm、Vulkan),并在启动时自动选择,但自动检测有时会因已安装的驱动程序而出错。

NVIDIA (CUDA)
已安装 535 或更高版本的专有驱动(nvidia-smi 必须能正常运行)。CUDA 12.x 已包含在 AppImage 中,无需单独安装。在 Settings → Hardware 中确认 GPU 已列出,并且后端确实为 CUDA。
AMD (ROCm)
主机上已安装 ROCm 6.x 驱动程序(官方支持 Radeon RX 6800 XT 及更新型号,RX 6700 XT 和 RX 7600 使用 HSA_OVERRIDE_GFX_VERSION 时通常也能运行)。您的用户账户必须属于 render 和 video 组。
Intel Arc / iGPU
使用 Vulkan 后端,在 Arc A770/A750 上性能尚可,但不如 NVIDIA/AMD。请安装 vulkan-tools,并使用 vulkaninfo 检查 GPU 是否被识别。
无GPU
自动回退到 CPU。在 Ryzen 7 上运行 Granite 4.2 8B Q4 时,预计速度为每秒 5–8 个 token。3B 级别的小模型,如 Qwen 3.5 2B 或 Granite 4.2 3B,仍然很好用。超过 14B 后,等待时间就会考验您的耐心。

Chat 或 Developer 中的 GPU offload 滑块控制加载到 GPU 上的模型层数。在显存允许的情况下,将其调到最大值。请在终端中检查实际占用情况:

监控显存
# NVIDIA
nvidia-smi -l 1

# AMD (radeontop ou rocm-smi)
rocm-smi --showmeminfo vram
按模型大小划分的VRAM参考(Q4)
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB。若上下文长度超过 4096,则这些数值会略有上升。
GPU 选型参考
RTX 3060 12GB 可轻松运行 7B 至 14B 模型。RTX 4070 12GB:同样可以,且留有余量。RTX 4080 16GB:可运行 Q5 量化的 14B 模型,开始能运行 24B 模型。RTX 4090 24GB:可运行 Q4 量化的 32B 模型和 Q3 量化的 70B 模型。配备 24 至 48 GB 统一内存的 Mac M4 Pro:在 Apple Silicon 平台上也能做到同样的事,但需要使用 macOS 版 LM Studio。
!
悄然回退到 CPU 的陷阱
如果显存不足以容纳模型及所需的上下文长度,LM Studio 会将部分层转移到系统内存中,但并不总是明确提示。生成速度会变成每秒 2–5 个 token,而不是 40 个以上。生成过程中请检查 Settings → Hardware 或运行 nvidia-smi——如果显存没有占满,说明模型有一部分在 CPU 上运行。

#常见陷阱

AppImage 无法启动
请从终端启动它,以查看错误信息。最常见的原因是 Ubuntu 22.04 及更新版本中缺少 libfuse2(运行 sudo apt install libfuse2 即可解决)。其次是 glibc 版本过旧(LM Studio 要求 2.35 或更高版本,因此不能使用 CentOS 7 或 Debian 10)。
GPU 未被使用
请检查 nvidia-smi(或 rocm-smi)。如果未列出 GPU,说明驱动程序缺失或版本过旧。如果已列出 GPU,但 LM Studio 仍使用 CPU,可通过 Settings → Hardware 强制指定后端(CUDA/ROCm/Vulkan)。使用 AMD 时,用户必须属于 render 和 video 组——执行 usermod 后,请退出登录再重新登录。
尽管使用了GPU,模型仍然运行缓慢
显存已满,模型的一部分在没有提示的情况下被转移到其他设备运行。请缩短上下文长度,调低 GPU offload 滑块以测定阈值,或采用更激进的量化(Q5 → Q4 → Q3)。
端口1234已被占用
通常是被另一个开发服务占用了。请在 Developer → Settings 中更改端口,或终止占用端口的进程:ss -tulpn | grep 1234。仅在 localhost 上使用时,无需修改防火墙设置。
导致功能失效的自动更新
LM Studio 默认会自动更新。在受控环境(企业、CI/CD 集成)中,请通过 Settings → Updates 禁用自动更新。记下能正常工作的版本号,以便在需要时回滚。
CLI 无自动补全
AppImage 并未提供功能丰富的命令行接口。对于较复杂的脚本任务,服务器的 HTTP API(端口 1234)仍是更规范的途径。如果您需要真正的命令行工具,llama.cpp 或 Ollama 更为合适。

#深入了解

您已经安装了 LM Studio,加载了一个 GGUF 模型,并启动了兼容 OpenAI 的服务器。接下来可以进一步探索以下方向:

深入利用API服务器
《将 LM Studio 配置为 API 服务器》指南详细介绍了流式输出、多模型并行运行、如何安全地向局域网开放访问,以及性能调优。
与 Linux 上的 Ollama 比较
《在 Linux 上安装 Ollama》指南介绍了另一套流行的技术栈,更侧重于守护进程和服务器。对许多人来说,Ollama(守护进程)加上 LM Studio(连接到它的客户端界面)是理想的组合。
选择合适的量化
《选择量化方式(Q4、Q5、Q8、FP16)》指南直观比较实际的质量损失,帮助您在质量与显存(VRAM)之间做出权衡,尤其适合自行下载 GGUF 模型时参考。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。