入门 5 分钟LM Studio

LM Studio 新手入门:首次本地聊天只需 10 分钟

LM Studio 是本地 AI 中最接近 ChatGPT 的解决方案:图形化应用、可搜索和下载模型的内置商店,以及与您熟悉的界面相似的聊天界面。完全无需命令行操作。非常适合不使用终端就开始上手。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#什么是 LM Studio?

一款桌面应用程序(Windows、macOS、Linux),在同一个界面中集成四项功能:连接 Hugging Face 的模型浏览器、下载管理器、推理引擎(底层使用 llama.cpp)以及聊天功能。

该工具供个人使用时免费。自 0.3 版本起,企业商业用途需要许可证。

i
LM Studio 与 Ollama 对比
Ollama 以命令行操作为主,针对脚本和 API 使用进行了优化。LM Studio 以图形界面操作为主,针对探索使用进行了优化。两者都是合理的选择——许多高级用户会同时安装这两款工具。

#1. 安装

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款
官方网站
https://lmstudio.ai
  1. 01
    选择您的平台
    Windows .exe,macOS .dmg(Apple Silicon 或 Intel),Linux .AppImage。二进制文件大小在 400 到 600 MB 之间——这是正常的,因为其中包含 llama.cpp 及其依赖项。
  2. 02
    运行安装程序
    在Windows上,应用安装在%LOCALAPPDATA%中(无需管理员权限)。在Mac上,将应用拖入Applications文件夹。在Linux上,为AppImage添加执行权限:chmod +x LM_Studio_*.AppImage。
  3. 03
    首次启动
    LM Studio 会询问您要使用哪种界面级别(Power user 或 Developer)。刚开始使用时,Power user 就完全够用了——之后您可以再切换。

#2. 功能概览

左侧侧边栏包含5个核心视图:

💬 Chat
主要对话界面。外观类似 ChatGPT。
🔍 Discover
模型“商店”。直接在 Hugging Face 上实时搜索,一键下载。
📁 My Models
您已下载的所有模型,包含模型大小及量化信息。
💻 Developer
兼容 OpenAI 的本地服务器模式(见下文)。
⚙️ Settings
全局设置:模型目录、主题、集成功能。

#3. 下载您的首个模型

点击 🔍 Discover。搜索栏可直接在 Hugging Face 上搜索。2026 年首次尝试,请输入 Qwen 3.5 9B — 适用于 8 GB VRAM(256k 上下文,视觉功能,Apache 2.0 许可)的最佳选择。

  1. 01
    查看兼容性标签
    每个结果右侧,LM Studio 会显示 Full GPU Offload possible、Partial GPU Offload 或 Likely too large。这些提示基于检测到的您的硬件配置——只需选择标记为绿色的选项即可。
  2. 02
    选择合适的量化方式
    对于 Qwen 3.5 9B 这样的 9B 模型,显存为 8 GB 时,Q4_K_M 是最佳平衡点。显存达到 12 GB 及以上时,可选 Q5_K_M 或 Q6_K(甚至该 9B 模型的 Q8_0)。显存达到 16 GB 及以上时,可选 Q8_0,以获得最高质量。
  3. 03
    点击 Download
    根据量化方式不同,大小在 4 至 8 GB 之间。LM Studio 会实时显示进度。
→
GGUF 标签
LM Studio 仅支持 GGUF 格式(GGML 的继任者)。如果模型未提供 GGUF 变体,则需自行转换或直接跳过。

#4. 第一次对话

  1. 01
    返回 Chat 选项卡
    在顶部点击「Select a model to load」选择器,选择您刚刚下载的模型。
  2. 02
    调整 GPU offload 设置
    LM Studio 提供了一个滑块:0 = 完全在 CPU 上运行(速度慢,但总能运行),最大值 = 完全在 GPU 上运行(速度快,但显存不足时会崩溃)。请将滑块调到默认建议的最大值。
  3. 03
    点击“Load model”
    加载时间根据模型大小和硬盘速度在5到30秒之间。
  4. 04
    输入您的问题
    在下方的输入框中输入。按回车键发送。模型会以流式方式逐个输出 token。

#5. 调整回答质量

对话时查看右侧面板。只需调整三个设置,就能改变 90% 的行为:

Temperature
0.2 = 偏重事实、确定性强。0.7 = 均衡(默认值)。1.2 = 富有创意,但有时表现不稳定。如果模型过于重复,请调高该值。
Context Length
模型能够“看到”多少个先前的 token。默认值为 4096。处理长文档时,可将其增加到 8192 或 16384——注意,这会占用显存。
System Prompt(系统提示词)
不可见的消息,用于指定角色和规则。例如:"你是一个法国法律助手。始终引用适用的法律条文进行回答。"
!
误导性预设
LM Studio 内置多个预设(Creative、Balanced、Precise)。它们会一次性修改多个设置。虽然方便,但在盲目应用之前,请先了解每个预设具体会更改哪些设置。

#6. 本地服务器模式(API)

LM Studio 提供兼容OpenAI API的HTTP服务器。因此,任何能够与 ChatGPT 交互的工具都可以在本地运行。

  1. 01
    Developer 选项卡
    选择一个模型并点击Start Server(默认端口为1234)
  2. 02
    使用curl进行测试
    通过终端,一个简单的 GET 请求即可验证服务器是否响应。
验证
curl http://localhost:1234/v1/models
极简聊天
curl http://localhost:1234/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "local-model",
    "messages": [{"role":"user","content":"Bonjour"}]
  }'

在您的Python脚本中,只需将base_url更改为http://localhost:1234/v1,并使用任意虚构的API密钥即可。所有适用于OpenAI的功能均能正常运行。

#需了解的局限性

并非完全开源
该应用本身是专有软件,只有背后的 llama.cpp 引擎是开源的。若追求 100% 自由软件,请优先选择 Jan 或 Ollama。
自动更新
LM Studio 会自动更新。这很方便,但在严格管控的专业环境中可能让人措手不及。
付费商业许可证
企业用途请阅读条款。个人及教育用途免费。
不支持原生脚本
与 Ollama 不同,该产品没有命令行界面(CLI)。自动化操作仅通过 API 服务器实现。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。