进阶 11 分钟其他工具

Text Generation WebUI (oobabooga)

直接回答

oobabooga 是 Text Generation WebUI 开发者的化名。Text Generation WebUI 如今已更名为 TextGen,是一款开源界面(AGPL-3.0,GitHub 上约有 47,000 个星标),用于在本地运行语言模型,不包含遥测功能。它提供可下载的便携版,可像桌面应用一样使用,适用于 GGUF 模型;完整安装版则增加了其他引擎、LoRA 训练和扩展功能。官方来源:GitHub 仓库 oobabooga/textgen。

许多关于Text Generation WebUI的教程描述的是两年前的版本:已下线的引擎、被替换的插件、命令已变更。本指南基于当前仓库内容重新整理:新名称、三种安装方式、实际支持的引擎、插件、API以及在向他人开放界面前需了解的安全设置。

作者: Mohamed Meguedmi·更新于 2026-09-30·已在 Windows、macOS 和 Linux 上测试

#oobabooga、Text Generation WebUI、TextGen:这些名称指的是什么?

oobabooga 是该项目开发者在 GitHub 上使用的化名。该工具曾长期名为 Text Generation WebUI,如今以 TextGen 的名称呈现:旧仓库地址会重定向至 github.com/oobabooga/textgen。它是一款采用 AGPL-3.0 许可证的开源应用,集成了聊天、自由生成、视觉处理、工具调用、兼容 OpenAI 的 API 以及 LoRA 训练功能。仓库将其描述为完全离线且注重隐私的应用,没有遥测、外部资源,也不会向远程服务器发送更新请求。

该项目处于活跃状态:我们记录到的最新版本是4.9版,发布于2026年5月。据我们所知,除此GitHub仓库外,没有其他官方站点:请警惕第三方下载站点及声称替代本项目的Fork,因为被篡改的可执行文件会以您的权限运行。

i
为何旧教程会误导你
当前 README 列出了五个引擎:llama.cpp、ik_llama.cpp、Transformers、ExLlamaV3 和 TensorRT-LLM。较早的指南(包括本指南的第一版)经常提到的 ExLlamaV2、AWQ 和 GPTQ 格式以及 vLLM,已不再出现在该 README 中。请务必检查教程的日期。

#1. 安装:便携式、一键式或手动安装

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

代码仓库提供三种方式。便携版最简单:它包含所有依赖项,双击即可启动,而且只能加载 GGUF 模型(使用 llama.cpp 引擎)。它提供 Linux、Windows 和 macOS 版本,并有 CUDA、Vulkan、ROCm 和纯 CPU 变体。使用其他引擎、训练、生成图像及使用扩展功能都需要完整安装;完整安装会下载 PyTorch,并需要约 10 GB 磁盘空间。

选择安装方式
模式您将获得的内容需要了解的内容
便携版(桌面应用程序)通过 llama.cpp 运行 GGUF,所需组件均已包含最简单;不包含扩展或其他引擎
一键安装程序(start_脚本)完整安装:ExLlamaV3、Transformers、训练、扩展约 10 GB;安装时选择 GPU 厂商
使用 venv 或 Conda 手动安装对Python环境拥有完全控制权面向开发者;应仅用于特殊情况
  1. 01
    下载便携版
    请在仓库的版本发布页面选择适合您的操作系统和 GPU 的压缩包。对于 NVIDIA,如果 nvidia-smi 显示的 CUDA 版本大于或等于 13.1,请选择 cuda13.1 构建版本;否则选择 cuda12.4。AMD 和 Intel 使用 Vulkan,AMD 也可以使用 ROCm,此外还有仅使用 CPU 的版本。
  2. 02
    解压并启动
    解压压缩包,然后双击 textgen:会打开一个窗口。
  3. 03
    在 macOS 上解除隔离
    首次启动前,请按版本说明执行 xattr -cr 命令,并在命令后加上解压后文件夹的路径。
  4. 04
    添加模型
    将 GGUF 文件放入 user_data/models 文件夹中;界面会自动检测到该文件。
  5. 05
    加载并对话
    在模型选项卡中选择模型,然后打开聊天窗口。

更新便携版时,您可以保留模型和设置:下载新的压缩包并解压,然后用旧安装中的 user_data 文件夹替换新版本中的同名文件夹。从4.0版本起,您也可以将 user_data 放在各安装文件夹的上一级目录中;程序会自动检测到它。

要完成完整安装,请克隆仓库并运行适用于您操作系统的脚本。脚本会询问您的 GPU 厂商,将依赖项安装到本地文件夹中,然后您在浏览器中打开 http://127.0.0.1:7860。

使用一键安装程序完成完整安装(Linux;macOS 和 Windows 分别使用 start_macos.sh、start_windows.bat)
git clone https://github.com/oobabooga/textgen
cd textgen
./start_linux.sh

所有文件均存放于installer_files本地文件夹中。若需从零重新安装,请删除该文件夹并重新运行脚本。为永久应用选项,请在user_data/CMD_FLAGS.txt中写入,例如--api以启用API。这些脚本均无需管理员权限。

#2. 下载并选择模型

仓库中的使用说明只需三句话就能概括:从 Hugging Face 下载一个 GGUF 文件,将其放入 user_data/models,界面就会检测到它。由多个文件组成的模型(16 位 Transformers、EXL3)应放入该目录的子文件夹中,并且需要完整安装版,而不是便携版。

实际选择时,唯一的判断标准是内存。本网站给出的 Q4 量化参考值,仅计模型权重:3B 约 2 GB,7B 至 8B 约 5 GB,14B 约 9 GB,32B 约 19 至 20 GB,70B 约 40 GB。还需加上上下文缓存,并为系统预留余量。本网站的显存计算器会根据您的上下文长度给出精确的总需求。

#上下文与缓存:两种节省内存的方案

两个启动选项会直接影响内存占用。--ctx-size 设置上下文的 token 数量:在 llama.cpp 中,值为 0 表示自动设置,前提是将所有层都放在 GPU 上(--gpu-layers=-1);其他引擎的默认值为 8192。--cache-type 选择上下文缓存的格式;在 llama.cpp 中,有效值为 fp16、q8_0 和 q4_0。量化缓存比 fp16 缓存占用更少的内存,但精度略有降低:如果内存不足,请先尝试 q8_0,再考虑减小模型规模。

该代码仓库还提供了两个社区工具的链接,帮助您做出这一选择:GGUF 模型内存计算器和推荐量化方案列表。请用本站的计算器核对这些工具的结果,然后在长时间对话过程中监控显卡的实际显存占用。

#3. 选择引擎(加载器)

TextGen 通过一个称为 loader 的引擎加载模型。默认情况下会自动检测;您可以通过 --loader 选项强制指定。当前支持的值包括 Transformers、llama.cpp、ExLlamav3_HF、ExLlamav3 和 TensorRT-LLM,且可以在不重启的情况下切换引擎和模型。

当前README中的引擎组件
引擎模型格式用途
llama.cppGGUF默认选择:支持 CPU 和 GPU,也是便携版唯一的引擎
ik_llama.cppGGUFllama.cpp的一个变体,列为附加后端
ExLlamaV3EXL3面向 GPU 的量化,在完整安装中提供
Transformers16位模型,safetensors格式用途广泛,但内存消耗较大;也可用于训练
TensorRT-LLM为 NVIDIA 编译的模型适用于NVIDIA GPU的完整安装

如果您刚入门,请先使用 llama.cpp 和 GGUF 格式:这是最直接的方式,也是便携版以及其他工具(Ollama、LM Studio)采用的方案。只有存在明确需求时,才有理由选择其他引擎:例如特定格式、微调,或最大限度地发挥 NVIDIA 显卡的性能。

#4. Chat、instruct、notebook 和视觉功能

Instruct
像 ChatGPT 一样遵循指令的模式。提示词会通过 Jinja2 模板自动进行格式化。
Chat-instruct 和 chat
与自定义角色进行对话。
Notebook
一个独立于聊天轮次的自由生成选项卡:您写下文本,模型接着续写。
视觉与文件支持
您可以将图片和文本文件、PDF 及 .docx 文件附加到消息中,以讨论其内容。
编辑与分支
修改消息、在不同版本间切换,并可在对话任意点创建分支。

模型也可以在对话过程中调用工具:网络搜索、获取页面、计算。每个工具都是一个简单的 Python 文件,同时也支持 MCP 服务器。使用这项功能时还需考虑上下文:调用工具的智能体会很快填满较短的上下文窗口,因此请考虑通过 --ctx-size 选项增大上下文长度。

#5. 扩展:实际有哪些

扩展仅在完整安装下才能使用。仓库的扩展目录中包括 coqui_tts、silero_tts(语音合成)、whisper_stt(语音输入)、sd_api_pictures 和 send_pictures(图像)、google_translate、superbooga 和 superboogav2、ngrok、gallery 以及 perplexity_colors 等。README 还指出,除此之外也有社区扩展。

→
不再需要安装「openai」扩展
现已集成兼容OpenAI和Anthropic的API:只需添加--api参数即可。那些要求启用openai扩展的教程,描述的是旧版运行方式。

#6. API模式

在启动选项中添加 --api 即可启动 API。根据仓库 Wiki,默认端口为 5000,可通过 --api-port 修改;只要您没有明确要求对外开放,API 就只在本地提供访问。Wiki 说明,该 API 离线运行,不连接 OpenAI,也不生成任何日志。其接口涵盖聊天、文本补全和 Anthropic 格式的消息,并支持工具调用。

本地API请求(官方Wiki示例)
curl http://127.0.0.1:5000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Hello!"}],
    "temperature": 0.6
  }'

您可以将任何 OpenAI 客户端(聊天前端、编程智能体、LangChain)指向该地址来连接。所有 API 端点的交互式文档都提供在同一地址的 /docs 路径下。

#向其他人开放界面:需要了解的选项

默认情况下,只能从您的电脑访问该界面。有三个选项可以改变这一点。--listen 使该界面可从您的局域网访问。--share 会创建一个公开地址,除非是临时测试,否则应避免使用。而 --multi-user 不会保存聊天记录:代码仓库将其描述为适合彼此信任的小型团队,而非企业级解决方案。

对于 API,只要开始监听网络连接,就应添加 --api-key,并设置一个您自行选择的密钥:没有密钥时,任何能访问该端口的设备都可以向您的模型发起请求。若要真正用于团队协作(账户、角色、日志记录),则更适合在引擎前部署一个专用前端。

#TextGen 与 Ollama、LM Studio 的对比

根据需求选择合适的工具
需求TextGenOllama 或 LM Studio
使用 GGUF 快速上手便携版,操作也简单Ollama:一条命令;LM Studio:引导式界面
测试多种引擎和格式是的:这是它的优势专注于GGUF
在界面中微调 LoRA可以,但需要完整安装否
为团队提供服务不太适合(多用户支持有限)以 Ollama 作为 Open WebUI 或 LibreChat 的后端
日常使用流畅需要更多设置,也需要更多手动操作更易于维护

总结:TextGen 是用于探索和精细调优的工具,而非初学者日常使用的工具。如果您想先与模型对话,建议先使用 Ollama 或 LM Studio;当您需要其他工具无法提供的引擎、格式或训练方式时,再回到 TextGen。

常见问题
oobabooga和Text Generation WebUI是同一个东西吗?+
是的。oobabooga 是开发者的名字,Text Generation WebUI 是该项目的旧名称,现称为 TextGen。旧的 GitHub 地址已重定向至 github.com/oobabooga/textgen。这是我们所知的唯一官方来源:请避免使用第三方下载站点,并在执行任何操作前核实地址。
2026 年如何安装 Text Generation WebUI?+
最简单的方式是使用便携版,可从仓库的发布版本页面下载:它开箱即用,但仅支持GGUF模型。如需使用其他引擎、进行训练或使用扩展,请克隆仓库并运行start_windows.bat、start_linux.sh或start_macos.sh,同时预留约10 GB的磁盘空间。
支持哪些推理引擎和格式?+
当前README列出了llama.cpp、ik_llama.cpp、Transformers、ExLlamaV3和TensorRT-LLM。GGUF格式由llama.cpp处理,而llama.cpp是便携版唯一的引擎。旧教程中提到的ExLlamaV2、AWQ、GPTQ和vLLM已不再列于其中:在按照提及它们的指南操作前,请先查阅文档。
是否真的离线且无遥测功能?+
该仓库声称实现100%离线和私有运行,无遥测、无外部资源、无更新请求。Wiki说明API不连接OpenAI,也不生成日志。而其网络搜索功能本质上会访问互联网:为确保严格本地使用,请关闭该功能。
如何启用 API 以连接其他工具?+
在命令行或 user_data/CMD_FLAGS.txt 中添加 --api。默认端口为 5000,可通过 --api-port 修改,地址为 http://127.0.0.1:5000/v1。如果在网络上监听,请添加 --api-key 以要求提供密钥;否则,任何能够连接到该端口的设备都可以使用该 API。
应优先选择TextGen还是Ollama?+
刚开始时不建议优先选择 TextGen:Ollama 和 LM Studio 日常使用更简单,需要理解的选项也更少。当您想测试多种引擎和格式、在界面中训练 LoRA,或精细调整生成过程时,TextGen 才有其价值。常见的做法是日常使用 Ollama,探索时使用 TextGen。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。