进阶 10 分钟个性化

本地 abliterated(无审查)模型:指南 pratique

Qwen、Gemma 和 Mistral 等开放权重模型经过了对齐训练,会拒绝某些请求。abliterated 模型是一种在权重层面精准移除了这种拒绝行为的变体——这不是通过越狱提示词实现的,而是通过修改神经网络本身实现的。本指南解释这项技术实际做了什么、在哪里找到这些模型、如何使用 Ollama 或 GGUF 格式在本地运行它们,以及真正的局限在哪里。

作者: Mohamed Meguedmi·更新于 2026-09-01·已在 Windows、macOS 和 Linux 上测试

#什么是 abliterated 模型

所谓“abliterated”(有时也称为“decensored”或“uncensored”)模型,是指移除了拒绝能力的开放权重大语言模型。当您提出一个标准版 Qwen 3.5 会以“I cannot help with that”拒绝的请求时,abliterated 版本会直接作答,不附带对齐提示、不添加说教式前言,也不转移问题。

重要:这不是通过提示词实现的越狱。模型的权重已经被修改。由于触发拒绝的内部方向已被移除,从机制上说,拒绝已不再可能——或者至少变得极为罕见。

i
拒绝方向消融(Abliterated)、微调、越狱:三种不同的处理方式
越狱模型是在原始模型上加一个巧妙的提示词,促使它绕过自身的安全防护(这种方式不稳定)。经过微调的无审查模型则是在不含拒答示例的数据集上重新训练的(成本高)。经过 abliterated 处理的模型,只是通过线性代数运算移除了拒答方向(速度快,能更好地保留质量)。

#消融的工作原理

无过滤 AI 套件

你现在已经知道什么是“abliterated”模型了。无过滤 AI 套件先介绍法国和欧洲的法律框架(第 4 章),再教你如何在下载前评估模型变体(第 5、6 章),以及如何选择能装入你显存的变体(第 7 章)。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新

消融方法基于 Arditi 等人于 2024 年发表的一项研究结果(《Refusal in Language Models Is Mediated by a Single Direction》)。作者表明,在大多数经过对齐的 LLM 中,拒绝行为由内部激活空间中的单一方向控制——通过比较模型在无害提示和触发拒绝的提示下的激活值,可以分离出这一向量。

消融是通过投影运算,逐层从模型权重中去除这一方向。具体来说,就是修改投影矩阵,使其无法再产生与拒绝相关的分量。模型仍然正常运行,但此前使它切换到“我拒绝”模式的“内部信号”已被切断。

步骤 1 — 探测
向模型输入几十对提示:中性提示和会使模型拒绝回答的提示。记录每一层的激活值。
步骤2 — 隔离
我们计算两个组之间激活值的平均差异。该向量经归一化后即为拒绝方向。
步骤3 — 投影
通过修改每一层的权重,使模型无法再沿这个方向产生激活。这只是减去一个正交投影,并不是重新训练。
步骤4 — 测试
检查模型是否不再拒绝请求,以及其通用能力(推理、编程、法语)是否未出现大幅下降。
→
为什么这么快
消融不需要性能极强的GPU,也不需要进行数小时的训练。即使是70B模型,几分钟到几小时也足够,因为只需对现有矩阵进行线性代数运算。

#在哪里找到 abliterated 模型

这个生态系统主要集中在 Hugging Face 上。一些发布者因其消融处理的质量而在社区中具有公信力:

mlabonne
Maxime Labonne 是最早推广这项技术的人之一。Qwen 3.5、Gemma 4 和 Mistral Small 的 abliterated 版本——这些版本均在 huggingface.co/mlabonne 上有说明。
huihui-ai
涵盖的模型范围很广:Qwen 3.5(2B 至 27B)、Granite 4.2、Gemma 4、GLM 4.7。变体标记为“-abliterated”或“-abliterate”。
failspy
多个代表性变体的作者(Qwen 3.5 9B abliterated、Gemma 4 12B abliterated)。这些变体的质量引发了很多讨论。
Orenguteng / Lexi
“Lexi-Uncensored”系列结合了消融和轻量微调,以其对话语气著称。
!
检查模型详情
标有“uncensored”或“abliterated”的模型,质量并不都一样。请阅读模型卡:有些发布方会提供所用脚本及消融后的评估结果,有些则只有一个哗众取宠的标题。如有疑问,优先选择历史记录可核实的发布方。

使用 Ollama 时,官方模型库也提供许多变体——请在 ollama.com/library 上查找包含 abliterated 或 uncensored 的标签,或使用 huihui_ai 和 mlabonne 发布的社区变体,这些变体可以直接拉取。

#在 Ollama 中安装

在本地运行 abliterated LLM,最简单的方法是使用 Ollama。守护进程默认监听 http://localhost:11434,无需特殊配置即可使用社区提供的变体。

  1. 01
    检查 Ollama 是否正在运行
    在终端中运行 ollama --version。如果命令失败,请先按照 Ollama 安装指南进行安装,再继续操作。
  2. 02
    选择适合您 VRAM 的模型
    重新确认大致规模:7-8B Q4 约需 5 GB,14B 约需 9 GB,32B 约需 19 GB,70B 约需 40 GB。RTX 3060 12 GB 足以流畅运行 8B 模型,RTX 4090 24 GB 可支持 32B 模型。
  3. 03
    拉取并运行
    使用 ollama run,并指定模型变体的完整名称。模型会先下载,再加载到 VRAM 中,随后开始对话。
  4. 04
    测试典型拒绝场景
    提出一个基础模型会拒绝回答的问题。如果该变体经过了正确的 abliteration 处理,就会直接给出回答,不加任何开场说明。
示例 — Qwen 3.5 9B 的 abliterated 变体
ollama run huihui_ai/qwen3.5-abliterated:9b
示例——Gemma 4 12B 的 abliterated 变体
ollama run huihui_ai/gemma4-abliterated:12b
# ou, depuis Hugging Face directement :
# ollama run hf.co/mlabonne/gemma-4-12b-it-abliterated-GGUF
→
直接从Hugging Face拉取
从 Ollama 0.4 起,您可以直接执行 ollama run hf.co/<publisher>/<modele>-GGUF,无需通过 Ollama 模型注册中心。这便于快速测试 mlabonne 或 failspy 发布、但尚无官方标签的消融版本。

模型加载后,使用方式就与 Ollama 中的其他大语言模型一样:在 :11434 提供兼容 OpenAI 的端点,可接入 Open WebUI、Continue.dev、LiteLLM 和您的 Python 脚本。无需任何特殊选项,abliterated 模型就能“正常运行”——不拒绝请求这一特性体现在权重中,而不是配置中。

#使用 GGUF (LM Studio, llama.cpp)

如果您更倾向于使用 LM Studio 或直接使用 llama.cpp,就需要使用 GGUF 文件。Hugging Face 上的大多数消融版本已经提供多种量化版本——Q4_K_M 仍是推荐的折中选择(保留质量、显存占用最低);如果显存有余量,可选 Q5_K_M;如果追求最高保真度,可选 Q8_0。

  1. 01
    识别 GGUF 仓库
    在 Hugging Face 上,查找带有 -GGUF 标记的仓库。例如:mlabonne/Qwen3.5-9B-abliterated-GGUF 或 bartowski/<modele>-abliterated-GGUF。
  2. 02
    下载合适的量化版本
    在 LM Studio 中,界面可按大小和发布方筛选。大多数情况下,优先选择 Q4_K_M。对于很小的模型(1–3B),Q5_K_M 或 Q6_K 可避免明显的质量损失。
  3. 03
    加载并测试
    显存充足时,LM Studio 会自动将模型层加载到 GPU。请留意 offload 指示器——如果部分模型因显存不足而转移到系统内存中运行,速度就会下降。
  4. 04
    通过 API 暴露接口
    若需将服务集成到您的应用中,请启用本地OpenAI兼容服务器。LM Studio 的默认端口为1234(而 Ollama 为11434)。
i
量化与消融
消融是在未量化的模型上进行的,随后再对处理结果进行量化。因此,您直接获取的就是已经过 abliterated 处理的变体的 GGUF 文件——量化方面没有什么需要额外“启用”的。

#限制与质量下降

消融并非没有代价。在残差流中移除一个方向,会改变所有沿该方向传递的信息,包括有用的成分。实践中观察到的副作用包括:

推理基准测试成绩略有下降
通常会在 MMLU 或 GSM8K 上下降 1–3 分。这种下降可以测量到,但在实际使用中很少会成为障碍。
回答有时更机械
模型在对齐方面会失去一部分细腻程度:更少主动请求澄清,也更少给出提醒,即使这些提醒本来会有帮助。
幻觉发生频率略高
对于模型原本会回答“我不太确定”的问题,它往往会编造一个语气笃定的答案。
残留行为
某些拒答行为仍会出现,尤其是在拒答机制消融不够到位的模型上。相反,一些拒答机制消融得很彻底的模型会回答任何问题——包括那些您宁愿它们保持沉默的问题。
→
在采用前进行比较
在用abliterated版本替换基础模型前,请先用10到20个代表您实际使用场景的提示词,在两个版本上分别测试。您会立刻知道这种性能损失是否可接受。

#风险与负责任的使用

一个不会拒绝任何请求的模型绝不是玩具。在将其应用于实际场景之前,先了解几个基本原则:

您仍须对输出结果负责
无论您使用的是对齐模型、abliterated 模型还是云端模型,如何使用这些回答都由您决定。GDPR、刑法和著作权法不会因模型版本而改变。
未设置过滤机制时,请勿开放供用户自助使用
如果您为团队搭建 API 端点,至少应在应用层设置过滤机制(关键词过滤、输出审核)。一般而言,在内部聊天中直接使用未加任何防护的 abliterated 模型并不是好主意。
向用户如实说明情况
如果接入 abliterated 模型的应用会生成可能让用户感到意外的内容,请提前告知用户。没有意外,也就没有官司。
正当用途,实际用途
AI 安全研究、红队测试,以及敏感语料(医疗、法律、安全)的处理:如果对齐模型的拒绝行为使工具无法使用,那么这些就是消融真正有价值的场景。“我只是为了好玩而移除了审查”会带来极不理想的输出风险,却没有收益。
!
消融不会改变的部分
消融会去除拒绝回答的机制,但不会去除知识。如果基础模型在训练中从未接触过某个危险主题,经过消融处理的模型也不会因此知道更多。反过来,原本“知道”却拒绝说出来的模型,现在会说出来——这正是需要谨慎的原因。

#技巧与故障排除

模型仍然会拒绝
某些消融版本仍会在特定主题(政治、医学、未成年人)上出现拒绝回答的情况。尝试同一模型的其他消融版本,或更换发布者——消融质量差异很大。
模型输出变得不连贯
这是消融过于激进的症状(移除了过多方向,或未正确分离出目标方向)。请优先选择知名发布者提供的变体,而不是自行制作、缺乏文档说明的消融版本。
法语表现不佳
与所有开放权重模型一样,法语能力取决于基础模型。Qwen 3.5、Mistral Small、Gemma 4 和 Granite 4.2 表现扎实;较早的模型(Llama 3、Phi-3、Gemma 2)则较弱。消融处理不会改变这一点。
残留的“As an AI, I cannot...”式开场白
与其进行越狱,不如添加一个简短的系统提示,提醒模型的角色和预期格式。这通常足以消除对齐残留。
VRAM已满
显存为 8 GB 时,请使用 Q4_K_M 量化的 7–8B 模型。显存为 12 GB 时,可以提高到 Q5_K_M 量化,或尝试 Q4 量化的 14B 模型。显存为 24 GB 时,Q4 量化的 32B 模型可以轻松容纳。

#深入了解

消融是定制开放权重模型的入门途径。若想进一步探索:

使用 Ollama Modelfile 自定义模型
如果您想在 abliterated 变体之上叠加系统提示词、参数和模板,Modelfile 就是需要了解的工具。
选择量化方案(Q4、Q5、Q8、FP16)
帮助您根据 VRAM 容量和目标质量,了解该加载哪个 GGUF——消融不会改变这些取舍。
本地微调 LLM:LoRA 和 QLoRA
如果仅靠消融还不能满足您的需求,而您希望调整语气或适配特定领域,那么在 abliterated 变体上进行轻量级 LoRA 微调通常是最佳折中方案。
常见问题
是否存在一种无限制、无审查的AI?+
是的,但仅限本地运行:所有声称‘无限制’的在线服务实际上都在服务器端设置过滤和用户协议。真正无审查的 AI 是本地运行的‘被清除’模型——其拒绝行为已从权重中移除,没有任何数据经过第三方服务器。这正是本指南所涵盖的内容。
本地运行无审查的AI是合法的吗?+
在家运行经过拒绝行为消融的模型(abliterated)是合法的:这些是经过修改并公开分发的开放权重。然而,您用这些模型生成的内容仍受一般法律约束——消融移除的是模型的拒绝行为,并不会免除您的责任。还应检查所用变体的许可证(通常沿用原模型的许可证)。
在本地运行的无限制 AI 会没那么聪明吗?+
是的,会略有下降:消融会稍微降低整体质量(参见“局限性与质量损失”一节)。日常使用时,差异很小;对于编程或要求较高的推理,请同时保留原始版本——两者可以在 Ollama 中很好地共存。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。