本地 abliterated(无审查)模型:指南 pratique
Qwen、Gemma 和 Mistral 等开放权重模型经过了对齐训练,会拒绝某些请求。abliterated 模型是一种在权重层面精准移除了这种拒绝行为的变体——这不是通过越狱提示词实现的,而是通过修改神经网络本身实现的。本指南解释这项技术实际做了什么、在哪里找到这些模型、如何使用 Ollama 或 GGUF 格式在本地运行它们,以及真正的局限在哪里。
#什么是 abliterated 模型
所谓“abliterated”(有时也称为“decensored”或“uncensored”)模型,是指移除了拒绝能力的开放权重大语言模型。当您提出一个标准版 Qwen 3.5 会以“I cannot help with that”拒绝的请求时,abliterated 版本会直接作答,不附带对齐提示、不添加说教式前言,也不转移问题。
重要:这不是通过提示词实现的越狱。模型的权重已经被修改。由于触发拒绝的内部方向已被移除,从机制上说,拒绝已不再可能——或者至少变得极为罕见。
#消融的工作原理
你现在已经知道什么是“abliterated”模型了。无过滤 AI 套件先介绍法国和欧洲的法律框架(第 4 章),再教你如何在下载前评估模型变体(第 5、6 章),以及如何选择能装入你显存的变体(第 7 章)。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
消融方法基于 Arditi 等人于 2024 年发表的一项研究结果(《Refusal in Language Models Is Mediated by a Single Direction》)。作者表明,在大多数经过对齐的 LLM 中,拒绝行为由内部激活空间中的单一方向控制——通过比较模型在无害提示和触发拒绝的提示下的激活值,可以分离出这一向量。
消融是通过投影运算,逐层从模型权重中去除这一方向。具体来说,就是修改投影矩阵,使其无法再产生与拒绝相关的分量。模型仍然正常运行,但此前使它切换到“我拒绝”模式的“内部信号”已被切断。
- 步骤 1 — 探测
- 向模型输入几十对提示:中性提示和会使模型拒绝回答的提示。记录每一层的激活值。
- 步骤2 — 隔离
- 我们计算两个组之间激活值的平均差异。该向量经归一化后即为拒绝方向。
- 步骤3 — 投影
- 通过修改每一层的权重,使模型无法再沿这个方向产生激活。这只是减去一个正交投影,并不是重新训练。
- 步骤4 — 测试
- 检查模型是否不再拒绝请求,以及其通用能力(推理、编程、法语)是否未出现大幅下降。
#在哪里找到 abliterated 模型
这个生态系统主要集中在 Hugging Face 上。一些发布者因其消融处理的质量而在社区中具有公信力:
- mlabonne
- Maxime Labonne 是最早推广这项技术的人之一。Qwen 3.5、Gemma 4 和 Mistral Small 的 abliterated 版本——这些版本均在 huggingface.co/mlabonne 上有说明。
- huihui-ai
- 涵盖的模型范围很广:Qwen 3.5(2B 至 27B)、Granite 4.2、Gemma 4、GLM 4.7。变体标记为“-abliterated”或“-abliterate”。
- failspy
- 多个代表性变体的作者(Qwen 3.5 9B abliterated、Gemma 4 12B abliterated)。这些变体的质量引发了很多讨论。
- Orenguteng / Lexi
- “Lexi-Uncensored”系列结合了消融和轻量微调,以其对话语气著称。
使用 Ollama 时,官方模型库也提供许多变体——请在 ollama.com/library 上查找包含 abliterated 或 uncensored 的标签,或使用 huihui_ai 和 mlabonne 发布的社区变体,这些变体可以直接拉取。
#在 Ollama 中安装
在本地运行 abliterated LLM,最简单的方法是使用 Ollama。守护进程默认监听 http://localhost:11434,无需特殊配置即可使用社区提供的变体。
- 01检查 Ollama 是否正在运行在终端中运行 ollama --version。如果命令失败,请先按照 Ollama 安装指南进行安装,再继续操作。
- 02选择适合您 VRAM 的模型重新确认大致规模:7-8B Q4 约需 5 GB,14B 约需 9 GB,32B 约需 19 GB,70B 约需 40 GB。RTX 3060 12 GB 足以流畅运行 8B 模型,RTX 4090 24 GB 可支持 32B 模型。
- 03拉取并运行使用 ollama run,并指定模型变体的完整名称。模型会先下载,再加载到 VRAM 中,随后开始对话。
- 04测试典型拒绝场景提出一个基础模型会拒绝回答的问题。如果该变体经过了正确的 abliteration 处理,就会直接给出回答,不加任何开场说明。
模型加载后,使用方式就与 Ollama 中的其他大语言模型一样:在 :11434 提供兼容 OpenAI 的端点,可接入 Open WebUI、Continue.dev、LiteLLM 和您的 Python 脚本。无需任何特殊选项,abliterated 模型就能“正常运行”——不拒绝请求这一特性体现在权重中,而不是配置中。
#使用 GGUF (LM Studio, llama.cpp)
如果您更倾向于使用 LM Studio 或直接使用 llama.cpp,就需要使用 GGUF 文件。Hugging Face 上的大多数消融版本已经提供多种量化版本——Q4_K_M 仍是推荐的折中选择(保留质量、显存占用最低);如果显存有余量,可选 Q5_K_M;如果追求最高保真度,可选 Q8_0。
- 01识别 GGUF 仓库在 Hugging Face 上,查找带有 -GGUF 标记的仓库。例如:mlabonne/Qwen3.5-9B-abliterated-GGUF 或 bartowski/<modele>-abliterated-GGUF。
- 02下载合适的量化版本在 LM Studio 中,界面可按大小和发布方筛选。大多数情况下,优先选择 Q4_K_M。对于很小的模型(1–3B),Q5_K_M 或 Q6_K 可避免明显的质量损失。
- 03加载并测试显存充足时,LM Studio 会自动将模型层加载到 GPU。请留意 offload 指示器——如果部分模型因显存不足而转移到系统内存中运行,速度就会下降。
- 04通过 API 暴露接口若需将服务集成到您的应用中,请启用本地OpenAI兼容服务器。LM Studio 的默认端口为1234(而 Ollama 为11434)。
#限制与质量下降
消融并非没有代价。在残差流中移除一个方向,会改变所有沿该方向传递的信息,包括有用的成分。实践中观察到的副作用包括:
- 推理基准测试成绩略有下降
- 通常会在 MMLU 或 GSM8K 上下降 1–3 分。这种下降可以测量到,但在实际使用中很少会成为障碍。
- 回答有时更机械
- 模型在对齐方面会失去一部分细腻程度:更少主动请求澄清,也更少给出提醒,即使这些提醒本来会有帮助。
- 幻觉发生频率略高
- 对于模型原本会回答“我不太确定”的问题,它往往会编造一个语气笃定的答案。
- 残留行为
- 某些拒答行为仍会出现,尤其是在拒答机制消融不够到位的模型上。相反,一些拒答机制消融得很彻底的模型会回答任何问题——包括那些您宁愿它们保持沉默的问题。
#风险与负责任的使用
一个不会拒绝任何请求的模型绝不是玩具。在将其应用于实际场景之前,先了解几个基本原则:
- 您仍须对输出结果负责
- 无论您使用的是对齐模型、abliterated 模型还是云端模型,如何使用这些回答都由您决定。GDPR、刑法和著作权法不会因模型版本而改变。
- 未设置过滤机制时,请勿开放供用户自助使用
- 如果您为团队搭建 API 端点,至少应在应用层设置过滤机制(关键词过滤、输出审核)。一般而言,在内部聊天中直接使用未加任何防护的 abliterated 模型并不是好主意。
- 向用户如实说明情况
- 如果接入 abliterated 模型的应用会生成可能让用户感到意外的内容,请提前告知用户。没有意外,也就没有官司。
- 正当用途,实际用途
- AI 安全研究、红队测试,以及敏感语料(医疗、法律、安全)的处理:如果对齐模型的拒绝行为使工具无法使用,那么这些就是消融真正有价值的场景。“我只是为了好玩而移除了审查”会带来极不理想的输出风险,却没有收益。
#技巧与故障排除
- 模型仍然会拒绝
- 某些消融版本仍会在特定主题(政治、医学、未成年人)上出现拒绝回答的情况。尝试同一模型的其他消融版本,或更换发布者——消融质量差异很大。
- 模型输出变得不连贯
- 这是消融过于激进的症状(移除了过多方向,或未正确分离出目标方向)。请优先选择知名发布者提供的变体,而不是自行制作、缺乏文档说明的消融版本。
- 法语表现不佳
- 与所有开放权重模型一样,法语能力取决于基础模型。Qwen 3.5、Mistral Small、Gemma 4 和 Granite 4.2 表现扎实;较早的模型(Llama 3、Phi-3、Gemma 2)则较弱。消融处理不会改变这一点。
- 残留的“As an AI, I cannot...”式开场白
- 与其进行越狱,不如添加一个简短的系统提示,提醒模型的角色和预期格式。这通常足以消除对齐残留。
- VRAM已满
- 显存为 8 GB 时,请使用 Q4_K_M 量化的 7–8B 模型。显存为 12 GB 时,可以提高到 Q5_K_M 量化,或尝试 Q4 量化的 14B 模型。显存为 24 GB 时,Q4 量化的 32B 模型可以轻松容纳。
#深入了解
消融是定制开放权重模型的入门途径。若想进一步探索:
- 使用 Ollama Modelfile 自定义模型
- 如果您想在 abliterated 变体之上叠加系统提示词、参数和模板,Modelfile 就是需要了解的工具。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 帮助您根据 VRAM 容量和目标质量,了解该加载哪个 GGUF——消融不会改变这些取舍。
- 本地微调 LLM:LoRA 和 QLoRA
- 如果仅靠消融还不能满足您的需求,而您希望调整语气或适配特定领域,那么在 abliterated 变体上进行轻量级 LoRA 微调通常是最佳折中方案。
是否存在一种无限制、无审查的AI?+
本地运行无审查的AI是合法的吗?+
在本地运行的无限制 AI 会没那么聪明吗?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。