蒸馏:小型模型如何继承 gros
您大概见过 DeepSeek-R1-Distill-Qwen-14B 这样的名称,也曾疑惑:为什么一个“小”模型突然能推理得几乎和庞大的模型一样好?答案可以用一个词概括:蒸馏。这项技术让紧凑的模型继承比它大得多的模型的行为,却不必拥有同样庞大的规模或缓慢的速度。本指南用老师与学生的比喻解释 LLM 蒸馏,详细说明究竟传递了什么、哪些内容在过程中未能传递,以及如何在本地运行蒸馏模型之前判断蒸馏是否成功。
#蒸馏技术解决的问题
最好的开放模型规模庞大:拥有数千亿参数。它们表现出色,但无法在普通消费级电脑上使用:需要数十GB显存,而且生成速度较慢。相比之下,7B或14B模型能装入游戏显卡的显存,并快速响应,但往往缺少更大模型那样细致的推理能力。
因此,我们希望把大模型的一部分能力保留在能于本地运行的小模型中。一个天真的想法是,直接用与大模型相同的原始数据重新训练小模型。但这还不够:模型规模较小时,单靠海量文本自行学习,得到的模型虽能表现尚可,却难以出类拔萃。蒸馏提供了一条捷径:小模型不再从零重新学习整个世界,而是直接向大模型学习。
#师生学习原理
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
蒸馏涉及两个模型。“教师”是我们希望模仿的高性能大模型。“学生”是我们要训练的小模型。原理是:向教师提出数千个问题,获取其回答,再训练学生生成同样的回答。学生不再以网上找到的原始文本为学习材料,而是学习已经由专家模型“消化”过的示例。
真正起决定性作用的细微差别,在于学生究竟模仿什么。在信息最丰富的版本中,它不仅模仿教师最终选定的词,还模仿下一个词的完整概率分布:教师不只是说“答案是猫”,还会指出“猫的概率很高,狗有一点可能,烤面包机几乎不可能”。这些细微差别——有时被称为软标签——包含了单凭正确答案无法提供的信息。
- 教师(teacher)
- 参考级大模型,成本高但性能优异。它作为源模型使用,不会部署在本地。
- 学生(student)
- 通过训练来模仿教师模型行为的小模型。您将在本地运行的就是这个模型。
- 软标签
- 教师模型为每个可能的词给出的细致概率分布,而不只是概率最高的那个词。这是蒸馏最丰富的原材料。
- 蒸馏数据集
- 由所提出的问题和教师给出的回答组成的数据集合,供学生训练使用。
#真正被传递的内容
人们常以为蒸馏会“传递大模型的知识”。这在一定程度上是对的,但不够准确。最容易传递的主要是行为模式和做事方法,而不是那些具体事实。小模型的存储容量有限,无法记住大型模型内部那部百科全书中的全部内容。不过,它完全可以很好地学会方法。
- 推理风格
- 将问题分解为步骤、在得出结论前构建思维链的方法。这是最易传递的内容,也是R1-Distill的核心。
- 响应格式
- 结构、语气,以及组织解释或代码的方式。学生会采用教师的写作习惯。
- 解题模式
- 在数学、编程或逻辑问题上,学生模型继承了经过验证的解题方法:如何着手解决某类问题,以及需要做哪些检查。
- 部分知识
- 事实和关联可以传递,但受限于小模型的容量。这是传递效果最差的部分。
这一区别对于理解近期的蒸馏模型至关重要。当 DeepSeek 将 R1 蒸馏到一个 Qwen 14B 模型中时,目标并非将 R1 的全部通用知识塞进 140 亿参数中——这不可能实现。目标是传递其推理方式:分步思考、自我修正、展开推导过程。而这一点,小型模型完全可以学习得非常出色。
#为什么一个经过蒸馏的 14B 模型优于一个普通 14B 模型
这里有一点反直觉。两个模型的规模完全相同——都是140亿参数——因此显存占用和运行速度也相同。然而,蒸馏模型的推理能力往往远胜于常规模型。规模没有改变,改变的只有训练方式。为什么相同的参数数量能造就一个好得多的模型?
因为训练并不是随机填充参数,而是将它们组织起来。普通的 14B 模型独自从原始文本中学习,形成尚可但偏通用的能力。经过蒸馏的 14B 模型则从顶尖教师模型生成的示例中学习,这些示例往往包含完整展开的推理过程。它的 140 亿参数围绕优秀的方法组织起来,而不是各种内容都学一点。在容量相同的情况下,训练信号的质量决定了差异。
- 相同成本,更优质的学习信号
- 蒸馏模型既不会更大,也不会更慢,但它是在质量好得多的训练材料上学习的:专家的输出。
- 信息密度高的示例
- 教师模型的回答包含大量正确且完整的推理,这类推理在网上的原始文本中很少见。
- 更低的噪声
- 网上有大量错误和杂乱的信息。教师先进行筛选,让学生学习经过筛选的干净内容。
请注意不要过度解读:“胜过”主要适用于蒸馏所针对的任务,通常是推理、数学和编程。在一般知识或细致的事实知识方面,差距会缩小,甚至可能反过来。蒸馏模型并不会神奇地在所有方面都更强——它在经过针对性训练的领域才更强。
#R1-Distill的情况
让蒸馏技术在本地模型应用中普及的典型案例,是 2025 年初推出的 DeepSeek-R1-Distill 系列。DeepSeek 将其大型推理模型 R1 作为教师模型,把它的行为蒸馏到多个规模不同的学生模型中;这些学生模型基于 Qwen 和 Llama 等现有架构。结果是:1.5B、7B、8B、14B 和 32B 模型也能通过可见的思维链进行推理,而此前这种能力只属于超大型模型。
- R1-Distill-Qwen-1.5B
- 体积小巧,几乎可在任何设备上运行,甚至无需 GPU。以如此小的体积,在简单数学任务上的表现令人惊讶。
- R1-Distill-Qwen-7B / Llama-8B
- 面向大众用户的折中方案:Q4 下约占 5 GB,可在 8 GB 显存的显卡上运行。推理能力良好,适合日常使用。
- R1-Distill-Qwen-14B
- Q4 量化下约需 9 GB,适合 RTX 3060 12 GB 或 RTX 4070 12 GB。兼顾推理能力与易于获得的硬件,是一个理想的平衡点。
- R1-Distill-Qwen-32B
- Q4 量化下约需 19 GB,适合配备 24 GB 显存的 RTX 4090。如果您的显存足够,这是最接近教师模型的版本。
这些模型在给出最终答案前,会在思考标签之间展示思维链。这正是从教师模型 R1 传承过来的行为。实际使用中,R1-Distill-Qwen-14B 会针对数学问题展开结构化推理,而普通的 Qwen 14B 模型往往回答得较为平淡——两者的内存占用相同。
#局限:无法传承的能力
蒸馏的上限由学生模型的规模决定。巨人拥有的知识如同海洋,无法全部装进一枚顶针。了解蒸馏过程中丢失了什么,有助于避免失望和选错模型。
- 细粒度事实知识
- 小模型无法记住教师模型知道的所有内容。对于细节性或冷门领域的事实,它更容易产生幻觉。
- 在蒸馏任务范围之外的稳健性
- 在与蒸馏内容相差较大的任务上,学生模型的表现会回落到与同等规模的常规模型大致相当的水平。
- 模型能力的上限
- 经过蒸馏的7B模型依然是7B。蒸馏优化了参数使用,但不会增加参数数量。
- 在超长上下文中的连贯性
- 对于小模型来说,无论是否经过蒸馏,要在数万个 token 的跨度内跟进推理过程,仍然更加困难。
还存在一个更微妙的风险:蒸馏模型可能模仿教师的推理形式,但并不总是具备其准确度。它能够以令人信服的方式‘看起来像在思考’,但在超出其能力范围的问题上,仍可能自信地犯错。流畅的推理链条并不能保证准确性——这一点必须始终验证,尤其是涉及重要决策时。
#识别优质的模型蒸馏
并非所有蒸馏模型都质量相当。在下载前,一些判断指标可帮助你合理评估其质量,无需成为专家。
- 明确标明教师模型
- 一份好的模型说明会明确标明教师模型(例如“从 R1 蒸馏而来”)。教师模型声誉良好,是一个初步的积极信号。
- 清晰的基础架构
- 学生模型基于哪种架构构建(Qwen、Llama 等)?可靠且支持完善的基础架构有助于本地使用。
- 针对性基准测试
- 请查看目标任务(数学、编程、推理)上的得分,而不是一个含糊的综合分数。还应与同等规模的非蒸馏模型进行比较。
- 模型规模与宣传承诺是否相符
- 警惕那些被宣传为在所有方面都能媲美超大模型的极小模型。蒸馏有帮助,但创造不了奇迹。
- 推理格式
- 对于经过蒸馏的推理模型,请检查它是否确实展示了思维链,以及这条思维链是否与任务相关,而不只是装饰。
#本地可尝试的代表性蒸馏模型
以下是 2026 年值得关注的蒸馏模型,按从最轻量到资源需求最高的顺序排列,并列出它们在 Q4_K_M 量化下的大致内存占用。
- DeepSeek-R1-Distill-Qwen-1.5B
- 约 1.5 GB。押注超小模型:即使只用 CPU 或小型笔记本电脑也能运行。以这样的模型规模而言,其数学表现令人惊叹。
- DeepSeek-R1-Distill-Qwen-7B
- 约 5 GB,可装入一张 8 GB 显存的显卡。是在日常使用中体验蒸馏模型推理能力的理想入门选择。
- DeepSeek-R1-Distill-Qwen-14B
- 约 9 GB,适合 RTX 3060 12 GB 或 RTX 4070。在易于获得的硬件上,推理能力与硬件需求之间的平衡最佳。
- DeepSeek-R1-Distill-Qwen-32B
- ≈ 19 GB,适合配备 24 GB 显存的 RTX 4090。如果您的显存容量允许,这是最接近教师模型的选择。
如果您刚入门,可以从 7B 或 14B 版本开始:只用一张消费级显卡,就能体会蒸馏带来的价值,无需庞大配置的负担。1.5B 版本则是理解推理行为的绝佳实验平台,即使没有 GPU 也能使用。
#3分钟内尝试蒸馏模型
如果 Ollama 已安装并在默认端口监听(http://localhost:11434),只需两条命令,就能体会蒸馏相较于同等规模的常规模型带来的效果。
- 01下载并启动蒸馏模型获取一个 R1-Distill 模型并与它对话。首次启动会下载模型(几 GB,具体取决于所选模型的大小)。
- 02提出一个推理问题给出一个需要多步推理的数学或逻辑问题。观察其思维链:在得出结论前,会先展开推理过程。
- 03与未蒸馏模型进行对比运行同等规模的常规 Qwen 模型,并提出同一个问题。在显存占用和速度相同的情况下,蒸馏模型的推理应该更有条理。
#深入了解
将蒸馏与本地运行的其他基础概念联系起来,就更容易理解它。以下指南直接延伸了本指南的内容:
- 使用 Ollama 安装 DeepSeek R1
- 在本地运行 7B/14B/32B 蒸馏版本的分步指南,包含各规模模型所需的显存容量。
- MoE原理说明:为何30B-A3B模型运行得像小型模型
- 架构上的另一大技巧,使大模型能够在本地运行,与蒸馏技术相辅相成。
- 选择量化方案(Q4、Q5、Q8、FP16)
- 选定您的蒸馏模型后,量化决定了其在显存中的最终内存占用。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。