安装 DeepSeek R1 Ollama
DeepSeek R1 是 DeepSeek 以 MIT 许可证发布的思维链推理模型。完整模型拥有 6710 亿个参数,个人计算机难以运行,但蒸馏版本(1.5B 至 70B)可以在消费级硬件上轻松运行。本教程介绍如何使用 Ollama 安装 DeepSeek R1、选择合适的模型规模,以及充分利用推理模式。
#为什么选择 DeepSeek R1?
R1 不是“常规”的大语言模型:在回答之前,它会生成一条可见的推理链,用 <think>...</think> 标签包裹。正是这一阶段,使它能够解决直接生成答案的模型经常无法解决的数学、逻辑或代码问题。在 AIME 2024 和 MATH-500 上,14B 和 32B 的蒸馏模型大幅超越 Llama 3.1 70B Instruct,尽管后者的规模是它们的 2 到 5 倍。
另一个优势是 MIT 许可证:没有商业用途或地域限制。您可以将 R1 集成到产品、智能体或内部工具中,无需征得任何人的许可。对于达到这一水平的推理模型而言,这很少见。
#可用的蒸馏版本
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
Ollama 提供了七种不同规模的 deepseek-r1 模型。默认标签指向7B参数的蒸馏版本(Qwen 7B 基础版)。
- deepseek-r1:1.5b
- 基于 Qwen 2.5 Math 1.5B。轻量,非常适合在没有GPU的笔记本电脑上测试。处理复杂问题时质量有限。
- deepseek-r1:7b
- 基础模型 Qwen 2.5 Math 7B。默认标签。8 GB VRAM下的良好平衡选择。优秀的入门模型。
- deepseek-r1:8b
- 以 Llama 3.1 8B 为基础。比 7B 版本稍微更健谈,法语表现更好。
- deepseek-r1:14b
- 以 Qwen 2.5 14B 为基础模型。数学能力有显著提升。对于 12 GB 显存来说,是一个理想的平衡点。
- deepseek-r1:32b
- 基于 Qwen 2.5 32B。在大多数推理基准测试中达到 o1-mini 的水平。Q4 量化下需要 24 GB 显存。
- deepseek-r1:70b
- 基于Llama 3.3 70B。蒸馏模型中能力最强的一款。配置:32 GB显存的RTX 5090,或64 GB及以上内存的Mac Studio。
- deepseek-r1:671b
- 完整模型(MoE,总参数 671B,激活参数 37B)。超出一般个人电脑的能力范围,但可以在配备 512 GB 内存的 Mac Studio Ultra 上运行。
#前置要求与不同模型规模所需的显存
在使用 Ollama 安装 DeepSeek R1 之前,请确认已安装 Ollama(守护进程默认监听 http://localhost:11434),并且 GPU 的显存足以容纳您选定规模的模型。以下列出了 Q4_K_M 量化的显存需求,这是 Ollama 默认下载的量化版本。
- 1.5B Q4
- ~1.1 GB VRAM,可在任意 GPU 上运行,甚至纯 CPU 上运行(15-25 个 token/秒)。
- 7B Q4
- ~4.7 GB显存。RTX 3050 8GB、4060 8GB、Mac M1/M2 16GB。
- 8B Q4
- 约需 5.2 GB 显存。适用范围与 7B 版本相同,但在 6 GB 显存上剩余空间更少。
- 14B Q4
- ~9 GB 显存。RTX 3060 12 GB,4070 12 GB,M2 Pro 16 GB
- 32B Q4
- ~19 GB 显存。RTX 3090/4090 24 GB,M3 Max 36 GB。
- 70B Q4
- 约 40 GB 显存。32 GB 的 RTX 5090 需配合 offload,或使用 64 GB 及以上的 Mac Studio Ultra。
#1. 安装模型
只需一条命令。Ollama 会从其官方模型仓库下载权重,并在首次使用时将模型加载到内存中。
要选择特定规模的模型,请添加标签:
首次启动会下载模型(1.5B版本为1 GB,70B版本为40 GB)。后续启动若模型仍保留在Ollama的缓存中,则为即时加载。
#2. 选择模型大小
模型大小的选择取决于三个因素:显存、任务类型,以及您对等待时间的容忍度。R1 在给出最终回答前,平均会生成 500 至 2000 个推理 token——因此,其生成的 token 数量是传统直接生成答案的聊天模型的 3 至 10 倍。速度确实很重要。
- 在无高端 GPU 的情况下测试 R1
- 1.5B 或 7B。即使只用 CPU,聊天响应延迟也在可接受范围内。
- 高中数学 / 简单 Python
- 7B 或 8B。在 80% 的情况下够用,但在高等代数方面表现不尽如人意。
- 高难度数学、逻辑、长程推理
- 至少需要 14B。在 AIME 和 MATH-500 任务上,8B 到 14B 之间存在明显跃升。
- o1-mini 级别,复杂调试,演示
- 32B。如果您有 24 GB 显存,这个模型规模就是理想选择。
- 本地能运行的最大模型
- 70B Q4:可在 RTX 5090 上配合卸载到系统内存运行,或在内存至少为 64 GB 的 Mac Studio 上运行。
#3. 首个推理提示
R1 在需要多步推理的问题上表现出色。我们用一道 14B 模型也能尝试解答的 AIME 经典题来测试它:
请注意这一结构:<think> 和 </think> 之间的所有内容都是模型的思维链。您可以将其展示给最终用户、隐藏起来,或记录到日志中以便调试。这是在应用中提升可解释性的有效手段。
#4. Q4与Q8:选择量化方式
默认情况下,Ollama 会下载 Q4_K_M(推荐的质量与内存平衡方案)。对于推理模型,部分用户更倾向于使用 Q8_0——在思维链任务中,质量下降比普通聊天更为明显。
- Q4_K_M
- 默认的折中选择。在数学基准测试中,质量比 FP16 低 2% 至 4%。应当优先选择这一方案。
- Q5_K_M
- 与 Q4 相比,质量提高 1%,内存占用增加 25%。如果显存有余量,但不足以运行更大规模的模型,这个版本值得考虑。
- Q8_0
- 质量接近 FP16(-0.5%)。内存占用是 Q4 的两倍。如果您希望在14B或32B模型上获得最佳表现,且显存充足,推荐使用。
- FP16
- 全精度基准。对于蒸馏模型,相比 Q8 没有实际优势,而且体积是 Q4 的 4 倍。
#DeepSeek R1 对比 Qwen 3.8 27B
Qwen 3.8 27B 由 Qwen 团队于 2026 年 8 月 14 日发布,是 2026 年开放权重通用模型的标杆:上下文长度为 262k token,支持视觉,采用 Apache 2.0 许可证,最重要的是内置推理模式。当您需要一个既能推理又能处理其他所有任务的模型时,它自然是 R1 的替代之选。该选哪一个?
- DeepSeek R1 32B
- 专注于纯推理。在数学基准测试(AIME、MATH-500)上表现更好。推理过程始终可见,并可通过 <think>...</think> 轻松解析。它只做这一件事,但做得非常出色。
- Qwen 3.8 27B
- 2026年通用模型,内置推理功能。上下文长度262k,支持视觉,采用Apache 2.0许可,Q4量化下约18 GB。默认情况下会过度推理:即使面对简单问题,也会展开冗长而无用的思维链。将其推理级别设置为low,即可恢复直接回答。
- 实用结论
- R1 32B 在纯数学和逻辑任务上,以及在提供稳定、可记录到日志中的推理格式方面,仍然领先。如果您需要一个能按需推理的多功能模型(代码、聊天、视觉、长上下文),Qwen 3.8 27B 就更有优势。在法语方面,两者表现都很扎实。
- 资源
- 资源需求相当。R1 32B 采用 Q4 量化后可放入 24 GB 显存(RTX 3090/4090)。Qwen 3.8 27B 稍轻一些(Q4 量化后约 18 GB),在同一张显卡上为上下文留出的余量更大。
#故障排除
- 不显示 <think> 的模型
- 您可能正在使用一个屏蔽XML标签的客户端。请尝试使用ollama run en CLI来验证模型是否能正确生成这些标签。如果API JSON切断了标签,问题出在客户端。
- 截断的回复
- Ollama 的默认上下文为 4096 个 token。R1 在推理过程中会消耗大量 token。请增加该值:在会话中执行 /set parameter num_ctx 16384,或通过 API 中的 options.num_ctx 参数设置。
- 即使 GPU 性能不错,运行仍然很慢
- 使用 ollama ps 检查模型是否 100% 运行在 GPU 上。如果 PROCESSOR 列显示 CPU,说明 RAM 已溢出。请降低模型尺寸或采用更激进的量化。
- 模型的思维链陷入循环
- 这是小规模蒸馏模型(1.5B、7B)面对过难问题时的典型表现。要么换用更大的模型,要么提出更简单的问题,要么在提示中添加「请回答,推理部分少于 500 个 token」。
- 错误“insufficient memory”
- 模型过大,超出您的显存容量。先执行 ollama rm deepseek-r1:32b,再执行 ollama pull deepseek-r1:14b。您也可以通过 OLLAMA_GPU_LAYERS 强制将部分模型卸载到系统内存。
#深入了解
安装完成后,可以顺着这几个方向继续探索:
- 理解量化技术
- 网站的Q4/Q5/Q8指南详细说明了具体权衡,建议在扩大模型规模前参考。
- 选择 GPU 进行 R1 部署
- 如果您认真考虑使用 32B 版本,GPU 购买指南列出了 2026 年应瞄准的 24/32 GB 显存门槛。
- 将 R1 接入用户界面
- Open WebUI 或 LM Studio 原生支持 <think> 标签,并允许折叠或展开推理过程。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。