入门 8 分钟Ollama

安装 DeepSeek R1 Ollama

DeepSeek R1 是 DeepSeek 以 MIT 许可证发布的思维链推理模型。完整模型拥有 6710 亿个参数,个人计算机难以运行,但蒸馏版本(1.5B 至 70B)可以在消费级硬件上轻松运行。本教程介绍如何使用 Ollama 安装 DeepSeek R1、选择合适的模型规模,以及充分利用推理模式。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试

#为什么选择 DeepSeek R1?

R1 不是“常规”的大语言模型:在回答之前,它会生成一条可见的推理链,用 <think>...</think> 标签包裹。正是这一阶段,使它能够解决直接生成答案的模型经常无法解决的数学、逻辑或代码问题。在 AIME 2024 和 MATH-500 上,14B 和 32B 的蒸馏模型大幅超越 Llama 3.1 70B Instruct,尽管后者的规模是它们的 2 到 5 倍。

另一个优势是 MIT 许可证:没有商业用途或地域限制。您可以将 R1 集成到产品、智能体或内部工具中,无需征得任何人的许可。对于达到这一水平的推理模型而言,这很少见。

i
简要解释蒸馏
完整版 R1(671B MoE)生成了数百万个推理示例,随后用于微调更小的模型(Qwen 7B/14B/32B 和 Llama 8B/70B)。因此,这些蒸馏模型并非 R1 本身,而是 Qwen/Llama,它们学习了如何像 R1 一样进行推理。

#可用的蒸馏版本

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

Ollama 提供了七种不同规模的 deepseek-r1 模型。默认标签指向7B参数的蒸馏版本(Qwen 7B 基础版)。

deepseek-r1:1.5b
基于 Qwen 2.5 Math 1.5B。轻量,非常适合在没有GPU的笔记本电脑上测试。处理复杂问题时质量有限。
deepseek-r1:7b
基础模型 Qwen 2.5 Math 7B。默认标签。8 GB VRAM下的良好平衡选择。优秀的入门模型。
deepseek-r1:8b
以 Llama 3.1 8B 为基础。比 7B 版本稍微更健谈,法语表现更好。
deepseek-r1:14b
以 Qwen 2.5 14B 为基础模型。数学能力有显著提升。对于 12 GB 显存来说,是一个理想的平衡点。
deepseek-r1:32b
基于 Qwen 2.5 32B。在大多数推理基准测试中达到 o1-mini 的水平。Q4 量化下需要 24 GB 显存。
deepseek-r1:70b
基于Llama 3.3 70B。蒸馏模型中能力最强的一款。配置:32 GB显存的RTX 5090,或64 GB及以上内存的Mac Studio。
deepseek-r1:671b
完整模型(MoE,总参数 671B,激活参数 37B)。超出一般个人电脑的能力范围,但可以在配备 512 GB 内存的 Mac Studio Ultra 上运行。

#前置要求与不同模型规模所需的显存

在使用 Ollama 安装 DeepSeek R1 之前,请确认已安装 Ollama(守护进程默认监听 http://localhost:11434),并且 GPU 的显存足以容纳您选定规模的模型。以下列出了 Q4_K_M 量化的显存需求,这是 Ollama 默认下载的量化版本。

1.5B Q4
~1.1 GB VRAM,可在任意 GPU 上运行,甚至纯 CPU 上运行(15-25 个 token/秒)。
7B Q4
~4.7 GB显存。RTX 3050 8GB、4060 8GB、Mac M1/M2 16GB。
8B Q4
约需 5.2 GB 显存。适用范围与 7B 版本相同,但在 6 GB 显存上剩余空间更少。
14B Q4
~9 GB 显存。RTX 3060 12 GB,4070 12 GB,M2 Pro 16 GB
32B Q4
~19 GB 显存。RTX 3090/4090 24 GB,M3 Max 36 GB。
70B Q4
约 40 GB 显存。32 GB 的 RTX 5090 需配合 offload,或使用 64 GB 及以上的 Mac Studio Ultra。
→
不确定您的显存有多大?
在 Windows 上,打开任务管理器,进入“性能”选项卡 > GPU。在 Linux 上:NVIDIA 使用 nvidia-smi,AMD 使用 rocm-smi。在 Mac 上:采用统一内存,可将总 RAM 的约 75% 视为可供 LLM 使用的显存。

#1. 安装模型

只需一条命令。Ollama 会从其官方模型仓库下载权重,并在首次使用时将模型加载到内存中。

安装默认的 7B 模型
ollama run deepseek-r1

要选择特定规模的模型,请添加标签:

明确选择模型大小
# Version la plus légère (1.5B)
ollama run deepseek-r1:1.5b

# Sweet spot 12 Go VRAM
ollama run deepseek-r1:14b

# Pour RTX 3090/4090
ollama run deepseek-r1:32b

首次启动会下载模型(1.5B版本为1 GB,70B版本为40 GB)。后续启动若模型仍保留在Ollama的缓存中,则为即时加载。

!
绝不使用 :cloud
如果您在某处看到 deepseek-r1:cloud,忽略它:这是一个路由至 Ollama 云服务器并按使用量计费的标签。若要严格保持自托管模式,请仅使用编号标签(1.5b、7b、14b、32b、70b)。

#2. 选择模型大小

模型大小的选择取决于三个因素:显存、任务类型,以及您对等待时间的容忍度。R1 在给出最终回答前,平均会生成 500 至 2000 个推理 token——因此,其生成的 token 数量是传统直接生成答案的聊天模型的 3 至 10 倍。速度确实很重要。

在无高端 GPU 的情况下测试 R1
1.5B 或 7B。即使只用 CPU,聊天响应延迟也在可接受范围内。
高中数学 / 简单 Python
7B 或 8B。在 80% 的情况下够用,但在高等代数方面表现不尽如人意。
高难度数学、逻辑、长程推理
至少需要 14B。在 AIME 和 MATH-500 任务上,8B 到 14B 之间存在明显跃升。
o1-mini 级别,复杂调试,演示
32B。如果您有 24 GB 显存,这个模型规模就是理想选择。
本地能运行的最大模型
70B Q4:可在 RTX 5090 上配合卸载到系统内存运行,或在内存至少为 64 GB 的 Mac Studio 上运行。
→
简单规则
如果您有 12 GB 显存,请从 14B 版本开始。到了这个规模,R1 才真正值得一用。7B 版本主要用于练手。

#3. 首个推理提示

R1 在需要多步推理的问题上表现出色。我们用一道 14B 模型也能尝试解答的 AIME 经典题来测试它:

数学示例
>>> Un train part de Lyon à 8h à 90 km/h vers Paris.
... Un autre part de Paris à 9h à 110 km/h vers Lyon.
... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ?

<think>
À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km
entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h.
Temps avant croisement : 370 / 200 = 1,85 h = 1h51min.
Donc croisement à 9h + 1h51 = 10h51.
</think>

Les deux trains se croisent à 10h51.

请注意这一结构:<think> 和 </think> 之间的所有内容都是模型的思维链。您可以将其展示给最终用户、隐藏起来,或记录到日志中以便调试。这是在应用中提升可解释性的有效手段。

i
不要删除 <think>
一种常见的冲动是:添加系统提示词,写上“不要生成思维链”。这不是个好主意:质量会大幅下降。推理本身就是这个模型的核心。请在用户界面中隐藏该区块,而不是在生成阶段将其删除。

#4. Q4与Q8:选择量化方式

默认情况下,Ollama 会下载 Q4_K_M(推荐的质量与内存平衡方案)。对于推理模型,部分用户更倾向于使用 Q8_0——在思维链任务中,质量下降比普通聊天更为明显。

Ollama量化标签
# Q4_K_M (défaut) — recommandé pour 80 % des cas
ollama pull deepseek-r1:14b

# Q8_0 — qualité maximale, mémoire doublée
ollama pull deepseek-r1:14b-q8_0

# Liste complète des tags disponibles
ollama show deepseek-r1:14b --modelfile
Q4_K_M
默认的折中选择。在数学基准测试中,质量比 FP16 低 2% 至 4%。应当优先选择这一方案。
Q5_K_M
与 Q4 相比,质量提高 1%,内存占用增加 25%。如果显存有余量,但不足以运行更大规模的模型,这个版本值得考虑。
Q8_0
质量接近 FP16(-0.5%)。内存占用是 Q4 的两倍。如果您希望在14B或32B模型上获得最佳表现,且显存充足,推荐使用。
FP16
全精度基准。对于蒸馏模型,相比 Q8 没有实际优势,而且体积是 Q4 的 4 倍。
→
Q4 14B > Q8 7B
当您在提高量化精度和增大模型规模之间犹豫时,始终选择增大模型规模。在显存占用大致相同的情况下,14B Q4 模型的推理能力始终优于 7B Q8 模型。

#DeepSeek R1 对比 Qwen 3.8 27B

Qwen 3.8 27B 由 Qwen 团队于 2026 年 8 月 14 日发布,是 2026 年开放权重通用模型的标杆:上下文长度为 262k token,支持视觉,采用 Apache 2.0 许可证,最重要的是内置推理模式。当您需要一个既能推理又能处理其他所有任务的模型时,它自然是 R1 的替代之选。该选哪一个?

DeepSeek R1 32B
专注于纯推理。在数学基准测试(AIME、MATH-500)上表现更好。推理过程始终可见,并可通过 <think>...</think> 轻松解析。它只做这一件事,但做得非常出色。
Qwen 3.8 27B
2026年通用模型,内置推理功能。上下文长度262k,支持视觉,采用Apache 2.0许可,Q4量化下约18 GB。默认情况下会过度推理:即使面对简单问题,也会展开冗长而无用的思维链。将其推理级别设置为low,即可恢复直接回答。
实用结论
R1 32B 在纯数学和逻辑任务上,以及在提供稳定、可记录到日志中的推理格式方面,仍然领先。如果您需要一个能按需推理的多功能模型(代码、聊天、视觉、长上下文),Qwen 3.8 27B 就更有优势。在法语方面,两者表现都很扎实。
资源
资源需求相当。R1 32B 采用 Q4 量化后可放入 24 GB 显存(RTX 3090/4090)。Qwen 3.8 27B 稍轻一些(Q4 量化后约 18 GB),在同一张显卡上为上下文留出的余量更大。
i
两个模型都试一下,很快就能完成
ollama pull qwen3.8:27b à côté de deepseek-r1:32b, puis comparez sur vos vrais prompts. Pensez à baisser le niveau de raisonnement de Qwen 3.8 en low si vous le trouvez trop bavard. C'est l'arbitrage le plus fiable — vos cas d'usage valent mieux que n'importe quel benchmark public.

#故障排除

不显示 <think> 的模型
您可能正在使用一个屏蔽XML标签的客户端。请尝试使用ollama run en CLI来验证模型是否能正确生成这些标签。如果API JSON切断了标签,问题出在客户端。
截断的回复
Ollama 的默认上下文为 4096 个 token。R1 在推理过程中会消耗大量 token。请增加该值:在会话中执行 /set parameter num_ctx 16384,或通过 API 中的 options.num_ctx 参数设置。
即使 GPU 性能不错,运行仍然很慢
使用 ollama ps 检查模型是否 100% 运行在 GPU 上。如果 PROCESSOR 列显示 CPU,说明 RAM 已溢出。请降低模型尺寸或采用更激进的量化。
模型的思维链陷入循环
这是小规模蒸馏模型(1.5B、7B)面对过难问题时的典型表现。要么换用更大的模型,要么提出更简单的问题,要么在提示中添加「请回答,推理部分少于 500 个 token」。
错误“insufficient memory”
模型过大,超出您的显存容量。先执行 ollama rm deepseek-r1:32b,再执行 ollama pull deepseek-r1:14b。您也可以通过 OLLAMA_GPU_LAYERS 强制将部分模型卸载到系统内存。

#深入了解

安装完成后,可以顺着这几个方向继续探索:

理解量化技术
网站的Q4/Q5/Q8指南详细说明了具体权衡,建议在扩大模型规模前参考。
选择 GPU 进行 R1 部署
如果您认真考虑使用 32B 版本,GPU 购买指南列出了 2026 年应瞄准的 24/32 GB 显存门槛。
将 R1 接入用户界面
Open WebUI 或 LM Studio 原生支持 <think> 标签,并允许折叠或展开推理过程。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。