入门 8 分钟Ollama

本地运行Phi-4:使用Ollama安装、VRAM和 速度

Phi-4 是微软在 2024 年底引起广泛关注的小型模型:仅有 140 亿参数,数学和编程得分却足以挑战规模为其三倍的模型。本指南介绍如何使用 Ollama 在本地安装 Phi-4、它在实际使用中的真实表现,以及哪些方面令人失望——尤其是法语表现。

作者: Mohamed Meguedmi·更新于 2026-08-27·已在 Windows、macOS 和 Linux 上测试
i
简而言之
Phi-4是微软的140亿参数模型,擅长数学和编程(GPQA、MATH、HumanEval),采用MIT许可证。· Q4_K_M量化版本约需9 GB显存,RTX 3060或RTX 4070 12 GB即可运行,甚至可以仅使用CPU运行(16 GB内存,约5 token/秒)。· 安装只需一条命令:ollama pull phi4。· 它的弱项是法语,会出现语法一致性错误,也会切换到英语——法语写作请优先选择Mistral Small或Qwen 3.5 9B。

#为什么选择Phi-4?

Phi-4 是微软研究院 Phi 系列的自然延续:这一系列模型规模较小,主要使用精心制作的合成数据训练,旨在推理任务上与规模大得多的模型竞争。2024 年底发布的第 4 版将这一方法扩展至 14B 参数,在 GPQA、MATH 和 HumanEval 上取得了出色成绩——在这些特定基准测试中,其表现往往超过 Llama 3.3 70B。

具体而言,这个模型采用 Q4_K_M 量化后可装入 9 GB 显存,因此 RTX 3060 或 RTX 4070 这样的入门级 12 GB GPU 就能运行。如果您有 16 GB RAM,即使完全使用 CPU 运行,它的表现也相当不错。正是这种模型规模与质量之间的平衡,使它成为资源有限的自托管环境中的绝佳选择。

i
简而言之
Phi-4 = 14B,擅长数学和编程,通用知识和法语能力较弱,采用 MIT 许可。如果您希望在 12 GB 显存的 GPU 上使用一个‘小巧但强大’的模型处理技术任务,此模型非常合适。

#先决条件

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 终身更新
Ollama 已安装
Windows、macOS 或 Linux。如果尚未安装,按照 Ollama 安装指南操作只需 3 分钟。
Q4_K_M 量化所需的 VRAM
≈ 9 GB。RTX 3060 12 GB、RTX 4070 12 GB 或配备 16 GB 统一内存的 Mac 均可顺利运行。
若无GPU,则使用CPU内存
Q4 至少需要 16 GB 系统内存。在较新的 Ryzen 5 或 Core i5 上,预计速度为每秒 4–8 个 token,可用于测试,但无法实现流畅聊天。
10 GB 磁盘空间
Q4_K_M 模型大小约为 9 GB。若希望同时测试 Phi-4-Mini,建议预留更多空间。
→
仅 CPU 模式
Phi-4 是少数几个无需 GPU 即可实际使用的 14B 模型之一。在 Ryzen 7 5800X 或 Intel i7-12700 上,Q4 量化下大约能达到 5 个 token/秒,速度较慢但足以应对单次提问。若需交互式使用,仍建议配备 GPU。

#1. 安装 Ollama

若Ollama已安装,请直接跳至下一节。否则,以下为Linux和macOS平台的单命令安装方法。

Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

在Windows上,请从官方网站下载安装程序。

官方 Windows 链接
https://ollama.com/download/windows

安装完成后,Ollama 守护进程会监听 11434 端口。

验证
ollama --version
curl http://localhost:11434/api/tags

#2. 获取 Phi-4

Phi-4 已收录在 Ollama 官方模型目录中。默认标签会下载 Q4_K_M 量化版本,这是推荐的折中方案。

终端
ollama pull phi4

下载大小约为9GB。若要明确指定其他量化方式,请添加标签。

变体
ollama pull phi4:14b-q4_K_M    # ≈ 9 Go  (défaut)
ollama pull phi4:14b-q5_K_M    # ≈ 10 Go
ollama pull phi4:14b-q8_0      # ≈ 15 Go
ollama pull phi4:14b-fp16      # ≈ 29 Go (sans quantization)
→
选择哪种量化方式
对于 Phi-4,Q4_K_M 在消费级硬件上仍是最佳平衡点。在该模型上,Q5_K_M 的实际差异微乎其微,而 Q8_0 需要 15 GB 的 VRAM,除了基准测试外,其质量提升难以察觉。

#3. 初期测试:数学、编程、逻辑推理

启动交互式会话,确认模型能够运行,并测试它的强项。

会话
ollama run phi4

您应该会看到命令提示符`>>>`。逻辑和技术类练习正是Phi-4的强项。下面是几个能体现其能力的提示词:

数学测试
>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?

Phi-4会逐步推理并得出最终结果。在处理标准Python和JavaScript代码时表现稳定。

测试代码
>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.
i
预期速度
在RTX 4070(12 GB)上使用Q4_K_M量化,约45–60个token/秒;在RTX 3060(12 GB)上为25–35个token/秒;在Mac M2 24 GB上为20–30个token/秒;在Ryzen 5 5600X CPU上为4–6个token/秒。

#4. 法语表现:真正的短板

Phi-4 在这里暴露了其局限性。该模型主要基于英文数据(以及大量英文合成数据)进行训练。法语虽存在于语料库中,但明显处于次要地位。

语法与词形一致性
处理简单句子时表现良好,但一旦要求撰写长文本,就会出现语法一致性错误、英语化表达和生硬冗赘的措辞。
法语技术术语
即使有常用的法语对应词,也倾向于使用英语术语("endpoint"、"deployment"、"thread")。
理解能力
对法语提示词理解非常出色,但生成内容存在不足。
法语注释代码
代码注释在生成过程中经常切换为英语。请明确给出指令,这会有所帮助,但不能解决所有问题。
法国文化知识
较弱。对法国判例法、历史或机构的了解较浅。绝不是适合用法语撰写法律分析备忘录的模型。
!
法语表现结论
要写出质量合格的法语文本,建议优先选择 Mistral Small 24B(通用型,法语表现良好),或在配置较低的机器上选择 Qwen 3.5 9B——它的法语能力明显优于 Phi-4。对于输出代码或结构化推理、且交互语言不太重要的任务,Phi-4 仍然表现出色。

一个略有帮助的小技巧:使用严格的系统提示词,强制模型始终用法语回答,代价是回答有时会更短。

系统提示(法语)
>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."

#5. Phi-4-Mini:3.8B版本

微软同时发布了 Phi-4-Mini,一个 3.8B 的变体,旨在满足极低资源环境:无专用 GPU 的笔记本电脑、Raspberry Pi 5、边缘设备。其在 Q4 下仅需 2.5 GB,即可在任何现代设备上运行。

安装
ollama pull phi4-mini
所需 VRAM/RAM
Q4_K_M 量化下约需 2.5 GB 内存或显存。可在配备 8 GB 内存的 MacBook Air M1,或配备 4 GB 显存 GPU 的 PC 上运行。
速度
速度非常快。在 RTX 3060 上超过 80 token/秒,在较新的 CPU 上超过 30 token/秒。
优势
能够良好遵循简短指令,适用于提示词辅助、简单改写和分类任务。
弱点
复杂推理和长代码生成超出了其能力范围。这是一个辅助模型,而非 14B 版本的替代品。
→
Phi-4-Mini 的应用场景
非常适合连接到本地n8n工作流,用于邮件分类,或在需要快速轻量运行的Python脚本中集成LLM。不推荐用于通用聊天场景。

#6. Phi-4 vs Qwen 3.5 9B

2026 年,最值得比较的直接竞争对手是阿里巴巴的 Qwen 3.5 9B。它稍小一些(Q4 量化后为 6.6 GB,而 Phi-4 为 9 GB),同样能在这张 12 GB 显存的 GPU 上运行,面向的用户群体也相同。两者的区别在于:

推理与数学
Phi-4 在正式基准测试(GPQA、MATH)中占据优势。在实际处理常见问题时,差距比人们想象的更小。
代码
Qwen 3.5 9B在较少见的语言(Rust、Go、高级SQL)上总体表现更好。Phi-4在Python和JS上仍有竞争力。
法语
Qwen 3.5 表现明显更好。其训练使用的多语言数据多得多,词汇更丰富,也更少切换到英语。在这一标准上,Qwen 的优势明显。
上下文
Qwen 3.5 9B 支持最多 256k 个 token 的上下文,Phi-4 的上限为 16k 个 token。如果您处理长文档,Qwen 要合适得多。
指令遵循能力
Phi-4 能更准确地遵循结构化指令(JSON 格式、严格约束)。Qwen 稍微更有“创造性”,有时可能会自行偏离要求。
→
如何选择
用英语进行推理、编写 Python 代码或生成结构化输出:选择 Phi-4。用法语工作、处理长上下文或编写多种编程语言的代码:选择 Qwen 3.5 9B。如果您的 GPU 配备 12 GB 显存,无论如何都可以把这两个模型都安装好,再根据任务切换使用。

#故障排除

加载时出现“Out of memory”
显存不足以支持所选的量化方式。请切换至 Q4_K_M(最轻量且实用的选项),或让 Ollama 将部分计算卸载至 CPU,通过 `ollama run phi4 --num-gpu N` 实现,其中 N 为需要加载到 GPU 的层数。
在配备GPU的设备上,生成速度为1–2个token/秒
模型可能运行在 CPU 上。请通过 `ollama ps` 查看「PROCESSOR」列。若显示 100% CPU,请释放显存(Chrome、游戏、其他已加载模型等),然后重新启动。
回答在生成过程中突然切换为英文
这是 Phi-4 在使用法语时的预期表现。强化系统提示可以起到部分改善作用。如果您经常使用法语,最好更换模型,而不是继续费力调整。
上下文截断至4096个token
Ollama 默认加载较短的上下文。请明确扩展它:`/set parameter num_ctx 16384`。至于更长的上下文,Phi-4 训练时的上下文长度仅到 16k,因此没有必要再调高。
模型编造近期事实
Phi-4 的知识停留在其训练时点(2024 年底),通识知识也不如更大的模型丰富。要获取最新的事实信息,需要使用 RAG 流程,而不能只用模型本身。

#深入了解

Phi-4 是入门本地 14B 参数 LLM 的不错选择。以下是一些建议,帮助您进一步利用已安装的模型和环境:

测试直接竞品
Qwen 3 测试指南展示了在消费级硬件上进行的可比基准测试,有助于您用自己的提示词进行比较。
选择合适的量化
《选择量化方式(Q4、Q5、Q8、FP16)》指南详细说明了质量与内存之间的权衡,这些权衡同样适用于Phi-4。
在没有GPU的情况下运行Phi-4
如果您仅使用 CPU,指南《在没有 GPU 的情况下本地运行 LLM》会在此基础上提供特定优化。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。