本地运行Phi-4:使用Ollama安装、VRAM和 速度
Phi-4 是微软在 2024 年底引起广泛关注的小型模型:仅有 140 亿参数,数学和编程得分却足以挑战规模为其三倍的模型。本指南介绍如何使用 Ollama 在本地安装 Phi-4、它在实际使用中的真实表现,以及哪些方面令人失望——尤其是法语表现。
#为什么选择Phi-4?
Phi-4 是微软研究院 Phi 系列的自然延续:这一系列模型规模较小,主要使用精心制作的合成数据训练,旨在推理任务上与规模大得多的模型竞争。2024 年底发布的第 4 版将这一方法扩展至 14B 参数,在 GPQA、MATH 和 HumanEval 上取得了出色成绩——在这些特定基准测试中,其表现往往超过 Llama 3.3 70B。
具体而言,这个模型采用 Q4_K_M 量化后可装入 9 GB 显存,因此 RTX 3060 或 RTX 4070 这样的入门级 12 GB GPU 就能运行。如果您有 16 GB RAM,即使完全使用 CPU 运行,它的表现也相当不错。正是这种模型规模与质量之间的平衡,使它成为资源有限的自托管环境中的绝佳选择。
#先决条件
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 终身更新
- Ollama 已安装
- Windows、macOS 或 Linux。如果尚未安装,按照 Ollama 安装指南操作只需 3 分钟。
- Q4_K_M 量化所需的 VRAM
- ≈ 9 GB。RTX 3060 12 GB、RTX 4070 12 GB 或配备 16 GB 统一内存的 Mac 均可顺利运行。
- 若无GPU,则使用CPU内存
- Q4 至少需要 16 GB 系统内存。在较新的 Ryzen 5 或 Core i5 上,预计速度为每秒 4–8 个 token,可用于测试,但无法实现流畅聊天。
- 10 GB 磁盘空间
- Q4_K_M 模型大小约为 9 GB。若希望同时测试 Phi-4-Mini,建议预留更多空间。
#1. 安装 Ollama
若Ollama已安装,请直接跳至下一节。否则,以下为Linux和macOS平台的单命令安装方法。
在Windows上,请从官方网站下载安装程序。
安装完成后,Ollama 守护进程会监听 11434 端口。
#2. 获取 Phi-4
Phi-4 已收录在 Ollama 官方模型目录中。默认标签会下载 Q4_K_M 量化版本,这是推荐的折中方案。
下载大小约为9GB。若要明确指定其他量化方式,请添加标签。
#3. 初期测试:数学、编程、逻辑推理
启动交互式会话,确认模型能够运行,并测试它的强项。
您应该会看到命令提示符`>>>`。逻辑和技术类练习正是Phi-4的强项。下面是几个能体现其能力的提示词:
Phi-4会逐步推理并得出最终结果。在处理标准Python和JavaScript代码时表现稳定。
#4. 法语表现:真正的短板
Phi-4 在这里暴露了其局限性。该模型主要基于英文数据(以及大量英文合成数据)进行训练。法语虽存在于语料库中,但明显处于次要地位。
- 语法与词形一致性
- 处理简单句子时表现良好,但一旦要求撰写长文本,就会出现语法一致性错误、英语化表达和生硬冗赘的措辞。
- 法语技术术语
- 即使有常用的法语对应词,也倾向于使用英语术语("endpoint"、"deployment"、"thread")。
- 理解能力
- 对法语提示词理解非常出色,但生成内容存在不足。
- 法语注释代码
- 代码注释在生成过程中经常切换为英语。请明确给出指令,这会有所帮助,但不能解决所有问题。
- 法国文化知识
- 较弱。对法国判例法、历史或机构的了解较浅。绝不是适合用法语撰写法律分析备忘录的模型。
一个略有帮助的小技巧:使用严格的系统提示词,强制模型始终用法语回答,代价是回答有时会更短。
#5. Phi-4-Mini:3.8B版本
微软同时发布了 Phi-4-Mini,一个 3.8B 的变体,旨在满足极低资源环境:无专用 GPU 的笔记本电脑、Raspberry Pi 5、边缘设备。其在 Q4 下仅需 2.5 GB,即可在任何现代设备上运行。
- 所需 VRAM/RAM
- Q4_K_M 量化下约需 2.5 GB 内存或显存。可在配备 8 GB 内存的 MacBook Air M1,或配备 4 GB 显存 GPU 的 PC 上运行。
- 速度
- 速度非常快。在 RTX 3060 上超过 80 token/秒,在较新的 CPU 上超过 30 token/秒。
- 优势
- 能够良好遵循简短指令,适用于提示词辅助、简单改写和分类任务。
- 弱点
- 复杂推理和长代码生成超出了其能力范围。这是一个辅助模型,而非 14B 版本的替代品。
#6. Phi-4 vs Qwen 3.5 9B
2026 年,最值得比较的直接竞争对手是阿里巴巴的 Qwen 3.5 9B。它稍小一些(Q4 量化后为 6.6 GB,而 Phi-4 为 9 GB),同样能在这张 12 GB 显存的 GPU 上运行,面向的用户群体也相同。两者的区别在于:
- 推理与数学
- Phi-4 在正式基准测试(GPQA、MATH)中占据优势。在实际处理常见问题时,差距比人们想象的更小。
- 代码
- Qwen 3.5 9B在较少见的语言(Rust、Go、高级SQL)上总体表现更好。Phi-4在Python和JS上仍有竞争力。
- 法语
- Qwen 3.5 表现明显更好。其训练使用的多语言数据多得多,词汇更丰富,也更少切换到英语。在这一标准上,Qwen 的优势明显。
- 上下文
- Qwen 3.5 9B 支持最多 256k 个 token 的上下文,Phi-4 的上限为 16k 个 token。如果您处理长文档,Qwen 要合适得多。
- 指令遵循能力
- Phi-4 能更准确地遵循结构化指令(JSON 格式、严格约束)。Qwen 稍微更有“创造性”,有时可能会自行偏离要求。
#故障排除
- 加载时出现“Out of memory”
- 显存不足以支持所选的量化方式。请切换至 Q4_K_M(最轻量且实用的选项),或让 Ollama 将部分计算卸载至 CPU,通过 `ollama run phi4 --num-gpu N` 实现,其中 N 为需要加载到 GPU 的层数。
- 在配备GPU的设备上,生成速度为1–2个token/秒
- 模型可能运行在 CPU 上。请通过 `ollama ps` 查看「PROCESSOR」列。若显示 100% CPU,请释放显存(Chrome、游戏、其他已加载模型等),然后重新启动。
- 回答在生成过程中突然切换为英文
- 这是 Phi-4 在使用法语时的预期表现。强化系统提示可以起到部分改善作用。如果您经常使用法语,最好更换模型,而不是继续费力调整。
- 上下文截断至4096个token
- Ollama 默认加载较短的上下文。请明确扩展它:`/set parameter num_ctx 16384`。至于更长的上下文,Phi-4 训练时的上下文长度仅到 16k,因此没有必要再调高。
- 模型编造近期事实
- Phi-4 的知识停留在其训练时点(2024 年底),通识知识也不如更大的模型丰富。要获取最新的事实信息,需要使用 RAG 流程,而不能只用模型本身。
#深入了解
Phi-4 是入门本地 14B 参数 LLM 的不错选择。以下是一些建议,帮助您进一步利用已安装的模型和环境:
- 测试直接竞品
- Qwen 3 测试指南展示了在消费级硬件上进行的可比基准测试,有助于您用自己的提示词进行比较。
- 选择合适的量化
- 《选择量化方式(Q4、Q5、Q8、FP16)》指南详细说明了质量与内存之间的权衡,这些权衡同样适用于Phi-4。
- 在没有GPU的情况下运行Phi-4
- 如果您仅使用 CPU,指南《在没有 GPU 的情况下本地运行 LLM》会在此基础上提供特定优化。
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。