如何安装 Ollama:完整指南(Windows、Mac、Linux)

您希望在本地运行开源 LLM 模型吗?学习 如何安装 ollama 是让更多人能在自己的设备上使用开放权重模型的第一步。无论您使用 Windows、macOS 还是 Linux,这款工具都能大幅简化各种模型的下载和运行流程。这份完整指南详细介绍每种安装方法,让您开始尝试强大的模型架构,例如 DeepSeek V4 Pro 1.6T 或 MiMo V2.5 Pro。我们将探讨技术步骤、性能,以及如何使用这个本地平台。

什么是 Ollama,为什么要用它运行本地 LLM?

Ollama 是一个旨在简化大型语言模型(LLM)在个人环境或本地服务器上部署的工具。无需手动管理复杂的依赖关系,量化框架如 llama.cpp, 以及每个模型的特定配置,Ollama 提供一个简单的CLI接口。它作为一个本地服务器,可通过标准化API与不同的LLM进行交互。

对于希望深入本地实验的用户,了解像这样的工具会很有帮助 llama.cpp(官方 GitHub) 通常是 Ollama 的底层基础。无论您想测试高性能模型,例如 DeepSeek V4 Flash 0731 304B 或探索功能 Kimi K2.5, Ollama 使访问这些权重更加直接。

主要优势在于操作简单:只需一条命令即可下载并启动模型,非常适合希望快速从构想到在自己的 PC 或 Mac 上本地运行模型的用户。如果您希望在决定安装方案前比较不同架构,我们的 目录 收录了数百个模型及其对应的VRAM规格和许可证信息。您可以查阅 Hugging Face 上的 DeepSeek 以了解其可在本地运行的各类模型。

每个操作系统的详细安装指南

具体流程因操作系统而略有不同,但基本原则相同:安装 Ollama 可执行程序,然后通过命令行拉取模型。

在macOS(Mac)上的安装

对于 Mac 用户,无论是 M 系列芯片还是 Intel 芯片,安装过程都非常流畅。您可从以下链接下载官方安装脚本 Ollama(官方 GitHub)。安装完成后,Ollama 会在后台启动,您即可通过终端与模型交互。如需了解 Mac 的特定配置,尤其是如何优化 Apple Silicon GPU 的使用,请参阅我们的指南 llm-mac-mini-m4.

在 Windows 上安装

在 Windows 上,您主要有两种选择:使用原生二进制文件或通过 WSL2(Windows Subsystem for Linux 2)进行安装。如果您选择原生安装,请遵循官方网站的说明。为了实现更稳定的集成以及与基于 Linux 的开发工具更好的兼容性,我们通常建议使用 WSL2。我们的指南 ollama-wsl2-vs-windows-natif 详细介绍了该方法。

在 Linux 上安装

在 Linux 下,通过仓库脚本或预编译二进制文件安装通常最为直接,并应遵循以下提供方的说明: Ollama(官方 GitHub)。如需针对 shell 命令的分步说明,请参阅我们的专门教程: installer-ollama-linux.

使用 Ollama 运行和测试您的第一批 LLM 模型

安装完 Ollama 后,您将使用命令 ollama run <nom_du_modele> 即可开始。您在这里选择本地会话的“大脑”。

例如,如果您希望尝试一个性能非常出色的模型,如 DeepSeek V4 Pro 0813 1.7T,您将运行相应的命令。需要注意的是,模型通常提供不同版本(量化版本),以在大小和性能之间取得平衡。例如,像 GLM 5.2 753B-A40B 将需要较强的硬件配置。

要评估模型的原始性能,您可以参考 Open LLM排行榜(Hugging Face)。如果您的目标是搭建完整的智能体开发环境,我们已准备了与 CrewAI 或本地智能体集成的教程 crewai-ollama-multi-agents.

可测试的模型示例: * 若需高级推理能力,建议尝试 Inkling (975B) 或 DeepSeek V4 Pro 1.6T (1600B)。您也可以了解以下模型的能力: Kimi K3。* 如果您对编程感兴趣, Kimi K2.7 Code 是测试编程专用模型的良好起点。* 如果想要更轻量、在本地运行更快的模型,可以看看以下这类变体: Mixtral 8x22B Instruct.

Ollama 优化与高级使用

本地 LLM 的使用并不限于在终端中进行简单对话。Ollama 可以集成到更复杂的工作流中。如果您希望使用友好的图形界面,我们建议尝试一些工具,例如 Open WebUI(官方GitHub),可与Ollama服务器完美集成。

对于希望自动执行任务或构建应用的高级用户,可以配置 API 调用,直接访问您的 Ollama 实例。我们的指南 appel-outil-ollama-tutoriel 展示了如何将这些 LLM 集成到 Python 脚本中。

若遇到性能问题,尤其是与 GPU 使用(GPU 加速)相关的情况,请参阅我们的指南 depanner-ollama-gpu-erreurs。如需直接比较 Ollama 与 LM Studio 等其他方案,可参阅我们指南中的对比文章: interfaces-graphiques-ollama-comparatif。如果您在寻找更具体的替代方案,我们的页面 alternatives-ollama-tour-horizon 是一种有用的资源。

FAQ:Ollama 安装常见问题

Q:开始使用 Ollama 的最低硬件要求是什么?

R:对于基本测试,现代系统已足够。然而,如果您希望运行更大规模的模型,如 GLM 5.3 Flash 320B-A18B (Q4 量化后需要约 186 GB),需要配备显存容量较大的显卡。对于配置较低的设备,优先选择量化模型;只有在您愿意耐心等待推理结果时,才考虑使用 CPU。

Q:在安装了 Ollama 之后,如何选择合适的模型?

R:选择取决于您的用途(聊天、编程、推理)以及硬件资源。如果速度是关键因素,可考虑“Flash”版本,如 DeepSeek V4 Flash 284B为在复杂任务上获得最佳质量,请探索更大规模的模型,如 Kimi K3 或 DeepSeek V4 Pro 0813 1.7T, 请始终在我们的 目录.

Q:Ollama 是否仅支持 GGUF 模型?

R:尽管 Ollama 广泛使用 GGUF 格式(针对 CPU/GPU 推理进行了优化,依托 llama.cpp),还支持其他格式,并能与来自不同来源的权重进行交互,基于开源LLM社区定义的规范 Hugging Face Hub(文档).

Q:我可以使用 Ollama 进行 RAG 吗?

R:是的,当然。尽管Ollama是推理引擎,但您必须将其集成到RAG(检索增强生成)框架中,例如LangChain或LlamaIndex。我们有专门的教程介绍相关内容,例如 anythingllm-rag-tutoriel-complet.

Q:Ollama 是否免费且开源?

答:Ollama 工具本身的设计注重易用性和上手便利性。它运行的模型大多采用开放许可证(MIT、Apache 2.0),或遵循模型厂商的开放政策,例如 Hugging Face 上的 Moonshot AI,从而保证可在本地自由使用这些模型进行实验。

结论:通往本地LLM的桥梁

简而言之 如何安装Ollama 这是一种简单但强大的过程,可让您在自有基础设施上访问顶尖模型。无论您是初学者还是希望集成如基于的复杂系统专家, Llama 3.1 405B Instruct,Ollama 是理想的编排解决方案。安装完成后,请查看我们的 配置工具 以找到最适合您硬件配置和特定需求的模型。

本地运行 LLM 所需的硬件

要在本地流畅运行这些模型,一张 RTX 5070 Ti 提供出色的性价比。比较价格:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

联盟推广链接——QuelLLM 可能会从购买中获得佣金,您无需支付额外费用。作为亚马逊联盟合作伙伴,QuelLLM 会从符合条件的购买中获得收益。

文章发布及更新于 由 Mohamed Meguedmi · 数据来源: /api/models.json · 内容许可协议: CC BY 4.0.

有错误或更新需要反馈吗? 参与贡献.