入门 8 分钟Ollama

Ollama Cloud:价格、评价和限制 (2026)

Ollama 云提供的方案很简单:使用与本地版本相同的命令行界面,在 Ollama 的服务器上运行您的机器容纳不下的模型——120B、480B、671B 参数模型。这很方便。但它带来了两项根本性变化:您的提示词会离开本地设备,而且您需要按使用量付费。本指南将说明它究竟是什么、费用是多少,以及为什么在大多数情况下,自托管仍然更可取。

作者: Mohamed Meguedmi·更新于 2026-09-05·已在 Windows、macOS 和 Linux 上测试
i
简而言之
Ollama Cloud将在Ollama的服务器上运行超过本地设备承载能力的大型模型(120B、480B、671B),并提供与本地完全相同的CLI。· 服务模式介于按小时配额的月费套餐与按推理时长计费的大规模使用方案之间——请访问ollama.com/cloud查看具体价格,价格会动态调整。· 与本地部署不同,您的提示词将离开本地设备,通过主要位于美国的服务器进行传输。· 对于频繁使用或涉及敏感数据的场景,自建部署仍明显更优。

#什么是Ollama Cloud

自 2025 年起,Ollama 提供了一项名为 Ollama Cloud 的付费服务,可调用托管在其 GPU 基础设施上的模型,使用的命令与本地模型完全相同。它的承诺是:无需 Mac Studio Ultra 或 H100 集群,即可运行超大规模的开放权重模型(数千亿参数)。

实际上,您会像往常一样安装 Ollama,进行身份验证,并拉取一个标记为 "cloud" 的模型(例如 gpt-oss:120b-cloud)。推理过程不再在您的 GPU 上进行,而是在 Ollama 的服务器上完成——您的设备仅发送提示词的 token,接收响应的 token。

云端调用示例(通用语法)
# Authentification (une seule fois)
ollama signin

# Lancer un modèle hébergé
ollama run gpt-oss:120b-cloud
i
这不是所谓的‘本地云’
Ollama Cloud 并非混合模式,它不会在本地运行模型的一部分。这是一种纯粹的远程推理:您的提示会通过互联网发送,如同使用 OpenAI 或 Anthropic 的 API。唯一本地的部分是 CLI。

#云端运行哪些模型

本地 AI 套件

只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

云端模型目录专门面向难以在本地运行的模型。目录会变化,但选择逻辑始终相同:开放权重或开放的模型,规模非常大,或属于对显存要求很高的多模态模型。

100B参数以上的模型
gpt-oss:120b、qwen3-coder:480b、kimi-k2等模型在Q4量化下需占用60至250GB显存,超出个人工作站的承载能力。
前沿 MoE 模型
DeepSeek V3/V4、Llama 4 Maverick:这里指完整版本,而不是在本地安装的 7B/32B 蒸馏版本。
资源需求较高的专用模型
超大型编程模型、长上下文推理("thinking")模型、高分辨率视觉模型。

“常规”模型(Mistral 7B、Llama 3.1 8B、Qwen 14B、Phi-4 等)仍推荐在本地运行:它们能装入 RTX 3060 12 GB 或 MacBook Air 的可用内存,将它们移到远端运行没有任何好处。

#价格与使用限制

Ollama Cloud 的定位介于固定月费订阅(设有每小时请求数配额)与面向高强度使用的按用量计费模式之间。具体价格会变动——请在作出承诺前到 ollama.com/cloud 核实——但有几个相对稳定的特点值得留意。

小时配额
基础套餐限制每小时或每天的请求次数。这些额度足以满足人工聊天的需求,但对循环处理 10,000 份文档的脚本来说,很快就会达到上限。
按推理时长计费
超大型模型有时按消耗的 GPU 时间计费。一个长上下文请求(32k token、深度推理)的费用自然会高于一个“你好”请求。
默认未显示按token计费的价格
与 OpenAI 或 Anthropic 不同,Ollama Cloud 的 API 并不总是按 token 计费。这使预算估算不那么精确。
无面向大众的SLA
这项服务推出不久,在撰写本文时,尚无可与大型云服务商相提并论的可用性保证。
!
‘几乎免费’的陷阱
免费配额或价格低廉的入门套餐会让人想把所有任务都交给云端。但一旦开始自动化处理(批量处理、循环运行的智能体、针对 10 万个文本块的 RAG),费用就会迅速上升,而且每次调用都要额外承受网络延迟。

#隐私:真正发生的变化

这正是与自托管相比的结构性差异,而非无关紧要的小差别。当你在本地使用 Ollama 时,你的提示请求永远不会离开 localhost:11434 —— 这可以在防火墙中验证。而在云端,请求会通过互联网传输,并在第三方基础设施上处理。

您的提示词会离开受控范围
发送的任何数据——合同摘录、专有源代码、患者档案、电子邮件——都会离开您的机器。对于律师事务所、医生、人力资源部门或研发实验室而言,这是不可接受的。
数据保留策略
Ollama 表示不会使用您的提示词训练其模型。但为调试、滥用检测或日志记录而保留数据的政策因套餐而异。发送敏感信息前,请阅读服务条款。
GDPR 与托管服务
Ollama Cloud 的服务器大多位于美国。对于欧洲的个人数据,这会带来向欧盟境外传输数据的问题,而自行托管可以直接消除这些问题。
基础设施端无法进行审计
在本地,您可以使用 tcpdump 抓取端口 11434 的流量,证明没有数据向外传输。在云端,您只能选择信任——没有技术手段可以核实哪些内容被记录到了日志中。
→
tcpdump 测试
对于自托管的 Ollama,请在使用模型时运行 `sudo tcpdump -i any port 443`。不应看到任何出站数据包。使用 Ollama Cloud 时,您会看到发往 ollama.com 服务器的流量。隐私保护是否成立只有两种结果,而且可以直接观察。

#每个云模型的自托管替代方案

对于云端提供的几乎所有模型,都有本地替代方案:要么是等效方案(同一家族中更小的模型),要么是可接受的方案(其他可比的开放权重模型)。以下是实用的对应关系。

gpt-oss:120b-cloud → llama3.1:8b 或 qwen2.5:14b 本地运行
对于 90% 的对话场景,RTX 3060 12 GB 上的 8B-14B Q4 即可满足。在长推理或百科知识任务上的表现差异更为明显。
qwen3-coder:480b-cloud → qwen2.5-coder:14b 或 32b
32B 模型采用 Q4 量化时(约需 19 GB 显存),可在 RTX 4090 或 Mac M-Max 上运行。对于 IDE 中的代码自动补全,这已经绰绰有余——参见 Continue.dev 指南。
deepseek-v3:671b-cloud → deepseek-r1:32b 或 70b 蒸馏版
DeepSeek R1 的蒸馏版本可在 RTX 4090 或 Mac Studio 上本地运行,并在常用基准测试中达到完整模型推理能力的 80–90%。
超大型视觉模型 → qwen2.5-vl:7b 或 llama3.2-vision:11b
对于 OCR、图片打标签和图片描述,这两个模型可在配备 8–12 GB 显存的设备上运行。请参阅本地多模态视觉 LLM 指南。
长上下文 1M token → 本地 128k 模型 + 分块
实际应用中极少有场景需要一次性处理 1M 个 token。设计良好的 RAG 流水线结合分块和重排序器,可用上下文长度为 32k 的本地模型处理大规模语料库。
i
质量差距每季度缩小
2026 年的 14B 模型在大多数基准测试中超过了 2024 年的 70B 模型。“我需要一个 400B 模型”这一理由越来越少站得住脚。在为云服务付费之前,认真试试本地 14B 模型是否已经足够——结果往往会让您惊讶。

#决策表

在选择 Ollama 云服务还是自托管时,请按顺序回答以下五个问题。第一个回答为‘自托管’的问题即可决定最终方案。

1. 数据是否敏感?
专有代码、客户数据、医疗、法律、人力资源、研发 → 自托管,没有商量余地。
2. 您是否受《通用数据保护条例》(GDPR)或行业监管法规约束?
医院、银行、公共部门、欧洲数据 → 自托管,或专用主权云(不是 Ollama Cloud)。
3. 调用量是否可预测且较高?
每天调用次数超过数千次 → 与金额随使用量变化的云端账单相比,一块售价 1500 欧元的 GPU 可在几个月内摊销其成本。
4. 是否需要离线运行?
现场没有可靠的网络连接、需要实地演示,或合规要求网络物理隔离 → 必须自行托管。
5. 您确实必须使用 100B 及以上的模型吗?
如果答案是肯定的,而且只有在答案是肯定的、并且已经测试过本地 32B 模型的情况下,Ollama Cloud 才成为值得考虑的选项。
→
实用准则
如果拿不准,请先在本地使用一个 14B Q4 模型。您很快就会发现,它的局限是否真的妨碍您的使用——在 80% 的情况下,并不会。云端仍应是例外,而非常态。

#何时使用哪一个

#Ollama Cloud 真正适用的少数场景

对超大模型进行一次性评估
您想先用 10 分钟测试一个 480B 编程模型是否值得使用,再决定是否投资购买机器——云端可以避免冲动购买。
无需现场硬件的客户演示
销售人员在自己的笔记本电脑上展示概念验证(POC),无需随身携带 Mac Studio。
要求很高的单项任务
一份 500 页的报告,每季度总结一次,需要长上下文,且其中没有任何机密数据。
学习与探索
了解一个 670B 模型能做什么,以便之后回到本地运行时,知道应该追求什么目标。

#自托管的优势场景

任何经常性使用场景
日常编程助手、内部团队聊天、基于企业文档的 RAG——账单金额的稳定性很重要。
所有涉及敏感数据的使用
这一点没有商量余地:法律、医疗、人力资源、金融、研发和专有代码都应留在本地处理。
所有自动化用途
批处理流水线、循环运行的智能体、n8n、ETL 脚本:云端配额很快就会耗尽,成本变得难以预测。
所有离线或边缘使用场景
工作坊用树莓派、出差用笔记本、无稳定网络的现场环境。
任何个性化需求
微调、自定义Modelfile、团队系统提示、与您现有工具的深度集成——这些功能无法在云端实现。
!
供应商锁定的陷阱
一旦团队习惯了调用特定云模型,退出这种依赖就非常痛苦:经过调优的提示词、输出格式、特定行为模式。从一开始就自托管,可以避免这种依赖——当云服务价格上涨时,还能节省成本。

#深入了解

如果您认为自托管适合自己的情况(这很有可能),这些指南可以帮助您顺利起步:

选择合适的GPU
《如何为本地 AI 选择 GPU》一文详细说明了 VRAM、预算和性能之间的权衡,涵盖从 RTX 3060 12 GB 到 Mac Studio Ultra 的多种选择。
理解量化(quantization)
《选择量化方式(Q4、Q5、Q8、FP16)》指南说明如何将 32B 模型部署到 16 GB 显存的 GPU 上,且不降低模型质量。
实际运行中的保密性
隐私检查清单列出了具体检查项,用于确认没有任何数据包从您的机器发出——以事实为证。
关于 Ollama 云的常见问题
Ollama Cloud 免费吗?+
有免费档位,但使用限制较严格(可同时使用的模型较少,配额按会话和每周刷新)。对于使用强度更高的用户,Ollama 提供按月订阅的付费档位,允许同时使用更多模型,并提供更高的配额。具体价格会变化:在决定订阅前,请务必查看官方定价页面 ollama.com/pricing,而不要依赖某个固定的价格数字。
如何在不使用云端的情况下使用Ollama?+
没有任何变化:Ollama 的常规本地安装方式与以前完全一样,无需账户或订阅。云端功能是可选的,只有在您明确选择标记为“cloud”的模型并完成身份验证时才会启用。只要您使用标准模型(Llama、Mistral、Qwen 等),一切都在本地运行,下载模型后无需联网。
这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。