Ollama Cloud:价格、评价和限制 (2026)
Ollama 云提供的方案很简单:使用与本地版本相同的命令行界面,在 Ollama 的服务器上运行您的机器容纳不下的模型——120B、480B、671B 参数模型。这很方便。但它带来了两项根本性变化:您的提示词会离开本地设备,而且您需要按使用量付费。本指南将说明它究竟是什么、费用是多少,以及为什么在大多数情况下,自托管仍然更可取。
#什么是Ollama Cloud
自 2025 年起,Ollama 提供了一项名为 Ollama Cloud 的付费服务,可调用托管在其 GPU 基础设施上的模型,使用的命令与本地模型完全相同。它的承诺是:无需 Mac Studio Ultra 或 H100 集群,即可运行超大规模的开放权重模型(数千亿参数)。
实际上,您会像往常一样安装 Ollama,进行身份验证,并拉取一个标记为 "cloud" 的模型(例如 gpt-oss:120b-cloud)。推理过程不再在您的 GPU 上进行,而是在 Ollama 的服务器上完成——您的设备仅发送提示词的 token,接收响应的 token。
#云端运行哪些模型
只需 1 小时,即可在您的电脑上拥有专属的免费 ChatGPT — LM Studio、Ollama、Open WebUI、您的文档,无需云端。
- 在线空间,终身可用
- PDF + 文件
- 30 天内退款
云端模型目录专门面向难以在本地运行的模型。目录会变化,但选择逻辑始终相同:开放权重或开放的模型,规模非常大,或属于对显存要求很高的多模态模型。
- 100B参数以上的模型
- gpt-oss:120b、qwen3-coder:480b、kimi-k2等模型在Q4量化下需占用60至250GB显存,超出个人工作站的承载能力。
- 前沿 MoE 模型
- DeepSeek V3/V4、Llama 4 Maverick:这里指完整版本,而不是在本地安装的 7B/32B 蒸馏版本。
- 资源需求较高的专用模型
- 超大型编程模型、长上下文推理("thinking")模型、高分辨率视觉模型。
“常规”模型(Mistral 7B、Llama 3.1 8B、Qwen 14B、Phi-4 等)仍推荐在本地运行:它们能装入 RTX 3060 12 GB 或 MacBook Air 的可用内存,将它们移到远端运行没有任何好处。
#价格与使用限制
Ollama Cloud 的定位介于固定月费订阅(设有每小时请求数配额)与面向高强度使用的按用量计费模式之间。具体价格会变动——请在作出承诺前到 ollama.com/cloud 核实——但有几个相对稳定的特点值得留意。
- 小时配额
- 基础套餐限制每小时或每天的请求次数。这些额度足以满足人工聊天的需求,但对循环处理 10,000 份文档的脚本来说,很快就会达到上限。
- 按推理时长计费
- 超大型模型有时按消耗的 GPU 时间计费。一个长上下文请求(32k token、深度推理)的费用自然会高于一个“你好”请求。
- 默认未显示按token计费的价格
- 与 OpenAI 或 Anthropic 不同,Ollama Cloud 的 API 并不总是按 token 计费。这使预算估算不那么精确。
- 无面向大众的SLA
- 这项服务推出不久,在撰写本文时,尚无可与大型云服务商相提并论的可用性保证。
#隐私:真正发生的变化
这正是与自托管相比的结构性差异,而非无关紧要的小差别。当你在本地使用 Ollama 时,你的提示请求永远不会离开 localhost:11434 —— 这可以在防火墙中验证。而在云端,请求会通过互联网传输,并在第三方基础设施上处理。
- 您的提示词会离开受控范围
- 发送的任何数据——合同摘录、专有源代码、患者档案、电子邮件——都会离开您的机器。对于律师事务所、医生、人力资源部门或研发实验室而言,这是不可接受的。
- 数据保留策略
- Ollama 表示不会使用您的提示词训练其模型。但为调试、滥用检测或日志记录而保留数据的政策因套餐而异。发送敏感信息前,请阅读服务条款。
- GDPR 与托管服务
- Ollama Cloud 的服务器大多位于美国。对于欧洲的个人数据,这会带来向欧盟境外传输数据的问题,而自行托管可以直接消除这些问题。
- 基础设施端无法进行审计
- 在本地,您可以使用 tcpdump 抓取端口 11434 的流量,证明没有数据向外传输。在云端,您只能选择信任——没有技术手段可以核实哪些内容被记录到了日志中。
#每个云模型的自托管替代方案
对于云端提供的几乎所有模型,都有本地替代方案:要么是等效方案(同一家族中更小的模型),要么是可接受的方案(其他可比的开放权重模型)。以下是实用的对应关系。
- gpt-oss:120b-cloud → llama3.1:8b 或 qwen2.5:14b 本地运行
- 对于 90% 的对话场景,RTX 3060 12 GB 上的 8B-14B Q4 即可满足。在长推理或百科知识任务上的表现差异更为明显。
- qwen3-coder:480b-cloud → qwen2.5-coder:14b 或 32b
- 32B 模型采用 Q4 量化时(约需 19 GB 显存),可在 RTX 4090 或 Mac M-Max 上运行。对于 IDE 中的代码自动补全,这已经绰绰有余——参见 Continue.dev 指南。
- deepseek-v3:671b-cloud → deepseek-r1:32b 或 70b 蒸馏版
- DeepSeek R1 的蒸馏版本可在 RTX 4090 或 Mac Studio 上本地运行,并在常用基准测试中达到完整模型推理能力的 80–90%。
- 超大型视觉模型 → qwen2.5-vl:7b 或 llama3.2-vision:11b
- 对于 OCR、图片打标签和图片描述,这两个模型可在配备 8–12 GB 显存的设备上运行。请参阅本地多模态视觉 LLM 指南。
- 长上下文 1M token → 本地 128k 模型 + 分块
- 实际应用中极少有场景需要一次性处理 1M 个 token。设计良好的 RAG 流水线结合分块和重排序器,可用上下文长度为 32k 的本地模型处理大规模语料库。
#决策表
在选择 Ollama 云服务还是自托管时,请按顺序回答以下五个问题。第一个回答为‘自托管’的问题即可决定最终方案。
- 1. 数据是否敏感?
- 专有代码、客户数据、医疗、法律、人力资源、研发 → 自托管,没有商量余地。
- 2. 您是否受《通用数据保护条例》(GDPR)或行业监管法规约束?
- 医院、银行、公共部门、欧洲数据 → 自托管,或专用主权云(不是 Ollama Cloud)。
- 3. 调用量是否可预测且较高?
- 每天调用次数超过数千次 → 与金额随使用量变化的云端账单相比,一块售价 1500 欧元的 GPU 可在几个月内摊销其成本。
- 4. 是否需要离线运行?
- 现场没有可靠的网络连接、需要实地演示,或合规要求网络物理隔离 → 必须自行托管。
- 5. 您确实必须使用 100B 及以上的模型吗?
- 如果答案是肯定的,而且只有在答案是肯定的、并且已经测试过本地 32B 模型的情况下,Ollama Cloud 才成为值得考虑的选项。
#何时使用哪一个
#Ollama Cloud 真正适用的少数场景
- 对超大模型进行一次性评估
- 您想先用 10 分钟测试一个 480B 编程模型是否值得使用,再决定是否投资购买机器——云端可以避免冲动购买。
- 无需现场硬件的客户演示
- 销售人员在自己的笔记本电脑上展示概念验证(POC),无需随身携带 Mac Studio。
- 要求很高的单项任务
- 一份 500 页的报告,每季度总结一次,需要长上下文,且其中没有任何机密数据。
- 学习与探索
- 了解一个 670B 模型能做什么,以便之后回到本地运行时,知道应该追求什么目标。
#自托管的优势场景
- 任何经常性使用场景
- 日常编程助手、内部团队聊天、基于企业文档的 RAG——账单金额的稳定性很重要。
- 所有涉及敏感数据的使用
- 这一点没有商量余地:法律、医疗、人力资源、金融、研发和专有代码都应留在本地处理。
- 所有自动化用途
- 批处理流水线、循环运行的智能体、n8n、ETL 脚本:云端配额很快就会耗尽,成本变得难以预测。
- 所有离线或边缘使用场景
- 工作坊用树莓派、出差用笔记本、无稳定网络的现场环境。
- 任何个性化需求
- 微调、自定义Modelfile、团队系统提示、与您现有工具的深度集成——这些功能无法在云端实现。
#深入了解
如果您认为自托管适合自己的情况(这很有可能),这些指南可以帮助您顺利起步:
- 选择合适的GPU
- 《如何为本地 AI 选择 GPU》一文详细说明了 VRAM、预算和性能之间的权衡,涵盖从 RTX 3060 12 GB 到 Mac Studio Ultra 的多种选择。
- 理解量化(quantization)
- 《选择量化方式(Q4、Q5、Q8、FP16)》指南说明如何将 32B 模型部署到 16 GB 显存的 GPU 上,且不降低模型质量。
- 实际运行中的保密性
- 隐私检查清单列出了具体检查项,用于确认没有任何数据包从您的机器发出——以事实为证。
Ollama Cloud 免费吗?+
如何在不使用云端的情况下使用Ollama?+
有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。