进阶 10 分钟API

免费API LLM:真正的对比(以及选项 locale)

免费的 LLM API 确实存在:多家供应商提供免费使用能力不错的模型的机会,无需银行卡。问题藏在细则里——配额紧张、吞吐量受限,而且您的提示词往往会被用于训练下一个模型。本指南如实梳理实际可用的服务,用数字说明「免费」在实际使用中付出的成本,并指出对开发项目而言,本地运行 Ollama 从什么时候开始更划算、更稳妥。

作者: Mohamed Meguedmi·更新于 2026-09-15·已在 Windows、macOS 和 Linux 上测试

#为何进行此对比

开发原型时,很多人首先会找免费的 LLM API:不想掏出信用卡,只想试验一个想法,把模型接入脚本,看看是否行得通。好消息是,免费服务确实存在,有些还提供相当充足的额度。坏消息是,“免费”可能意味着截然不同的条件:永久免费套餐、有有效期的试用额度,或传输速率受限的社区服务。

本指南的目的并非告诉您‘本地部署更好’,而是提供数据,让您自行判断:每个免费方案实际允许的功能、所付出的代价,以及在何种使用规模或保密性要求下,本地端点才成为合理选择。通常,最佳方案并非二者之一,而是两者结合,根据具体任务进行路由。

#免费 LLM API 概览

本地副驾驶套件

本指南带你上手模型。工具包则帮你用上能在你的编辑器中编写代码的编程助手。

  • 在线空间,终身可用
  • PDF + 文件
  • 30 天内退款

免费服务方案可以分为四类。了解某项方案属于哪一类,可以避免在一个开发冲刺进行到一半、剩余额度归零时遭遇意外。

永久免费套餐
长期提供的免费访问,但每分钟和每天的请求次数都有上限。Google AI Studio(Gemini API)或 Groq 就属于这种情况,它们提供开放模型(Llama、Qwen、gpt-oss),可免费调用,但吞吐量有限。
聚合平台和带有 :free 后缀的模型
OpenRouter 提供数十个模型,其中一些带有“:free”后缀。确实可以访问这些模型,但吞吐量取决于共享资源池,并可能在高峰时段下降。
试用额度
账户创建时赠送的金额(通常为几美元),有效期数周。适用于短期测试,对持续项目无用。
社区推理
Hugging Face Inference 等服务:可免费访问众多模型,但存在冷启动(cold start)、排队等待以及吞吐量无法保证的问题。
i
精确数值变化迅速
各供应商的具体限额(每分钟请求数、每日 token 数)每隔几个月就会调整。在依据这些限额规划项目规模之前,请务必查看官方定价页面——免费配额可能一夜之间就减半。

#真实配额,如实呈现

“免费”一词掩盖了三种不同的上限,它们共同决定这项服务能否满足您的使用需求。某个套餐档位可能在其中一项上额度宽裕,却在另外两项上限制很严。

每分钟请求数(RPM)
每分钟允许的调用次数。免费层级的调用限制通常在几十 RPM 左右——对于开发者测试来说足够,但不足以同时服务多个用户。
每日令牌数(TPD)
这才是真正决定使用规模的上限。一旦发送很长的提示词、RAG 上下文,或循环处理一个数据集,每日 token 配额就会很快耗尽。
吞吐量与延迟
在共享的免费服务中,生成速度并不保证。在非高峰时段运行流畅;在高峰时段,延迟会急剧上升或请求被拒绝(错误429)。

具体来说:对于手动制作原型、偶尔发送几次请求,免费配额相当充裕。一旦您编写脚本进行批量处理——对一千个工单进行分类、汇总整个邮箱中的邮件、为代码仓库生成测试——几分钟内就会触及 TPD 上限,而吞吐量限制会让原本只需 10 分钟的批量任务变成一小时的等待,其间还会出现 429 错误。

!
生产环境中的请求速率限制陷阱
免费配额在开发阶段够用,并不能说明它在生产环境中的表现。等到您的应用有十名用户同时使用时,共享的 RPM/TPD 上限就会成为第一个导致运行中断的瓶颈——而且总是在最糟糕的时刻触发,而不是在测试期间。

#您实际支付的费用

免费 API 并非没有成本:代价只是从金钱支出转移到了其他方面。其中三个方面对开发项目影响很大。

您的数据
许多免费套餐会保留提示词和回答,并可能将其用于训练或改进模型。使用虚构数据进行测试时,这种做法可以接受;但涉及专有代码、客户数据或个人信息(GDPR)时,就不可接受。
依赖
依赖免费配额来构建,就像在可能塌陷的地基上建造:条款可能变更,模型可能下架,免费档位可能取消。您的代码、提示词和设置都针对某一家供应商进行了调整;迁移会耗费您原本没有预料到的时间。
不可预测性
延迟波动、排队、服务中断:当核心组件不受您控制,而且免费服务没有任何保障承诺时,就很难兑现服务质量承诺。
!
请阅读有关模型训练的条款
在将任何真实数据发送至免费 API 之前,请查找「we may use your data to improve our models」的说明。在付费层级,此类数据使用通常默认关闭;在免费层级,往往默认开启。如有疑问,请认为您发送的任何数据都可能被读取并重新利用。

#使用 Ollama 的本地方案

除了附带条件的免费方案,还有真正免费的方案:在您自己的机器上运行模型。Ollama 是实现这一目标最简单的工具。它是一个守护进程,可以下载开放权重模型,并在 http://localhost:11434 上提供本地 HTTP API,其中包含一个兼容 OpenAI 的端点。这意味着,为云端 API 编写的代码通常只需更改基础 URL 就能运行。

终端 — 安装并启动模型
# Installer Ollama (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Tirer et lancer un modèle 7-8B quantifié Q4_K_M
ollama pull qwen2.5:7b
ollama run qwen2.5:7b

# Le daemon écoute sur http://localhost:11434

在代码层面,只需三行代码即可接入兼容 OpenAI 的端点。无需管理 API 密钥,没有配额限制,也没有数据会离开这台机器。

Python — 指向 Ollama 的OpenAI客户端
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",  # endpoint local Ollama
    api_key="ollama",  # ignoré en local, mais requis par le client
)

resp = client.chat.completions.create(
    model="qwen2.5:7b",
    messages=[{"role": "user", "content": "Explique la récursion en une phrase."}],
)
print(resp.choices[0].message.content)

代价在于硬件。本地模型需要显存(采用 Apple Silicon 的 Mac 则需要统一内存)。采用 Q4_K_M 量化时,内存需求有一组容易记住的参考值:3B 模型约需 2 GB,7B 约需 5 GB,14B 约需 9 GB,32B 约需 19 GB,70B 则约需 40 GB。RTX 3060 12 GB 可以轻松运行 7–14B 模型;RTX 4090 24 GB 或配备 24–48 GB 统一内存的 Mac M4 Pro 则可以运行 32B 模型。

完全保密
任何提示词都不会离开您的设备。专有代码、客户数据、个人信息:一切都保留在您本地,这大大简化了 GDPR 合规工作。
无配额限制
没有 RPM 限制,也没有 TPD 限制。您可以在夜间循环处理一万份文档,无需计数,也不会遇到 429 错误。
零边际成本
硬件到位后,每次请求都是免费的。与按用量计费的 API 账单相比,台式机 GPU 的电费仍然可以忽略不计。
稳定性
不会出现使用条件变更,也不会有模型被撤下。只要您不更新,已经下载的版本就会保持不变。

#向本地迁移的临界点

值得问的不是“选择免费服务还是本地运行?”,而是“从什么时候起,本地运行会成为更好的选择?”。四个信号表明您已经跨过了这一门槛。

  1. 01
    您处理的是不能向外部披露的数据
    只要提示词中包含专有代码、客户数据或个人信息,免费 API 中允许使用数据进行训练的条款就会成为无法接受的障碍。本地运行从根源上解决了这个问题:任何内容都不会传出本机。
  2. 02
    您经常遇到配额限制
    如果您的脚本因 429 错误而终止,或您为了不超过 TPD 限额而拆分批次,或您在多个免费账户之间来回切换,那么您已经在耗费时间,而本地运行本可以帮您省下这些时间。
  3. 03
    使用量可预测且持续较高
    对于持续生成测试、内部 RAG 流水线、常驻分类任务等经常性用途,本地运行很快就能收回成本。硬件是可以摊销的固定成本;按使用量计费的 API 则是可变成本,会随着项目的成功而增加。
  4. 04
    您需要可控的延迟
    在专用机器上,延迟由您自己掌控,不受共享服务负载的影响。对于全天使用的内部工具,这种可预测性非常有价值。
→
哪些情况下免费云服务仍是合适的选择
本地运行并不总是合适的选择。对于一次性测试、访问您的机器无法承载的超大前沿模型,或应对偶发且不可预测的负载,使用免费或按使用量计费的 API 仍比购买 GPU 更简单、更便宜。合理的做法是让本地运行与 API 搭配使用。

#保留两者:智能路由

对开发项目而言,最合理的架构并不是只选一种方案:它会将每项任务路由到最合适的端点。本地处理大部分工作量和所有敏感内容;云端仅用于真正超出本地设备能力的任务。

向本地迁移
大批量任务、敏感数据、循环处理、开发迭代,以及所有必须保密的内容。本地运行的 7–14B 模型可以覆盖绝大多数日常开发需求。
转向云端
需要超大模型的复杂推理、偶发的负载高峰,或本地不具备的多模态功能。只将确有必要的内容发送到云端,绝不发送敏感数据。

由于 Ollama 提供兼容 OpenAI 的 API,这种路由很容易用代码实现:两个客户端,加上一条按任务选择客户端的规则。若想进一步扩展,可用 LiteLLM 这样的代理,将多个后端整合到统一接口之后,支持从云端自动回退到本地(或反过来),并跟踪成本。

Python — 根据任务选择本地或云端路由
from openai import OpenAI

local = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
cloud = OpenAI(base_url="https://api.exemple.com/v1", api_key="VOTRE_CLE")

def router(sensible: bool, gros_raisonnement: bool):
    # Données sensibles OU volume : local par défaut
    if sensible or not gros_raisonnement:
        return local, "qwen2.5:7b"
    # Sinon, cloud pour un modèle plus puissant
    return cloud, "modele-frontiere"

client, model = router(sensible=True, gros_raisonnement=False)
resp = client.chat.completions.create(
    model=model,
    messages=[{"role": "user", "content": "Résume ce ticket interne..."}],
)

#通过 4 个步骤开始本地运行

  1. 01
    安装 Ollama
    在 Linux/macOS 上使用一条命令(curl -fsSL https://ollama.com/install.sh | sh)安装,或在 Windows 上使用官方安装程序。守护进程启动后会监听 http://localhost:11434。
  2. 02
    选择与您的硬件配置相匹配的模型
    请确认您的可用显存,并选择一个 Q4_K_M 量化模型,确保加载后仍为上下文留有余量:8–12 GB 显存可选 7B(约 5 GB),12–16 GB 可选 14B(约 9 GB),24 GB 可选 32B(约 19 GB)。显存更少时,3B(约 2 GB)模型仍可用于简单任务。
  3. 03
    下载模型并进行测试
    ollama pull qwen2.5:7b puis ollama run qwen2.5:7b pour vérifier qu'il répond. Un pull ne se fait qu'une fois ; ensuite le modèle est en cache local.
  4. 04
    接入您的代码
    将现有 OpenAI 客户端指向 http://localhost:11434/v1。其余代码——消息、流式传输、函数调用——可像使用云 API 一样工作,无需密钥,也没有配额限制。
→
从一开始就保留云端备用方案
即使每日 100% 本地运行,也应在代码中保留云端连接路径(可使用免费或按需获取的密钥)。当您遇到超出本地机器能力的任务时,切换已经准备就绪,不会阻碍您的进展。

#深入了解

部署好 Ollama 后,本站的三篇指南可以帮助您继续推进这一转变。《在 Python 中集成 Ollama 的 REST API》详细介绍了如何在本地端点上使用流式传输、JSON 模式和函数调用。GPU 服务器成本对比指南量化了购买硬件与使用云端 API 之间的盈亏平衡点。如果需要在本地与云端之间实现生产级路由,LiteLLM 指南则介绍了如何通过一个代理统一两者,并提供备用切换和成本跟踪。


这份指南对您有帮助吗?

有反馈、发现了错误,或想补充说明?请告诉我们,让这份指南对每个人都更有帮助。