成本模型 · 更新于 2026 年
成本的 人工智能 API 会让您的预算严重超支吗?
云 API 提供商消耗了收入中的很大一部分。以下计算方法可帮助您判断,它们下一次涨价是否也会让您的预算大幅超支。
coût_mensuel_2026 = R × (T_in × P_in + (T_out + T_raisonnement) × P_out)coût_mensuel_2027 = coût_mensuel_2026 × (1 + r)^Δmois
计算API费用及临界点
请输入您的月用量:工具会根据价格上涨情景计算当前、12 个月后和 24 个月后的账单,以及本地配置的投资回收期。
无人提及的隐性成本上涨
自2023年以来,按token计价的价格整体下降。但幕后发生了两件事: 推理 token 按输出 token 计费,其长度可能达到可见回答长度的数倍; 默认路由 会悄然将“困难”的请求转交给更昂贵的推理模型。TechAhead 于 2026 年 4 月发表的一篇评述就指出,OpenAI API 的价格“最高可达 4× 在某些地区,价格在2025年3月至2026年1月期间仍较高,尽管目录价格有所下降。
2026年的实际费用账单
| 工作负载 | 每请求可见 token 数 | 每次请求的推理 token 数 | 成本/请求(GPT-5) |
|---|---|---|---|
| 客服分类器 | 120输入/40输出 | 180 | 0,0021 € |
| 代码审查智能体(1 个文件) | 2 400 in / 600 out | 4 800 | 0,050 € |
| 多步骤研究智能体 | 8 000 in / 1 200 out | 22 000 | 0,213 € |
| 长上下文法律 RAG | 62,000输入 / 1,500输出 | 9 000 | 0,161 € |
按 GPT-5 的公开价格计算(每百万输入 token 1.25 美元,每百万输出 token 10 美元,推理 token 按输出 token 计费),以 1 美元兑 0.88 欧元换算(2026 年 9 月)。
每月运行智能体50,000次——对于中型企业而言,这是一个规模不大的部署——仅“研究智能体”这一项费用就达到 约10600欧元/月.
与本地部署相比的盈亏平衡点
真正的问题不是“本地模型在 MMLU 上能否媲美前沿模型 API?”,而是“它能否以可接受的方式处理我 70% 的流量,迁移成本又是多少?”。以下是三种参考部署方案,成本按 24 个月摊销,并计入电费(0.20 欧元/kWh,利用率 60%)。阈值计算将这一月度成本与 GPT-5 仅输出 token 的价格(约 8.80 欧元/百万 token)进行比较:
| 配置 | 模型 | 硬件成本 | 月度费用 | 盈利即刻开始 |
|---|---|---|---|---|
| RTX 5090 32 GB(加装到现有 PC 中) | Qwen 3 32B Q4_K_M | ≈ 5 000 € | ≈ 265 € | 每月约 3000 万个输出 token |
| 2 × RTX 5090(无 NVLink,模型分布在两张显卡上) | Qwen 2.5 72B Q4_K_M | ≈ 10 000 € | ≈ 520 € | 每月约 5900 万个输出 token |
| Mac Studio M5 Ultra 96 GB | gpt-oss 120B | ≈ 6 600 € | ≈ 300 € | 每月约3400万个输出token |
硬件价格数据截至2026年9月(RTX 5090价格约为5000至5600欧元,视供应商而定;Mac Studio M5 Ultra 96GB售价为6599欧元)。RTX 5090不支持NVLink:两块显卡通过PCIe总线共享模型。
上述示例(50 000 次执行,每月约 11.6 亿个输出和推理 token,约 10 600 欧元/月)已经远远超过盈亏平衡点。但单张 GPU 不足以生成这么多 token:需要使用多张显卡,通过 vLLM 进行批处理服务,而且部分流量仍会继续使用 API。
混合路由器:兼得两者之长
- 级别 1(本地,60-75% 的流量): 分类、信息提取、代码补全、上下文少于 32K 的 RAG 内容综合。
- 级别 2(中端 API,15-25%): 轻量模型适用于中等强度的推理,成本可控。
- 第 3 层(前沿模型 API,5-15 %): 仅处理真正需要前沿推理能力、经低成本分类器筛选出的请求。
如果70%的请求在本地处理,API费用将下降约70%,减去硬件成本——前提是本地请求的质量可接受,这一点可通过您自身流量的测试验证。
结论
| 当前月度API费用 | 建议 | 为什么 |
|---|---|---|
| < 400 € | 继续使用API | 迁移工程的成本超过 24 个月内节省的费用 |
| 400 - 1 800 € | 优化提示词,为推理设置上限 | 提示词缓存、批量处理(费用降低 50%)以及限制推理投入,都能在继续使用 API 的同时降低费用 |
| 1 800 - 8 000 € | 混合模式:第 1 级本地 + 第 3 级 API | 高性能GPU若本地流量占主导,可在数月内实现回本 |
| > 8 000 € | 激进迁移 | 成本曲线在超过 12 个月后不可持续 |
常见问题
API 的价格真的会上涨,还是会继续下降?
自 2023 年以来,按 token 计算的标价总体下降了。但每次有效回答的成本可能上升,因为推理 token 按输出 token 计费。TechAhead 于 2026 年 4 月发布的一篇综述指出,在 2025 年 3 月至 2026 年 1 月期间,OpenAI API 的价格在“某些地区最高达到原来的 4 倍”。请按实测的每次请求成本制定预算,不要只看标价。
单块高端 GPU(32 GB)是否足以替代前沿模型 API?
对于相当一部分常规请求(代码、分类、上下文少于 32K 的 RAG),通常可以:一个经 Q4_K_M 量化的 32B 模型,在 RTX 5090 上能达到每秒数十个 token 的速度。实际可替代的比例取决于您的任务,需要用您自己的请求流量验证。对于最先进的推理能力和超长上下文,仍需要使用能切换到前沿模型 API 的混合路由器。
在模型中使用何种通胀率?
没有官方数值:r 是情景假设。举例来说,r = 0.06 每月会使账单在一年内翻倍。也请测试 r = 0(价格稳定)以及一个负值,后者对应自 2023 年以来观察到的标价下降。
微调是否是本地部署的替代方案?
在云服务提供商处进行微调会降低微调后模型的每 token 成本,但往往会增加总支出,因为团队会以较低的单位成本为理由增加调用次数。这也会使您受制于该服务提供商。对本地模型(Qwen3 或 Llama)进行 LoRA 微调则能带来持久的成本节省。