测量方法

具体数据 可验证的

本站展示了各种数值:配置器的估算、模型目录中的评估结论,以及实测的基准测试结果。下面具体说明它们的来源和计算方法。

查看试点测试的实测结果及其局限 · 可复现的测试规程 · 公开的计算引擎

三大原则

  1. 01

    区分估计值与测量值

    配置器通过公式估算tokens/秒,基准测试页面显示实际测量的tokens/秒。两者标签不同,以避免混淆

  2. 02

    我们公布误差范围

    我们并没有为所有估算提供经过校准的误差区间。已完成实测的试点公布了五次重复测量的中位数、最小值和最大值。

  3. 03

    所有内容均标注时间

    每个指南、每个模型页面均标注最后验证日期。在Ollama上6个月前正确的信息,今天往往已不再适用。

所使用的公式

面向公众的兼容性引擎所采用的规则。这些规则评估内存需求并提供参考速度,不构成质量排名。

01
模型权重的内存预算
预算 ≥ 目录中列出的该量化方案阈值

Q4/Q5/Q8/FP16 的阈值是目录中的近似估算值。引擎不会计算所请求上下文的 KV 缓存大小:需预留余量。

02
GPU 速度估算
tok/s = 根据 GPU 的档次选取模型的 low、mid 或 high 值

启发式估算:未在您的机器上进行测量。Apple 机型的配置方案使用各自的统一内存预算。

03
回退到 CPU
≤3B:mid × 0.3;≤8B:low × 0.4;否则 max(1, low × 0.15)

以 tokens/s 为单位四舍五入。即使存在 GPU,只要模型权重未驻留在其中,也会使用这一分支。

这些数据来自哪里 数据

所有内容都有来源依据,没有任何信息是凭空捏造的。如果某条信息有误或已过时, signalez-la.

Hugging Face
模型资料、大小、架构
huggingface.co
Ollama库
可用的量化方式及权重信息
ollama.com/library
llama.cpp
PPL 测试基准、支持的架构
github.com/ggerganov/llama.cpp
TechPowerUp
GPU规格(VRAM、带宽)
techpowerup.com/gpu-specs
我们的测试平台
三个模型,一块 RTX 5070 Ti Laptop 显卡,原始数据已公开
查看基准测试

已知偏差

!
阅读我们的数据前需要了解的信息
  • 估算的token/秒假设使用一台机器 空闲状态,没有同时运行打开了 40 个标签页的 Chrome。
  • 2026年9月12日版本驱动已运行 Ollama 0.30.6;其选项和版本信息已归档。
  • 配置器无法精确模拟 Mac——Apple Silicon 在运行超大模型时会表现出非线性行为。
  • 引擎会选择在分配给模型权重的内存容量内能够容纳的最高量化精度。这一选择既不保证模型能在长上下文设置下加载,也不保证其质量适合您的用途。