由 QuelLLM 测量
三个模型,一台机器,实证数据
2026 年 9 月 12 日在 RTX 5070 Ti Laptop 上进行的试测:实测 12 227 MiB,使用 Ollama,上下文长度为 4096,一次处理一个请求。结果不外推到桌面版、RTX 5090 或 Mac。
旧版多机器测试矩阵已被撤下,因为缺少可供核验的测试产物。本专题只公布这次试点测试的实测数据,每个模型先预热,再重复测试五次。
| 模型 | 量化 | 每秒 token 数中位数 | Min–max | 代码 FR | 法语文档 |
|---|---|---|---|---|---|
| qwen3:8b | Q4_K_M | 59.71 | 59.45–59.96 | 成功 | 事实与格式均达标 |
| hermes3:8b | Q4_0 | 71.97 | 71.79–72.15 | 失败 | 事实准确,关键点不同 |
| mistral-nemo:12b | Q4_0 | 47.44 | 47.37–47.56 | 成功 | 事实与格式均达标 |
该测试能够说明的问题
Hermes3 在这项测试中的生成速度更快,但它生成的函数未能正确去重,而且对值进行了排序。Qwen3 和 Mistral Nemo 成功完成了这项任务。因此,吞吐量并不能证明质量。一项代码任务和一项合成数据提取任务不足以对模型在所有用途中的表现进行排名;Hermes3 的输出也达到了 256 个 token 的上限。
复现并检查数据
原始数据分别记录提示处理和生成。前缀缓存可能影响前者;显示的吞吐量仅涉及生成。这既不是能耗测量,也不是应用的总延迟。
三种数据类型
“由QuelLLM测量”指附有相关实验产物的实验。“外部测量”必须注明测量者及其测试方法。“估算”尤其包括配置器中通过启发式方法估算的速度和内存预算;这些数值并非来自本次新测试。