MMLU-Pro:本地 LLM 的知识能力基准测试

Le MMLU-Pro基准测试 已成为评估本地运行的开放权重模型知识深度和推理能力的标杆。由 TIGER-Lab 于 2024 年发布,这项 MMLU-Pro基准测试 通过引入涵盖 14 个学科的 12,032 道题目、每题设置 10 个选项,弥补了原版 MMLU 的不足(得分趋于饱和、题意含糊、多项选择题答案过于容易猜中)。本文详细介绍评测流程、quelllm.fr 模型目录中各模型的实测得分、量化对结果的影响,以及如何在家中使用消费级 GPU 或工作站复现该基准测试。

为什么 MMLU-Pro 在严谨的评估中取代了 MMLU

在经典 MMLU(Hendrycks 等,2020)上,最佳模型的得分已接近约 88–90% 的上限,因此几乎无法区分前沿模型之间的水平。 arXiv论文 2406.01574 引入了三项重大改进:

结果:与 MMLU 相比,平均得分下降 15 至 25 分。在 MMLU 上取得 86% 的模型,在 MMLU-Pro 上通常会降至约 66%。这种分数整体下移,使这项测量重新能够有效比较现代开放权重模型。

完整数据集托管于 HuggingFace TIGER-Lab/MMLU-Pro 而参考评估使用的是 官方GitHub仓库.

在 quelllm.fr 模型目录中观察到的 MMLU-Pro 分数

以下评分来自 TIGER-Lab 官方排行榜及厂商技术报告。标注为“估算”的数值源自社区部分测量数据,尚需进一步验证。

同一模型在不同类别(法律、医学、工程)上的得分差距可达 20 分:平均分往往掩盖了某个学科领域的短板。

量化对 LLM MMLU 评分的影响

量化会降低显存需求,但也会降低评分。对目录中模型的实测得出了以下大致幅度(来源:llama.cpp 的 issues、Unsloth 报告):

Pour Llama 3.3 70B Instruct,例如,在 "law" 子集上,得分从 FP16 下的约 68% 降至 Q4_K_M 下的约 64%。对于 Qwen 2.5 72B Instruct,差距较小(1.5个百分点)。实用准则:Q5_K_M仍是严谨评估的最佳折中方案,Q4则适合日常使用。

参见 GGUF 量化指南 关于格式详情。

运行知识基准所需的VRAM与硬件成本

在本地复现 MMLU-Pro 需要将模型加载到内存中,并生成约 12,032 个回答(使用 CoT 时,相当于输出 500 万至 1,000 万 token)。各档硬件成本:

在 RTX 6000 Ada 上,对采用 Q4 量化的 70B 模型进行完整基准测试需要 4 至 8 小时,具体取决于吞吐量(约 25–35 tokens/sec)。要校准您的配置,工具 /configurateur 提供适合目标VRAM预算的硬件方案

本地复现基准测试的方法

标准测试流程使用 vllm 或 llama.cpp 作为后端,并配合使用 TIGER-AI-Lab 仓库中的官方 Python 脚本。

主要步骤:

  1. 数据集下载 depuis HuggingFace (约 12 MB)。
  2. 模型配置 在聊天生成模式下,温度设为0,top-p设为1。系统提示应包含每类5个few-shot示例(思维链启用)。
  3. 启动评估 逐个学科进行(14 个类别:biology、business、chemistry、computer_science、economics、engineering、health、history、law、math、other、philosophy、physics、psychology)。
  4. 解析响应 :通过正则表达式从最后一行提取最终答案字母(A 到 J)。
  5. 评分计算 按类别加权或取整体平均值。

详细信息请参见 GitHub 说明文件。要并排比较两个模型,请查看 /compare/llama33-70b-vs-qwen25-72b 或在以下页面查看总排名: /meilleur-llm/raisonnement.

MMLU-Pro 的局限性及补充基准测试

任何基准测试单独使用都不够。MMLU-Pro 衡量学术知识和结构化推理能力,但不涵盖:

一套稳健的测试组合至少包含MMLU-Pro + HumanEval + GSM8K + 一个智能体基准测试。

FAQ

Q:MMLU 与 MMLU-Pro 之间有什么实际区别?

MMLU 每题有 4 个选项,得分超过 88% 后便趋于饱和。MMLU-Pro 将选项增加到 10 个,筛除有歧义的问题,并纳入多步推理。结果:得分下降 15 至 25 分,使其重新具备区分能力。对于 2025 年及以后的使用,MMLU-Pro 已成为模型厂商技术报告中的参考标准。

Q:评估模型时是否需要启用链式思维?

是,用于比较基准测试,因为官方MMLU-Pro协议使用了它。不启用思维链(CoT)时,各模型得分会下降5至15分。在 DeepSeek R1 671B,推理模式比直接调用高约 8 分。要评估不使用 CoT 时在生产环境中的适用性,请单独以 "answer only" 模式运行评估。

Q:我能否在 Mac M4 上运行知识基准测试?

是的,通过 llama.cpp 或 MLX 实现。一台配备 128 GB 内存的 Mac Studio M4 Max 可以运行 Llama 3.3 70B Instruct Q4(约40 GB),8-12个token/秒,完整基准测试约需6至10小时。100B以上的模型需要M4 Ultra 192 GB或非常缓慢的SSD卸载。详见 Mac Apple 芯片指南 ,了解推荐配置。

Q:用 MMLU-Pro 得分来选择业务模型是否可靠?

部分是这样。MMLU-Pro 能较好地反映通用能力,但 70% 的总分可能掩盖法律领域 55% 和物理领域 82% 的得分。如果您的使用场景针对某个特定学科,请查看排行榜公布的分类得分。对于法语环境下的编程或法律用途,请结合 HumanEval-FR,以及基于您自身数据的内部测试进行评估。

Q:基准测试中顶尖模型采用何种许可证?

开放权重模型中的最高分来自采用宽松许可证的模型: DeepSeek V3 671B (DeepSeek 许可证), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0)。注意 : Llama 3.1 405B Instruct 采用 Llama 3.1 Community 许可证(超过 7 亿月活跃用户时存在限制)。在商业部署前,请核查每个许可证。

Q:在租用 GPU 上进行完整评估需要多少钱?

通过裸金属云服务租用 H100 80 GB 的价格为每小时 2 欧元,在 Q4 量化的 70B 模型上完整运行一次 MMLU-Pro 基准测试,费用为 8 至 16 欧元,具体取决于吞吐量。对于需要 4 块 H100 的 Q4 量化 405B 模型,费用约为 80 至 160 欧元。这明显比购买硬件便宜,但对于重复评估或敏感数据,本地推理仍有价值。

结论

Le MMLU-Pro基准测试 目前提供了最能区分开放权重 LLM 知识与推理能力的评估指标。结合专门的基准测试(HumanEval、AIME、LongBench),它可以为模型选择提供客观依据。要确定能让您运行排行榜中最佳模型的硬件配置,请使用 quelllm.fr 配置器 或探索已索引的249个模型 完整目录.

文章发表于 由 Mohamed Meguedmi · 数据来源: /api/models.json · 内容许可协议: CC BY 4.0.

有错误或更新需要反馈吗? 参与贡献.