MMLU-Pro:本地 LLM 的知识能力基准测试
Le MMLU-Pro基准测试 已成为评估本地运行的开放权重模型知识深度和推理能力的标杆。由 TIGER-Lab 于 2024 年发布,这项 MMLU-Pro基准测试 通过引入涵盖 14 个学科的 12,032 道题目、每题设置 10 个选项,弥补了原版 MMLU 的不足(得分趋于饱和、题意含糊、多项选择题答案过于容易猜中)。本文详细介绍评测流程、quelllm.fr 模型目录中各模型的实测得分、量化对结果的影响,以及如何在家中使用消费级 GPU 或工作站复现该基准测试。
为什么 MMLU-Pro 在严谨的评估中取代了 MMLU
在经典 MMLU(Hendrycks 等,2020)上,最佳模型的得分已接近约 88–90% 的上限,因此几乎无法区分前沿模型之间的水平。 arXiv论文 2406.01574 引入了三项重大改进:
- 每题10个选项,而非4个 :随机猜对的概率从 25% 降至 10%,从而扩大了分数范围。
- 手动筛除有歧义的问题 :专家已删除或重新表述了原始 MMLU 中约 5000 道题。
- 增加对推理要求较高的问题 :纳入来自 STEM 领域的问题(TheoremQA、SciBench),这些问题需要多步计算,而非简单地提取记忆。
结果:与 MMLU 相比,平均得分下降 15 至 25 分。在 MMLU 上取得 86% 的模型,在 MMLU-Pro 上通常会降至约 66%。这种分数整体下移,使这项测量重新能够有效比较现代开放权重模型。
完整数据集托管于 HuggingFace TIGER-Lab/MMLU-Pro 而参考评估使用的是 官方GitHub仓库.
在 quelllm.fr 模型目录中观察到的 MMLU-Pro 分数
以下评分来自 TIGER-Lab 官方排行榜及厂商技术报告。标注为“估算”的数值源自社区部分测量数据,尚需进一步验证。
- DeepSeek V3 671B :75.9%——截至 2024 年末记录到的通用开放权重模型最高得分。完整资料参见 /modele/deepseek-v3-671b.
- DeepSeek R1 671B :84.0%(启用推理)—— 得益于内部思维链,提升约 8 个百分点。详情参见 /modele/deepseek-r1-671b.
- Qwen 3 235B-A22B : 72.1% 估算值 — MoE 架构,参见 /modele/qwen3-235b-a22b.
- Llama 3.1 405B Instruct :73.3%——Meta 的参考模型,模型资料页 /modele/llama-3-1-405b.
- Llama 3.3 70B Instruct :68.9%——对于配备 40 GB 显存的设备,性能与显存占用之比最佳,模型介绍页 /modele/llama33-70b.
- Mistral Large 3 675B : 71.5%(估算值)— 参见 /modele/mistral-large-3.
- gpt-oss 120B :估计为 70.2% — OpenAI 蒸馏变体,模型介绍页面: /modele/gpt-oss-120b.
- Qwen 2.5 72B Instruct : 65.4% — 多语言基础扎实,详情 /modele/qwen25-72b.
- Mixtral 8x22B Instruct :56.2%——虽是历史数据,但仍有比较参考价值,模型介绍见 /modele/mixtral-8x22b.
同一模型在不同类别(法律、医学、工程)上的得分差距可达 20 分:平均分往往掩盖了某个学科领域的短板。
量化对 LLM MMLU 评分的影响
量化会降低显存需求,但也会降低评分。对目录中模型的实测得出了以下大致幅度(来源:llama.cpp 的 issues、Unsloth 报告):
- FP16 → Q8_0 :MMLU-Pro 得分下降不到 0.5 分,通常不显著。
- Q8 → Q5_K_M : 不同学科损失1至2分(数学受影响更明显)
- Q5 → Q4_K_M :分数下降 2 至 4 分,在多步推理问题上下降更明显。
- Q4 → Q3 :得分可能大幅下降(超过 5 分),应避免用于要求较高的场景。
Pour Llama 3.3 70B Instruct,例如,在 "law" 子集上,得分从 FP16 下的约 68% 降至 Q4_K_M 下的约 64%。对于 Qwen 2.5 72B Instruct,差距较小(1.5个百分点)。实用准则:Q5_K_M仍是严谨评估的最佳折中方案,Q4则适合日常使用。
参见 GGUF 量化指南 关于格式详情。
运行知识基准所需的VRAM与硬件成本
在本地复现 MMLU-Pro 需要将模型加载到内存中,并生成约 12,032 个回答(使用 CoT 时,相当于输出 500 万至 1,000 万 token)。各档硬件成本:
- 24 GB 显存(RTX 4090) :仅限约 30B 的 Q4 量化模型;无法使用大型开放权重模型。
- 48GB VRAM(2× RTX 4090 或 RTX 6000 Ada) : 支持 Llama 3.3 70B Instruct 采用 Q4 量化(约 40 GB), Qwen 2.5 72B Instruct (~42 GB), Qwen3-Coder-Next 80B-A3B (约 48 GB)。
- 96 GB VRAM(2× RTX 6000 Ada) :可运行 Mixtral 8x22B Instruct (~82 GB), gpt-oss 120B (~70 GB), Mistral Small 4 (~72 GB)。
- 160-200 GB 显存(4-5 块 RTX 6000 Ada 或 H100) : Llama 3.1 405B Instruct 采用 Q4 量化(约 240 GB,部分模型卸载至系统内存,由 CPU 处理), Qwen 3 235B-A22B (~142 GB)。
- 400 GB 及以上显存(H100/H200 集群) : DeepSeek V3 671B, DeepSeek R1 671B, Kimi K2.5 以及规模更大的模型。
在 RTX 6000 Ada 上,对采用 Q4 量化的 70B 模型进行完整基准测试需要 4 至 8 小时,具体取决于吞吐量(约 25–35 tokens/sec)。要校准您的配置,工具 /configurateur 提供适合目标VRAM预算的硬件方案
本地复现基准测试的方法
标准测试流程使用 vllm 或 llama.cpp 作为后端,并配合使用 TIGER-AI-Lab 仓库中的官方 Python 脚本。
主要步骤:
- 数据集下载 depuis HuggingFace (约 12 MB)。
- 模型配置 在聊天生成模式下,温度设为0,top-p设为1。系统提示应包含每类5个few-shot示例(思维链启用)。
- 启动评估 逐个学科进行(14 个类别:biology、business、chemistry、computer_science、economics、engineering、health、history、law、math、other、philosophy、physics、psychology)。
- 解析响应 :通过正则表达式从最后一行提取最终答案字母(A 到 J)。
- 评分计算 按类别加权或取整体平均值。
详细信息请参见 GitHub 说明文件。要并排比较两个模型,请查看 /compare/llama33-70b-vs-qwen25-72b 或在以下页面查看总排名: /meilleur-llm/raisonnement.
MMLU-Pro 的局限性及补充基准测试
任何基准测试单独使用都不够。MMLU-Pro 衡量学术知识和结构化推理能力,但不涵盖:
- 代码 : 使用HumanEval、MBPP或LiveCodeBench。该模型 Qwen3-Coder-Next 80B-A3B 专为该类别设计(fiche).
- 高级数学 : AIME、MATH、GSM8K仍不可或缺。 DeepSeek R1 671B 在此方面表现尤为突出。
- 多语言支持 :MGSM、Multilingual MMLU,以及用于法语评测的 Belebele。 Mistral Large 3 675B et Rakuten AI 3.0 在这些方面获得了更高的评价。
- 长上下文 : RULER, LongBench. Llama 4 Scout 109B (10M tokens上下文) 或 MiMo V2.5 Pro (100 万 token)是这里的标杆。
- L'agentique : SWE-bench, BFCL, AgentBench。
一套稳健的测试组合至少包含MMLU-Pro + HumanEval + GSM8K + 一个智能体基准测试。
FAQ
Q:MMLU 与 MMLU-Pro 之间有什么实际区别?
MMLU 每题有 4 个选项,得分超过 88% 后便趋于饱和。MMLU-Pro 将选项增加到 10 个,筛除有歧义的问题,并纳入多步推理。结果:得分下降 15 至 25 分,使其重新具备区分能力。对于 2025 年及以后的使用,MMLU-Pro 已成为模型厂商技术报告中的参考标准。
Q:评估模型时是否需要启用链式思维?
是,用于比较基准测试,因为官方MMLU-Pro协议使用了它。不启用思维链(CoT)时,各模型得分会下降5至15分。在 DeepSeek R1 671B,推理模式比直接调用高约 8 分。要评估不使用 CoT 时在生产环境中的适用性,请单独以 "answer only" 模式运行评估。
Q:我能否在 Mac M4 上运行知识基准测试?
是的,通过 llama.cpp 或 MLX 实现。一台配备 128 GB 内存的 Mac Studio M4 Max 可以运行 Llama 3.3 70B Instruct Q4(约40 GB),8-12个token/秒,完整基准测试约需6至10小时。100B以上的模型需要M4 Ultra 192 GB或非常缓慢的SSD卸载。详见 Mac Apple 芯片指南 ,了解推荐配置。
Q:用 MMLU-Pro 得分来选择业务模型是否可靠?
部分是这样。MMLU-Pro 能较好地反映通用能力,但 70% 的总分可能掩盖法律领域 55% 和物理领域 82% 的得分。如果您的使用场景针对某个特定学科,请查看排行榜公布的分类得分。对于法语环境下的编程或法律用途,请结合 HumanEval-FR,以及基于您自身数据的内部测试进行评估。
Q:基准测试中顶尖模型采用何种许可证?
开放权重模型中的最高分来自采用宽松许可证的模型: DeepSeek V3 671B (DeepSeek 许可证), DeepSeek R1 671B (MIT), Qwen 3 235B-A22B (Apache 2.0), Mistral Large 3 675B (Apache 2.0)。注意 : Llama 3.1 405B Instruct 采用 Llama 3.1 Community 许可证(超过 7 亿月活跃用户时存在限制)。在商业部署前,请核查每个许可证。
Q:在租用 GPU 上进行完整评估需要多少钱?
通过裸金属云服务租用 H100 80 GB 的价格为每小时 2 欧元,在 Q4 量化的 70B 模型上完整运行一次 MMLU-Pro 基准测试,费用为 8 至 16 欧元,具体取决于吞吐量。对于需要 4 块 H100 的 Q4 量化 405B 模型,费用约为 80 至 160 欧元。这明显比购买硬件便宜,但对于重复评估或敏感数据,本地推理仍有价值。
结论
Le MMLU-Pro基准测试 目前提供了最能区分开放权重 LLM 知识与推理能力的评估指标。结合专门的基准测试(HumanEval、AIME、LongBench),它可以为模型选择提供客观依据。要确定能让您运行排行榜中最佳模型的硬件配置,请使用 quelllm.fr 配置器 或探索已索引的249个模型 完整目录.