AI万址
MMLU

MMLU

MMLU由Dan Hendrycks提出,覆盖57个学科15,908道选择题,是大模型评测黄金标准。GPT-4o得分87.4%,已面临性能饱和问题。

MMLU
访问官网
基本信息详情
开发团队Dan Hendrycks等(UC Berkeley等)
上线时间2021年(ICLR 2021,arXiv: 2009.03300)
官网https://paperswithcode.com/sota/multi-task-language-understanding-on-mmlu
支持平台Papers with Code排行榜 / HuggingFace / GitHub
价格免费(MIT许可)
核心定位大语言模型多任务理解能力的黄金基准,覆盖57个学科

MMLU的全称是Massive Multitask Language Understanding。2021年Dan Hendrycks发出来的时候,它立刻成了大模型评测的事实标准。原因很简单:57个学科,15,908道选择题,从小学数学到美国历史,从计算机科学到法学。你跑一遍MMLU就知道你的模型在"知识"这个维度上到底什么水平。

但MMLU现在有个尴尬的问题:太简单了。2023年3月GPT-4拿到86.4%的准确率,之后所有前沿模型都卡在86%-87%之间。GPT-4o也就87.4%。这意味着MMLU已经无法区分顶级模型之间的差距了。所以2024年滑铁卢大学推出了MMLU-Pro,把4选项扩到10选项,加了更多推理题,准确率直接掉16%-33%。微软也出了MMLU-CF,专门解决数据污染问题。

即便如此,MMLU本身仍然是所有新模型发布时必报的分数。它已经不是一个用来分高下的基准,而是一个用来证明"你的模型基本能力达标"的门槛。80分以下意味着你的模型在知识层面有严重缺陷。

核心功能

01

57学科全覆盖

学科分四大类:STEM(理工)、人文学科、社会科学、其他。从抽象代数到世界观宗教,从高中物理到专业医学。每道题4个选项,只有一个正确答案。随机基线25%。

02

三段数据划分

数据集分为三个部分:Few-shot开发集(每学科5题,用于给模型示范)、验证集(1,540题,用于调超参)、测试集(14,042题,用于最终评分)。这种划分确保评测结果不会被过度调优。

03

Zero-shot和Five-shot评测

Zero-shot直接给题不给示例,测模型的真实知识储备。Five-shot给5个示范问答再测试,测模型结合上下文学习的能力。两者差距大说明模型更多依赖上下文学习,自身知识储备可能不足。

04

Papers with Code排行榜

MMLU的SOTA排行榜托管在Papers with Code上,所有主流模型都会提交成绩。排行榜按学科细分,你可以看到哪个模型在哪个学科最强。这是MMLU最大的价值——不是看总分,而是看学科分布。

05

多语言扩展

OpenAI把MMLU翻译成了多种语言,发布了MMMLU。但翻译版本有文化偏差问题——美国历史、美国法律这些题翻译成中文给中文模型做,测的是翻译能力还是知识能力很难说。所以如果你测中文模型,建议用CMMLU或C-Eval。

适合谁

做大模型研发的团队。MMLU是基本功测试,80分以下说明模型训练有问题。但85分以上之后区分度就很小了,需要上MMLU-Pro或GPQA这种更难的基准。

做模型选型的技术决策者。看MMLU分数时别只看总分。看分学科分数,找跟你业务场景相关的学科。做法律应用的看professional_law,做医疗的看clinical_knowledge和college_medicine。

做学术研究的研究者。MMLU是论文里的标准baseline,几乎所有LLM论文都会报MMLU分数。不用它你的论文可能被审稿人质疑。

同类竞品对比

对比维度MMLUMMLU-ProCMMLUGPQA
学科数5714大类67研究生级
题目数15,908~12,00011,582448
选项数41044
难度中等中等极高
数据污染部分缓解检测中
顶尖模型分数~87%~60%~90%~40%

MMLU和MMLU-Pro搭配使用是当前的主流做法。MMLU确认基线达标,MMLU-Pro测推理能力上限。GPQA则用来区分顶级模型之间的细微差距。

FAQ

A

MMLU现在还有用吗? 有。虽然顶级模型已经接近饱和,但新模型仍然需要MMLU分数来证明基本能力。对于70亿参数以下的中小模型,MMLU的区分度依然够用。

A

MMLU的数据污染问题严重吗? 严重。很多模型的训练数据里可能包含了MMLU的测试集。微软的研究发现,部分模型在用MMLU题目作为prompt时,能直接给出和原始数据完全一致的选项。MMLU-CF通过重新出题和闭源测试集来缓解这个问题。

A

MMLU和MMLU-Pro应该用哪个? 两个都用。MMLU作为基线,MMLU-Pro作为进阶。如果只能选一个,取决于你的模型水平:75分以下用MMLU,85分以上用MMLU-Pro。

A

怎么跑MMLU评测? 最简单的方式是用lm-evaluation-harness或OpenCompass,两个框架都内置了MMLU。HELM也支持MMLU评测。HuggingFace上可以直接下载数据集。

A

MMLU为什么只有英文? 因为原始设计是面向英文模型的。OpenAI做了MMMLU多语言翻译版,但翻译质量和文化偏差是已知问题。中文场景用CMMLU,阿拉伯语有ArabicMMLU,保加利亚语有MMLU-BG。

A

MMLU的题目质量怎么样? 整体不错,但也有噪音。MMLU-Pro的论文指出MMLU中有一些trivial和noisy的题目,这些在MMLU-Pro中被移除了。不过对于大部分评测场景,MMLU的题目质量是够用的。

更新动态

客户评论

MMLU作为学术基准,没有传统商业产品的用户评分。以下是学术界和工程团队的反馈:

"MMLU是我们评估新模型时的第一个基准。虽然已经接近饱和,但它作为门槛测试依然不可替代。" — 搜索结果中的模型评测实践文章

"MMLU的饱和问题让我们不得不转向MMLU-Pro和GPQA。但MMLU的历史地位不会变,它定义了LLM评测的范式。" — MMLU-Pro论文中的讨论

MMLU论文被ICLR 2021收录,是LLM评测领域引用量最高的论文之一。后续的MMLU-Pro被多篇顶会论文引用,MMLU-CF被ACL 2025录用。

参考来源