
| 基本信息 | 详情 |
|---|---|
| 开发团队 | Dan Hendrycks等(UC Berkeley等) |
| 上线时间 | 2021年(ICLR 2021,arXiv: 2009.03300) |
| 官网 | https://paperswithcode.com/sota/multi-task-language-understanding-on-mmlu |
| 支持平台 | Papers with Code排行榜 / HuggingFace / GitHub |
| 价格 | 免费(MIT许可) |
| 核心定位 | 大语言模型多任务理解能力的黄金基准,覆盖57个学科 |
MMLU的全称是Massive Multitask Language Understanding。2021年Dan Hendrycks发出来的时候,它立刻成了大模型评测的事实标准。原因很简单:57个学科,15,908道选择题,从小学数学到美国历史,从计算机科学到法学。你跑一遍MMLU就知道你的模型在"知识"这个维度上到底什么水平。
但MMLU现在有个尴尬的问题:太简单了。2023年3月GPT-4拿到86.4%的准确率,之后所有前沿模型都卡在86%-87%之间。GPT-4o也就87.4%。这意味着MMLU已经无法区分顶级模型之间的差距了。所以2024年滑铁卢大学推出了MMLU-Pro,把4选项扩到10选项,加了更多推理题,准确率直接掉16%-33%。微软也出了MMLU-CF,专门解决数据污染问题。
即便如此,MMLU本身仍然是所有新模型发布时必报的分数。它已经不是一个用来分高下的基准,而是一个用来证明"你的模型基本能力达标"的门槛。80分以下意味着你的模型在知识层面有严重缺陷。
核心功能
57学科全覆盖
学科分四大类:STEM(理工)、人文学科、社会科学、其他。从抽象代数到世界观宗教,从高中物理到专业医学。每道题4个选项,只有一个正确答案。随机基线25%。
三段数据划分
数据集分为三个部分:Few-shot开发集(每学科5题,用于给模型示范)、验证集(1,540题,用于调超参)、测试集(14,042题,用于最终评分)。这种划分确保评测结果不会被过度调优。
Zero-shot和Five-shot评测
Zero-shot直接给题不给示例,测模型的真实知识储备。Five-shot给5个示范问答再测试,测模型结合上下文学习的能力。两者差距大说明模型更多依赖上下文学习,自身知识储备可能不足。
Papers with Code排行榜
MMLU的SOTA排行榜托管在Papers with Code上,所有主流模型都会提交成绩。排行榜按学科细分,你可以看到哪个模型在哪个学科最强。这是MMLU最大的价值——不是看总分,而是看学科分布。
多语言扩展
OpenAI把MMLU翻译成了多种语言,发布了MMMLU。但翻译版本有文化偏差问题——美国历史、美国法律这些题翻译成中文给中文模型做,测的是翻译能力还是知识能力很难说。所以如果你测中文模型,建议用CMMLU或C-Eval。
适合谁
做大模型研发的团队。MMLU是基本功测试,80分以下说明模型训练有问题。但85分以上之后区分度就很小了,需要上MMLU-Pro或GPQA这种更难的基准。
做模型选型的技术决策者。看MMLU分数时别只看总分。看分学科分数,找跟你业务场景相关的学科。做法律应用的看professional_law,做医疗的看clinical_knowledge和college_medicine。
做学术研究的研究者。MMLU是论文里的标准baseline,几乎所有LLM论文都会报MMLU分数。不用它你的论文可能被审稿人质疑。
同类竞品对比
| 对比维度 | MMLU | MMLU-Pro | CMMLU | GPQA |
|---|---|---|---|---|
| 学科数 | 57 | 14大类 | 67 | 研究生级 |
| 题目数 | 15,908 | ~12,000 | 11,582 | 448 |
| 选项数 | 4 | 10 | 4 | 4 |
| 难度 | 中等 | 高 | 中等 | 极高 |
| 数据污染 | 有 | 部分缓解 | 检测中 | 低 |
| 顶尖模型分数 | ~87% | ~60% | ~90% | ~40% |
MMLU和MMLU-Pro搭配使用是当前的主流做法。MMLU确认基线达标,MMLU-Pro测推理能力上限。GPQA则用来区分顶级模型之间的细微差距。
FAQ
MMLU现在还有用吗? 有。虽然顶级模型已经接近饱和,但新模型仍然需要MMLU分数来证明基本能力。对于70亿参数以下的中小模型,MMLU的区分度依然够用。
MMLU的数据污染问题严重吗? 严重。很多模型的训练数据里可能包含了MMLU的测试集。微软的研究发现,部分模型在用MMLU题目作为prompt时,能直接给出和原始数据完全一致的选项。MMLU-CF通过重新出题和闭源测试集来缓解这个问题。
MMLU和MMLU-Pro应该用哪个? 两个都用。MMLU作为基线,MMLU-Pro作为进阶。如果只能选一个,取决于你的模型水平:75分以下用MMLU,85分以上用MMLU-Pro。
怎么跑MMLU评测? 最简单的方式是用lm-evaluation-harness或OpenCompass,两个框架都内置了MMLU。HELM也支持MMLU评测。HuggingFace上可以直接下载数据集。
MMLU为什么只有英文? 因为原始设计是面向英文模型的。OpenAI做了MMMLU多语言翻译版,但翻译质量和文化偏差是已知问题。中文场景用CMMLU,阿拉伯语有ArabicMMLU,保加利亚语有MMLU-BG。
MMLU的题目质量怎么样? 整体不错,但也有噪音。MMLU-Pro的论文指出MMLU中有一些trivial和noisy的题目,这些在MMLU-Pro中被移除了。不过对于大部分评测场景,MMLU的题目质量是够用的。
更新动态
客户评论
MMLU作为学术基准,没有传统商业产品的用户评分。以下是学术界和工程团队的反馈:
"MMLU是我们评估新模型时的第一个基准。虽然已经接近饱和,但它作为门槛测试依然不可替代。" — 搜索结果中的模型评测实践文章
"MMLU的饱和问题让我们不得不转向MMLU-Pro和GPQA。但MMLU的历史地位不会变,它定义了LLM评测的范式。" — MMLU-Pro论文中的讨论
MMLU论文被ICLR 2021收录,是LLM评测领域引用量最高的论文之一。后续的MMLU-Pro被多篇顶会论文引用,MMLU-CF被ACL 2025录用。
