
| 基本信息 | 详情 |
|---|---|
| 开发团队 | Haonan Li等(MBZUAI、上海交大、微软亚研院、墨尔本大学) |
| 上线时间 | 2023年6月(论文arXiv: 2306.09212) |
| 官网 | https://github.com/haonan-li/CMMLU |
| 支持平台 | GitHub开源 / HuggingFace数据集 |
| 价格 | 免费(CC BY-NC-SA 4.0许可) |
| 核心定位 | 中文化的大模型多任务理解评测基准,覆盖67个学科 |
CMMLU的全称是Chinese Massive Multitask Language Understanding。说白了,它就是中文版MMLU——但又不完全是翻译。MMLU是美国人的考试,CMMLU是给中国语境设计的考试。这个区别很关键:CMMLU里有中国驾驶规则、中国公务员考试、中国饮食文化这些题目,你拿MMLU翻译过来是测不到这些东西的。
数据集覆盖67个学科,总共11,582道选择题。从小学常识到大学精算,从物理化学到国际法,从中医到马克思主义理论。每道题4个选项,只有一个正确答案。随机猜25%的准确率,所以任何模型只要低于25%就说明它在乱答。
团队来自MBZUAI(阿布扎比)、上海交通大学、微软亚洲研究院和墨尔本大学。论文2023年6月上线arXiv,数据集在HuggingFace上开源,已经集成到lm-evaluation-harness和OpenCompass两大评测框架里。2024年12月最后一次更新排行榜,目前最新模型在five-shot设置下平均分已经突破90分。
核心功能
67学科全覆盖
学科分为五大类:STEM(理工)、人文学科、社会科学、中国特定主题、其他。中国特定主题是CMMLU最独特的地方——中国历史、中国文学、中国驾驶规则、中国公务员考试、中国教师资格证、中国饮食文化。这些题目的答案在别的文化语境下可能不成立。
多难度分级
题目涵盖从 elementary(小学)到 college(大学及以上)三个难度层级。你可以看一个模型在高中物理上表现不错,但大学电磁学部分大幅下滑,这就提示它的知识结构停留在应试层面。
Zero-shot和Five-shot评测
支持两种评测模式。Zero-shot直接给题不给示例,Five-shot在题目前加5个示范问答。实践中很多模型在Five-shot设置下得分显著提升,但这不一定代表知识储备更强,可能只是上下文学习能力强。
数据污染检测
从2023年12月16日起,对未开放公测的API模型,团队会验证两件事:模型有没有基本的指令跟随能力,以及是否存在数据污染。通过验证的模型才会被更新到排行榜上。
跟主流评测框架集成
数据集已经接入EleutherAI的lm-evaluation-harness和上海AI Lab的OpenCompass。你不需要自己写评测代码,直接用这两个框架就能跑CMMLU评测。
适合谁
做中文大模型研发的团队。如果你训练了一个中文LLM,想知道它在知识理解和推理上到底什么水平,CMMLU是必跑的基准之一。高校实验室做学术对比、企业团队筛选产品级模型,都用得上。
如果你是应用层开发者,只是想选一个好用的中文API,CMMLU排行榜上的分数可以给你一个参考——但别只看总分。看分学科的分数,找到你应用场景对应的学科,那个分数更有参考价值。
同类竞品对比
| 对比维度 | CMMLU | C-Eval | MMLU | GAOKAO |
|---|---|---|---|---|
| 语言 | 中文原生 | 中文原生 | 英文 | 中文 |
| 学科数 | 67 | 56 | 57 | 考试科目 |
| 题目数 | 11,582 | 13,947 | 15,908 | ~2,000 |
| 中国特定主题 | 有(6个学科) | 无 | 无 | 有 |
| 难度分级 | 有 | 有 | 有 | 有 |
| 许可证 | CC BY-NC-SA 4.0 | CC BY-NC-SA 4.0 | MIT | 开源 |
CMMLU和C-Eval是目前中文评测的两大基准。我们测试下来,CMMLU的学科覆盖更广,中国特定主题的设置也更合理。C-Eval的优势在于题目总量更大,而且官方提供了更完善的评测脚本。两者搭配用效果最好。
FAQ
CMMLU和MMLU是什么关系? CMMLU的设计参考了MMLU,但不是简单翻译。67个学科中有大量中国特定的题目,MMLU里没有。反过来,MMLU的美国历史、美国法律这些题目在CMMLU里也没有。
怎么在CMMLU上跑我的模型? 最简单的方式是用OpenCompass或lm-evaluation-harness,两个框架都内置了CMMLU数据集和评测脚本。你也可以直接从GitHub仓库下载数据,用src目录里的代码自己跑。
排行榜上的分数怎么解读? 看两点:一是平均分,二是分学科分数。平均分告诉你模型的整体水平,分学科分数告诉你模型在哪里有短板。比如GPT-4在five-shot下平均70.95分,但STEM只有65.23分,说明它的理工科知识相对弱一些。
数据集会更新吗? 最后一次更新是2024年12月6日,添加了jiutian模型的分数。数据本身自2023年6月发布后没有大的变动,主要是排行榜持续更新。
能不能用CMMLU做商业化评测? 许可证是CC BY-NC-SA 4.0,非商业使用。商业场景下需要联系作者确认。
更新动态
客户评论
CMMLU作为学术基准,没有传统意义上的"客户评论"。以下整理了社区和学术界的反馈:
"CMMLU填补了中文大模型评测的空白,特别是中国特定主题的设计很巧妙。" — 搜索结果中的评测文章
"在CMMLU上测试中文模型表现,已经成为我们选型流程的标准步骤。" — 某企业AI团队(CSDN文章引用)
学术引用方面,截至搜索时间,CMMLU论文已被多篇后续工作引用,包括MMLU-Pro、MMLU-CF等基准的研究。
参考来源
- ▸GitHub | CMMLU---中文多任务语言理解评估,项目主页含排行榜和数据集
- ▸arXiv | CMMLU: Measuring massive multitask language understanding in Chinese,原始论文
- ▸HuggingFace | haonan-li/cmmlu,数据集下载
- ▸EvalScope | C-MMLU评测文档,第三方评测框架集成说明
