| 基本信息 | 详情 |
|---|---|
| 开发公司 | 香港科技大学 NLP 团队(Yuzhen Huang 等) |
| 上线时间 | 2023 年 5 月 |
| 官网 | https://cevalbenchmark.com/ |
| 支持平台 | Web / GitHub / HuggingFace |
| 价格 | 免费开源 |
| 核心定位 | 中文基础模型综合评测基准 |
C-Eval 是第一个面向中文的综合性大模型评测套件。它把高考、考研、职业资格这类中文考试题整理成 13,948 道多选题,覆盖 52 个学科,横跨人文、社科、理工和其他四个方向。说白了,它要回答的问题是:"这个模型在中文知识上,到底处在什么水平?"
难度分四级:初中、高中、大学、专业。其中 C-Eval Hard 是挑出来最难的子集,专门测高级推理,比如高等数学、概率统计、离散数学这些"硬骨头"。如果你只看平均分会高估模型,Hard 子集才是真正的分水岭。
2023 年发布后,C-Eval 迅速成了中文大模型圈的"高考"。2023 年 10 月被 NeurIPS 接收,学术地位坐实。2025 年 7 月 27 日,团队做了一个关键决定--把完整测试集公开到 HuggingFace,停止维护官方排行榜。理由很直接:保密测试集防泄漏的成本太高,不如放出来让大家自由评测。这其实标志着中文评测从"集中考试"走向"开放复现"。
核心功能
52 学科四难度覆盖
从语文、历史到高等数学、计算机网络,52 个学科的分布让模型无法靠某一类知识"偏科"蒙混过关。四级难度让评测能区分"会背"和"真懂"。
C-Eval Hard 子集
把概率统计、离散数学、大学物理等最难的科目单独切出来。这个子集的分数通常比平均分低 10–20 分,是区分顶级模型的关键。
Zero-shot / Few-shot 双设定
官方同时给出 zero-shot 和 five-shot 结果。有意思的是,对很多指令微调模型,zero-shot 反而比 few-shot 更好--多给几个例子反而把模型带偏。
接入 lm-evaluation-harness
C-Eval 已被纳入 EleutherAI 的 lm-evaluation-harness 框架,意味着你可以用统一的工具链跑 MMLU、C-Eval、CMMLU 等多个基准,不用自己写评测脚本。
适合谁
发布新模型前必须在 C-Eval 上跑一遍,这是中文圈的"入场券"。
对比不同厂商的中文能力时,C-Eval 平均分和 Hard 分是参考锚点。
研究中文知识、推理、对齐的,C-Eval 提供了标准化的题源和 baselines。
把它当作中文知识底座的回归测试,看微调后有没有把通识知识"练崩"。
同类竞品对比
| 基准 | 语言 | 题量 | 难度分级 | 特色 |
|---|---|---|---|---|
| C-Eval | 中文 | 13,948 | 四级 + Hard | 学科最全,NeurIPS 2023 |
| CMMLU | 中文 | ~11,528 | 无分级 | 覆盖广,偏常识与考试 |
| MMLU | 英文 | ~14,042 | 无分级 | 全球通用基准 |
| GAOKAO-Bench | 中文 | 高考真题 | 高考 | 真题,时效性强 |
| SuperCLUE | 中文 | 综合任务 | - | 含开放任务,不只选择题 |
C-Eval 和 CMMLU 是中文圈最常被一起引用的一对。C-Eval 的优势是难度分级和 Hard 子集,CMMLU 的优势是题源更杂更接地气。如果你只选一个中文基准,C-Eval 的学术认可度更高。
FAQ
Q1:C-Eval 现在还能提交模型上榜吗? 不能了。2025 年 7 月 26 日官方宣布停止维护排行榜,测试集已公开到 HuggingFace,大家自行本地评测即可。
Q2:C-Eval 和 CMMLU 有什么区别? C-Eval 有明确的四级难度和 Hard 子集,学术上是 NeurIPS 论文;CMMLU 题源更杂、覆盖更广,但没有难度分级。两者互补,很多人一起跑。
Q3:现在榜首是多少分? 官方停止维护前的公开访问模型榜首是讯飞 Spark4.0 Max 的 91.8。第三方聚合榜单上 Qwen3.6 Plus 到了 93.3%。不同榜单口径不同,别直接比。
Q4:C-Eval Hard 为什么这么难? Hard 子集挑的是需要长链推理的科目,比如概率统计、离散数学。很多模型平均分 80+ 但 Hard 只有 60 多,差距就是推理能力。
Q5:可以用 C-Eval 测英文模型吗? 可以测,但题目是中文,英文模型会被语言门槛拖累。要测纯知识能力,建议同时跑 MMLU 对照。
Q6:测试集公开后,分数还能信吗? 公开后存在被"刷榜"污染的风险。建议把 C-Eval 当回归测试,同时准备私有 holdout 集做交叉验证。
更新动态
C-Eval 自 2023 年 5 月发布,节奏很快。2023 年 10 月 NeurIPS 接收,2023 年底接入 lm-evaluation-harness,2024–2025 年持续有国产模型提交。2025 年 7 月是关键转折--测试集全公开,官方排行榜停更,重心交给社区。
客户评论
C-Eval 是学术基准,没有用户评分。社区反馈集中在论文引用和榜单使用:
- HKUST 团队(官方):在 GitHub README 中明确说明 zero-shot 对指令微调模型经常优于 five-shot,这是反直觉但被反复验证的结论。
- DataLearner 聚合榜:把 C-Eval 列为"综合评估"类目,Qwen3-Max-Thinking 以 93.70 居首,反映中文头部模型已进入 90+ 区间。
- BenchLM:标注 C-Eval 的 staleness 状态为"Stale",理由是题源静态、可能已被部分模型见过训练数据,建议作为参考而非唯一判据。
参考来源
- ▸C-Eval 官网 | 排行榜,官方榜单与公开测试集说明
- ▸GitHub | hkust-nlp/ceval,代码与数据仓库
- ▸arXiv | C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models,NeurIPS 2023 论文
- ▸HuggingFace | ceval/ceval-exam,公开测试集下载
- ▸DataLearner | C-Eval 排名,第三方聚合榜
- ▸BenchLM | C-Eval,基准新鲜度与元数据
