AI万址

C-Eval

C-Eval 是香港科技大学发布的中文大模型综合评测基准,覆盖 52 学科 13,948 道多选题,含 C-Eval Hard 难度子集,NeurIPS 2023 接收。

C-Eval
访问官网
基本信息详情
开发公司香港科技大学 NLP 团队(Yuzhen Huang 等)
上线时间2023 年 5 月
官网https://cevalbenchmark.com/
支持平台Web / GitHub / HuggingFace
价格免费开源
核心定位中文基础模型综合评测基准

C-Eval 是第一个面向中文的综合性大模型评测套件。它把高考、考研、职业资格这类中文考试题整理成 13,948 道多选题,覆盖 52 个学科,横跨人文、社科、理工和其他四个方向。说白了,它要回答的问题是:"这个模型在中文知识上,到底处在什么水平?"

难度分四级:初中、高中、大学、专业。其中 C-Eval Hard 是挑出来最难的子集,专门测高级推理,比如高等数学、概率统计、离散数学这些"硬骨头"。如果你只看平均分会高估模型,Hard 子集才是真正的分水岭。

2023 年发布后,C-Eval 迅速成了中文大模型圈的"高考"。2023 年 10 月被 NeurIPS 接收,学术地位坐实。2025 年 7 月 27 日,团队做了一个关键决定--把完整测试集公开到 HuggingFace,停止维护官方排行榜。理由很直接:保密测试集防泄漏的成本太高,不如放出来让大家自由评测。这其实标志着中文评测从"集中考试"走向"开放复现"。

核心功能

01

52 学科四难度覆盖

从语文、历史到高等数学、计算机网络,52 个学科的分布让模型无法靠某一类知识"偏科"蒙混过关。四级难度让评测能区分"会背"和"真懂"。

02

C-Eval Hard 子集

把概率统计、离散数学、大学物理等最难的科目单独切出来。这个子集的分数通常比平均分低 10–20 分,是区分顶级模型的关键。

03

Zero-shot / Few-shot 双设定

官方同时给出 zero-shot 和 five-shot 结果。有意思的是,对很多指令微调模型,zero-shot 反而比 few-shot 更好--多给几个例子反而把模型带偏。

04

接入 lm-evaluation-harness

C-Eval 已被纳入 EleutherAI 的 lm-evaluation-harness 框架,意味着你可以用统一的工具链跑 MMLU、C-Eval、CMMLU 等多个基准,不用自己写评测脚本。

适合谁

中文大模型开发者

发布新模型前必须在 C-Eval 上跑一遍,这是中文圈的"入场券"。

模型采购方

对比不同厂商的中文能力时,C-Eval 平均分和 Hard 分是参考锚点。

学术研究者

研究中文知识、推理、对齐的,C-Eval 提供了标准化的题源和 baselines。

企业 RAG / Agent 团队

把它当作中文知识底座的回归测试,看微调后有没有把通识知识"练崩"。

同类竞品对比

基准语言题量难度分级特色
C-Eval中文13,948四级 + Hard学科最全,NeurIPS 2023
CMMLU中文~11,528无分级覆盖广,偏常识与考试
MMLU英文~14,042无分级全球通用基准
GAOKAO-Bench中文高考真题高考真题,时效性强
SuperCLUE中文综合任务-含开放任务,不只选择题

C-Eval 和 CMMLU 是中文圈最常被一起引用的一对。C-Eval 的优势是难度分级和 Hard 子集,CMMLU 的优势是题源更杂更接地气。如果你只选一个中文基准,C-Eval 的学术认可度更高。

FAQ

A

Q1:C-Eval 现在还能提交模型上榜吗? 不能了。2025 年 7 月 26 日官方宣布停止维护排行榜,测试集已公开到 HuggingFace,大家自行本地评测即可。

A

Q2:C-Eval 和 CMMLU 有什么区别? C-Eval 有明确的四级难度和 Hard 子集,学术上是 NeurIPS 论文;CMMLU 题源更杂、覆盖更广,但没有难度分级。两者互补,很多人一起跑。

A

Q3:现在榜首是多少分? 官方停止维护前的公开访问模型榜首是讯飞 Spark4.0 Max 的 91.8。第三方聚合榜单上 Qwen3.6 Plus 到了 93.3%。不同榜单口径不同,别直接比。

A

Q4:C-Eval Hard 为什么这么难? Hard 子集挑的是需要长链推理的科目,比如概率统计、离散数学。很多模型平均分 80+ 但 Hard 只有 60 多,差距就是推理能力。

A

Q5:可以用 C-Eval 测英文模型吗? 可以测,但题目是中文,英文模型会被语言门槛拖累。要测纯知识能力,建议同时跑 MMLU 对照。

A

Q6:测试集公开后,分数还能信吗? 公开后存在被"刷榜"污染的风险。建议把 C-Eval 当回归测试,同时准备私有 holdout 集做交叉验证。

更新动态

C-Eval 自 2023 年 5 月发布,节奏很快。2023 年 10 月 NeurIPS 接收,2023 年底接入 lm-evaluation-harness,2024–2025 年持续有国产模型提交。2025 年 7 月是关键转折--测试集全公开,官方排行榜停更,重心交给社区。

客户评论

C-Eval 是学术基准,没有用户评分。社区反馈集中在论文引用和榜单使用:

  • HKUST 团队(官方):在 GitHub README 中明确说明 zero-shot 对指令微调模型经常优于 five-shot,这是反直觉但被反复验证的结论。
  • DataLearner 聚合榜:把 C-Eval 列为"综合评估"类目,Qwen3-Max-Thinking 以 93.70 居首,反映中文头部模型已进入 90+ 区间。
  • BenchLM:标注 C-Eval 的 staleness 状态为"Stale",理由是题源静态、可能已被部分模型见过训练数据,建议作为参考而非唯一判据。

参考来源