AI万址
SuperCLUE

SuperCLUE

SuperCLUE是专注中文通用大模型的独立第三方测评基准,动态题库防刷榜,覆盖推理、代码、Agent等六大任务,定期发布权威榜单和性价比分析报告,国内引用率最高之一。

SuperCLUE
访问官网
基本信息详情
开发公司CLUE 学术社区(独立第三方机构)
上线时间2019年(前身CLUE),SuperCLUE于2023年升级
官网https://www.cluebenchmarks.com/static/superclue.html
支持平台网页版 / 微信公众号
价格免费
核心定位中文通用大模型综合性测评基准

SuperCLUE 的前身是2019年发起的 CLUE(中文语言理解测评基准),那个年代 BERT 还是主流,CLUE 是中文 NLP 的标配。后来大模型来了,CLUE 的评测维度不够用了,2023年团队把它升级成了 SuperCLUE,定位从"测NLP模型"变成"测中文通用大模型"。

跟 OpenCompass 那种"开源工具链+固定数据集"的学术路线不同,SuperCLUE 更像一个独立第三方测评机构。它定期发报告,出榜单,搞分析。2025年7月的报告用了1288道新题,测六大任务:数学推理、科学推理、代码生成(含Web开发)、智能体Agent(多轮工具调用)、幻觉控制、精确指令遵循。最终取各任务平均分排名。

我们一直关注 SuperCLUE 的报告,核心价值有两点。第一,它的题目是动态更新的,每次评测用新题,防止模型"刷榜"(把数据集背下来)。第二,它同时测开闭源模型,而且会做国内外对比和性价比分析。2025年7月的报告里,o3 以73.78分拿总榜第一,国产豆包以68.04分排国内第一全球第四。国内开源模型 DeepSeek-R1 拿了开源榜首,比海外开源最好成绩高近20分。这种"谁比谁强多少"的对比信息,是国内选型最需要的。

核心功能

通用能力测评:四大能力象限--语言理解与生成、知识理解与应用、专业能力、环境适应与安全性。往下细化到10项基础能力:语义理解、闲聊、上下文对话、生成与创作、知识与百科、代码、逻辑与推理、计算、角色扮演、安全。每次测评出综合分和各能力分项。

动态题库机制:每次评测用新题,不公开题库。这直接堵死了"模型背数据集"的作弊路径。1288道题全是从未曝光的新题。

性价比分析:不只评能力,还算价格。按输入Token和输出Token 3:1的比例估算API整体价格,画出"能力-价格"性价比区间分布图。这帮企业看清"花这个钱值不值"。

专项基准矩阵:除了通用测评,还有 Agent 系列、多模态系列、文本系列、推理系列、性能系列专项基准。2025年新出了 SuperCLUE-SWE(软件工程)、SuperCLUE-CUA(Computer Use Agent)、SuperCLUE-OnDevice(手机端侧模型)。

SC成熟度指数:衡量国内大模型成熟度的综合指标,从多个维度给国产模型"体检",判断整体发展水平。

评测与人类一致性验证:SuperCLUE 会验证评测结果和人类判断的一致性,确保榜单排名经得起推敲。

适合谁

国产大模型开发团队:想知道自家模型在中文场景下排第几,跟 GPT-5 差多少分。SuperCLUE 是国内最权威的中文模型排名参考。

企业选型决策者:报告里的性价比分析直接告诉你"68分的模型花1/8的钱,75分的模型花8倍的钱,值不值"。这对预算敏感的团队特别实用。

行业分析师和媒体:SuperCLUE 每月的榜单和半年度报告是行业报道的标准数据源。引用它的数据写报告基本不会被质疑。

端侧设备厂商:SuperCLUE-OnDevice 专门测手机端侧大模型,对手机厂商选模型有直接参考价值。

同类竞品对比

维度SuperCLUEOpenCompassChatbot ArenaC-Eval
评测方式客观题+主观对战客观题自动化人类盲测投票客观题
中文专精核心优势
题库更新每月新题按版本实时固定
性价比分析有(核心特色)
开闭源对比
端侧评测有(OnDevice)

SuperCLUE 的护城河是"中文专精+动态题库+性价比分析"三件事一起做。OpenCompass 在工具链和学术严谨性上更强,但 SuperCLUE 在"给企业选型直接有用的信息"这件事上做得更接地气。

FAQ

A

SuperCLUE 跟 CLUE 是什么关系? SuperCLUE 是 CLUE 的升级版。CLUE 2019年发起,测的是传统NLP任务。大模型时代来了之后,升级成 SuperCLUE,扩展到测通用大模型的综合能力。

A

题库公开吗? 不公开。这是有意为之。公开题库等于公开答案,模型可以背题。每次评测用1288道新题,测的是模型的真实能力不是记忆力。

A

怎么看待国内外模型分数差距? 2025年7月数据显示,海外头部模型(o3的73.78分)比国内头部模型(豆包的68.04分)高约6分。推理任务差距更明显,接近10分。但国内开源模型碾压海外开源,DeepSeek-R1比海外开源最好成绩高近20分。

A

SuperCLUE 的排名权威吗? 它是独立第三方,不卖评测服务,不收钱排名。题目动态更新防作弊。还会做评测结果与人类一致性验证。在国内中文模型评测领域引用率最高之一。

A

支持自己提交模型评测吗? 可以。模型厂商提交模型,SuperCLUE 团队用标准流程评测出分。评测方法在报告里有公开说明。

更新动态

近半年 SuperCLUE 动作密集。9月手机端侧模型测评上线,10月出了软件工程基准和竞技场平台。竞技场的上线意味着它也开始引入人类投票数据,跟 Chatbot Arena 的路线开始交叉。半年度报告(2025年8月发布)是观察国内大模型发展的必读材料。

客户评论

汇总评分:暂无第三方平台评分(以行业引用率替代)

"每月等 SuperCLUE 出榜已经成了习惯。国内中文模型评测,它的报告最全、最新、最接地气。" - AI行业分析师

"性价比分析是我们选型的核心依据。光看能力分没用,还得看花多少钱。SuperCLUE 是唯一做这个的。" - 企业技术总监

"动态题库防作弊这点太重要了。固定数据集的榜单现在基本不可信,模型都能刷分。" - 大模型工程师

"端侧测评帮我们选手机端侧模型省了大量时间。以前没有专门的中文端侧基准,只能自己测。" - 手机厂商AI负责人

SuperCLUE 在国内大模型圈的认可度很高。它的半年度报告几乎是行业标配的引用源。争议点在于有人觉得它的题目偏难或偏某些领域,但总体上作为中文模型评测的独立第三方,公信力是站得住的。

参考来源