AI万址

AI模型评测

提供 24 款 AI 大模型评测工具与基准对比,含书生、百川、CMMLU、HELM、MMLU 等评测体系,对比模型能力与开源情况 - AI万址

14 个结果

书生大模型

书生大模型

书生大模型是上海AI实验室开源模型体系,InternLM3用4T数据达到18T效果,Intern-S1科学多模态能力全球开源第一,超越Grok-4,数学奥赛102分夺冠。

02026-08-12 23:52:13
百川大模型

百川大模型

百川大模型是百川智能推出的以医疗AI为核心的大模型系列,旗下百小医AI家庭医生帮你梳理症状、解读医嘱。Baichuan-M3达2350亿参数,医疗M3 Plus API永久免费。

02026-08-12 23:52:13
CMMLU

CMMLU

CMMLU是专门评估中文语言模型知识和推理能力的基准,覆盖67个学科11,582道题,含中国特定主题,支持zero-shot和five-shot评测。

02026-08-12 23:52:13
HELM

HELM

HELM是斯坦福CRFM开发的开源大模型评估框架,支持准确率、偏见、安全性等多维度评测,已覆盖文本、视觉、音频等模态。

02026-08-12 23:52:13
MMLU

MMLU

MMLU由Dan Hendrycks提出,覆盖57个学科15,908道选择题,是大模型评测黄金标准。GPT-4o得分87.4%,已面临性能饱和问题。

02026-08-12 23:52:13
FlagEval

FlagEval

FlagEval是智源研究院推出的大模型评测系统,覆盖800+模型40+能力维度,采用自由生成式评测方法,专注中文模型评估。

02026-08-12 23:52:13

Chatbot Arena

Chatbot Arena(现更名为Arena)是全球被引用最多的大模型评测平台,累计700万张人类盲测选票、368个模型上榜。用Elo评分客观对比GPT、Claude、Gemini等主流模型,完全免费使用。

02026-08-12 23:51:29
OpenCompass

OpenCompass

OpenCompass司南由上海AI实验室打造,100+数据集覆盖12个能力维度,是大模型评测的全链路开源工具。Meta官方推荐用于Llama模型标准测试,GitHub Star过万。

02026-08-12 23:52:13
MMBench

MMBench

MMBench由OpenCompass团队推出,约3000道题覆盖20个细粒度能力维度,采用CircularEval循环评测确保多模态模型评测结果稳定可复现,中英双语原生支持。

02026-08-12 23:52:13

AGI-Eval

AGI-Eval以高考、SAT、LSAT等人类标准化考试评测大模型,首创人机竞赛模式构建人类基准线,提供模型榜单、开源评测框架和数据共建社区,2万+用户参与。

02026-08-12 23:51:29
SuperCLUE

SuperCLUE

SuperCLUE是专注中文通用大模型的独立第三方测评基准,动态题库防刷榜,覆盖推理、代码、Agent等六大任务,定期发布权威榜单和性价比分析报告,国内引用率最高之一。

02026-08-12 23:52:13

PubMedQA

PubMedQA 是基于 PubMed 摘要的生物医学研究问答数据集,提供 1k 专家标注与 211k 生成实例,是评测 LLM 医学推理能力的权威基准。

02026-08-12 23:51:29

C-Eval

C-Eval 是香港科技大学发布的中文大模型综合评测基准,覆盖 52 学科 13,948 道多选题,含 C-Eval Hard 难度子集,NeurIPS 2023 接收。

02026-08-12 23:51:29
H2O EvalGPT

H2O EvalGPT

H2O EvalGPT 是 H2O.ai 开源的 LLM 评测平台,用 Elo 评分和 GPT-4 裁判的 A/B 对决方式排名大模型,聚焦金融法律等行业场景。

02026-08-12 23:52:13