
| 基本信息 | 详情 |
|---|---|
| 开发团队 | 北京智源人工智能研究院(BAAI) |
| 上线时间 | 2023年 |
| 官网 | https://flageval.baai.ac.cn/#/trending |
| 支持平台 | Web平台 / GitHub开源 |
| 价格 | 免费(Apache-2.0许可) |
| 核心定位 | 全维度大模型评测平台,覆盖800+模型、40+能力维度 |
FlagEval(天秤)是智源研究院2023年推出的评测体系。智源在北京AI圈的地位比较特殊——它不是商业公司,是新型研发机构,做的东西偏向基础设施。FlagEval就是这种定位:不卖模型,不卖API,给你一套公平的尺子去量所有模型。
目前已收录超过800个开源和闭源模型,覆盖40多个能力维度,包含5大评测任务和4类评测指标。评测领域涵盖NLP、计算机视觉、音频和多模态。在中文模型评测这个领域,FlagEval和CMMLU、C-Eval是最常被提到的三个基准。
FlagEval最值得关注的设计决策是评测方式。它用的是"自由生成式"评测,而不是"选项概率式"。什么意思?别的评测是让模型算各选项的概率选最高的,FlagEval是让模型真正生成答案。这意味着如果模型指令跟随能力差——比如让它回答"A"但它回答"答案是A"——会被判零分。这种方式更贴近真实使用场景,但也会让一些模型分数偏低。FlagEval团队的做法是:如果模型因为格式问题得分很低,会先反馈给研发团队,在月度榜单中暂缓展示排名。
核心功能
自由生成式评测
严格按模型自由生成的答案评判,不做概率计算。源自斯坦福HELM的方法论,对模型的指令跟随能力要求更高。这种方式更符合实际使用场景——用户不会去算你每个选项的概率。
多维度能力评估
40多个能力维度覆盖推理、数学、代码生成、任务解决等。除了客观评测(选择题),FlagEval还集成了主观评测数据集CLCC(Chinese Linguistics & Cognition Challenge),以及与北大等机构共建的词汇语义关系、修辞手法判断等数据集。
FlagEval-Arena对比平台
2025年ACL发表的工作。对标LMSYS Chatbot Arena,但更专注于中文场景和中国机构开发的模型。支持语言模型、视觉语言模型、文生图、文生视频的side-by-side对比。和LMSYS的结果有一些有意思的差异。
FlagEvalMM多模态框架
2025年6月发布。把模型推理和评测过程解耦——推理环境和评测服务分开跑,通过轻量协议通信。支持vLLM和SGLang加速,异步数据加载。架构上比Lmms-Eval和VLMEvalKit更灵活。
全景能力扫描报告
智源定期发布《AI大模型能力全景扫描》报告,目前已出两期。报告提供跨任务、跨模型的深度分析,帮你理解主流AI模型的强弱项。
适合谁
做中文大模型研发的团队。FlagEval的评测方式更严格(自由生成式),如果你的模型在这个榜单上分数不错,说明指令跟随能力是过关的。反过来如果分数低,可能是格式问题而不是能力问题。
做模型选型的企业技术团队。FlagEval-Arena的中文场景对比比LMSYS Arena更有参考价值,特别是如果你要选的是国产模型。
做多模态研究的研究者。FlagEvalMM的开源框架和FlagEval-Arena的文生图/文生视频评测能力是目前少见的全模态覆盖。
同类竞品对比
| 对比维度 | FlagEval | HELM | OpenCompass | LMSYS Arena |
|---|---|---|---|---|
| 开发方 | 智源研究院 | 斯坦福CRFM | 上海AI Lab | LMSYS |
| 评测方式 | 自由生成式 | 标准化prompt | 多种方式 | 人工投票 |
| 中文专注度 | 高 | 中 | 高 | 低 |
| 模型覆盖 | 800+ | ~100+ | 500+ | ~200+ |
| 多模态 | 文本+视觉+音频 | 文本+视觉+音频 | 文本+视觉 | 文本+视觉 |
| 维护状态 | 活跃 | 维护模式 | 活跃 | 活跃 |
FlagEval在中文场景的深度和模型覆盖面上有优势。HELM的学术影响力更强但已进入维护模式。OpenCompass和FlagEval定位接近,建议两个都跑。
FAQ
FlagEval的"自由生成式"评测和别的评测有什么区别? 别的评测(如MMLU的选项概率式)让模型计算每个选项的概率,选概率最高的。FlagEval让模型直接生成答案文本。好处是更贴近真实使用,坏处是模型如果格式不对就判零分——比如让它回答"A"但它说"答案是A"。
FlagEval-Arena和LMSYS Chatbot Arena有什么不同? FlagEval-Arena更专注中文场景和中国模型,而且支持文生图和文生视频的对比。LMSYS Arena更国际化,模型覆盖更广。两者结果有一些差异,FlagEval团队认为这是因为中国用户的使用习惯和偏好不同。
怎么在FlagEval上评测我的模型? 开源模型可以直接在GitHub仓库的代码里配置运行。闭源模型需要联系FlagEval团队提交API接口。评测结果会经过验证后更新到排行榜。
FlagEval的数据集开源吗? 核心评测框架和部分数据集在GitHub上开源(Apache-2.0)。一些主观评测数据集和特殊数据集可能有不同的许可协议。
FlagEval覆盖哪些评测任务? 当前包含6大评测任务、近30个评测数据集、超10万道评测题目。包括HellaSwag、MMLU、C-Eval等公开数据集,以及CLCC等自建数据集。多模态评测通过FlagEvalMM支持。
更新动态
客户评论
FlagEval作为学术评测平台,没有传统商业产品的用户评分。以下是社区和学术界的反馈:
"FlagEval的自由生成式评测方式确实更严格,但也更真实。我们模型在上面跑出来的分数比MMLU低不少,后来发现是指令跟随的问题。" — 搜索结果中的开发者反馈
"智源的全景扫描报告是目前中文模型能力分析最全面的公开资料之一,每期都会仔细看。" — AI从业者社区讨论
FlagEval-Arena论文被ACL 2025收录(System Demonstrations方向),FlagEvalMM论文在arXiv发布。FlagEval开源生态下的HalluDial、CMMU、SeniorTalk等子项目也分别发表在相关学术会议上。
参考来源
- ▸FlagEval官网 | 天秤评测平台,排行榜与评测工具
- ▸GitHub | flageval-baai/FlagEval,开源评测框架
- ▸GitHub | FlagOpen/FlagEval,项目总览含全景报告
- ▸arXiv | FlagEvalMM: Flexible Framework for Multimodal Evaluation,多模态评测框架论文
- ▸ACL Anthology | FlagEval-Arena,ACL 2025对比评测平台论文
