
| 基本信息 | 详情 |
|---|---|
| 开发公司 | OpenCompass 团队(上海人工智能实验室) |
| 上线时间 | 2023年8月(论文发表于2023年7月) |
| 官网 | https://mmbench.opencompass.org.cn/leaderboard |
| 支持平台 | 网页版 / VLMEvalKit 本地工具包 |
| 价格 | 开源免费 |
| 核心定位 | 多模态视觉语言模型的细粒度能力评测基准 |
MMBench 是 OpenCompass 团队自己建的多模态评测数据集。起因很简单:2023年多模态模型井喷,但怎么评一个多模态模型到底行不行,当时没有靠谱的答案。要么题目太少没法覆盖全面,要么靠人肉看几条demo主观判断,没法复现。MMBench 就是为了堵这个口子。
团队从互联网公开信息和权威基准里采集了约3000道单项选择题,按"自上而下"的三级能力维度(L1-L3)组织。第一级分感知和推理两项。第二级往下展开6项。第三级再细到20个维度,包括目标检测、文字识别、动作识别、图像理解、关系推理、空间感知等。每道题都带图,都是单选,只有一个正确答案。
跟其他多模态 benchmark 相比,MMBench 有两个设计比较聪明。一是 CircularEval 循环评测:把选择题的选项打乱顺序反复问,如果模型真懂了,怎么打乱答案都一样。如果它靠位置猜,一打乱就露馅。二是用 ChatGPT 做答案匹配:模型有时候不按格式输出,传统正则匹配会误判,ChatGPT 能把自由文本映射到最接近的选项上。
核心功能
三级能力维度:L1 分感知与推理。L2 在此基础上展开到6项能力(如粗粒度感知、细粒度感知、属性推理、关系推理等)。L3 最终细到20个评估维度。这种结构让你能定位模型到底是哪个环节弱。
CircularEval 循环评测:对N个选项的题目,循环N轮每轮打乱选项顺序。模型要全答对才算通过这一题。这把随机猜对的概率从1/N压到了1/N!,有效剔除噪声。
中英双语版本:MMBench 有 Dev 和 Test 两个 split,每个都提供英文和中文版本。中文版不是机翻,是人工翻译并校准过的。另外还有 CCBench,510道中国文化相关题目,专门测模型对中国文化的理解。
VLMEvalKit 工具包:官方评测框架,支持一键启动70+基准测试。集成了主流多模态模型的推理接口,跑完直接出分数和排名。
在线排行榜:官网实时展示各视觉语言模型在 MMBench 上的表现,支持按数据集、按语言、按能力维度筛选对比。
适合谁
多模态模型开发者:训练了新的 VLM(视觉语言模型),要验证它在感知和推理上到底什么水平。MMBench 的20个维度能帮你精确定位短板。
学术研究者:发论文需要可复现的 benchmark。MMBench 数据集公开,评测代码开源,别人能复现你的结果。
企业选型团队:业务涉及图文理解(比如医疗影像分析、工业质检),需要横向对比哪个多模态模型在特定能力上更强。
同类竞品对比
| 维度 | MMBench | SEED-Bench | GQA | MMMU |
|---|---|---|---|---|
| 题目数量 | ~3000 | 19000+ | 2200万+ | 11500 |
| 能力维度 | 20个细粒度维度 | 6个维度 | 1个(场景图推理) | 30个学科 |
| 循环评测 | 有(CircularEval) | 无 | 无 | 无 |
| 中文支持 | 有(原生中文版) | 弱 | 无 | 有 |
| 评测方式 | 单选题+ChatGPT匹配 | 单选题 | 结构化问答 | 单选题 |
MMBench 的优势在"细"和"稳"。20个维度比竞品颗粒度更细,CircularEval 比一次性评测更稳。劣势是题量只有3000道,覆盖面不如 SEED-Bench 的19000道。但对于"精确定位模型哪个能力弱"这个需求,MMBench 是更趁手的工具。
FAQ
MMBench 是免费的吗? 完全免费。数据集和评测代码都在 GitHub 开源,官网排行榜也免费查看。
怎么提交模型评测结果? 用 VLMEvalKit 本地跑评测,跑完结果可以提交到官网排行榜。也支持提交模型到平台由官方评测。
CircularEval 是什么意思? 一道4选1的题,打乱选项顺序问4遍。4遍全答对才算对。这样模型就不能靠猜选项位置蒙混过关。
MMBench 和 OpenCompass 是什么关系? MMBench 是 OpenCompass 团队自建的数据集,属于 OpenCompass 生态的一部分。你可以用 OpenCompass 框架跑 MMBench,也可以单独用 VLMEvalKit 跑。
支持视频理解评测吗? MMBench 主要面向图文任务。视频时序理解有专门的分项,但核心数据集以静态图像为主。
更新动态
MMBench 更新不算频繁,数据集本身比较稳定。但它的评测框架 VLMEvalKit 一直在迭代,支持的新模型和数据集持续增加。近半年最值得关注的是它在开源社区里的引用量持续走高,已经成了多模态评测的事实标准之一。
客户评论
汇总评分:暂无第三方平台评分(学术工具,以引用量替代)
"CircularEval 这个设计太聪明了,我们之前评测VLM经常被随机性困扰,加了循环评测后结果稳定多了。" - 多模态研究员
"20个维度的细分对我们定位模型短板帮助很大。之前只知道模型'看图不行',现在能精确到是OCR不行还是空间关系推理不行。" - VLM开发工程师
"中英双语版本是加分项。很多benchmark只有英文,对中文多模态模型不公平。" - 高校博士生
作为学术 benchmark,MMBench 没有商业评分平台。但它在论文里的被引量和 GitHub 的 Star 数说明问题。学术界对它的认可度很高。
参考来源
- ▸GitHub | open-compass/MMBench - 官方代码仓库,含数据集下载和评测工具
- ▸arXiv | MMBench: Is Your Multi-modal Model an All-around Player? - MMBench 技术论文
- ▸CSDN | OpenCompass 官方博客:多模态评测神器MMBench - 官方团队发布的功能详解
- ▸VLMEvalKit | GitHub - 官方评测框架,支持MMBench及70+多模态基准
