AI万址
OpenCompass

OpenCompass

OpenCompass司南由上海AI实验室打造,100+数据集覆盖12个能力维度,是大模型评测的全链路开源工具。Meta官方推荐用于Llama模型标准测试,GitHub Star过万。

OpenCompass
访问官网
基本信息详情
开发公司上海人工智能实验室(Shanghai AI Lab)
上线时间2023年8月开源
官网https://opencompass.org.cn/leaderboard-llm
支持平台网页版 / 开发者API / 本地部署
价格开源免费
核心定位面向大语言模型与多模态模型的一站式评测体系

OpenCompass 司南是上海人工智能实验室搞出来的大模型评测体系。说"体系"不是客套--它确实不只是个榜单,而是三件套:CompassKit 是评测工具链,CompassHub 是数据集社区,CompassRank 是排行榜。这三块拼在一起,从跑评测到出排名一条龙全包了。

跟 Chatbot Arena 那种"靠人投票"的路子不同,OpenCompass 走的是客观题自动化评测。它内置了100多个数据集,覆盖语言、知识、理解、数学、代码、长文本、智能体等12个一级能力维度,往下还细分了50多个二级维度。零样本、少样本、思维链评测都支持。GitHub 上 Star 过万,Meta 官方推荐它做 Llama 的标准测试工具。

我们团队跑过几次本地评测。千亿参数模型用分布式策略,最快3小时能跑完一轮。但说实话,门槛不低--你得懂 Python、会写 YAML 配置、理解评测指标,还得有 GPU。平台本身免费,算力得自己掏。所以它更像给研究者和企业团队用的工具,不是普通用户随便点两下就能出结果的东西。

核心功能

CompassKit 工具链:包含四个工具。OpenCompass 负责大语言模型评测,VLMEvalKit 负责多模态模型评测,Code-Evaluator 做代码能力评测,MixtralKit 给 MoE 模型入门用。一条命令 pip install opencompass 就能装上。

CompassHub 数据集社区:基准测试的导航平台。你可以上传自己的评测数据集,也可以搜别人贡献的。官方欢迎社区共建,数据集会定期扩充。

CompassRank 排行榜:承载各类榜单的中立平台。不收钱、不受商业干扰,定期更新。覆盖多领域多任务,还附专业解读帮你看懂分数背后的含义。

六位一体评估:大语言模型、多模态模型、具身智能、安全可信、科学智能、AI计算系统。这是 OpenCompass 2.0 提出的全景评估范式,从模型本身延伸到底层算力。

司南 Arena 对战:除了客观题,还搞了个匿名双盲对战平台。两个模型同时回答,用户投票选更好的。中文主观题、文化题、时政题比重很大,弥补英文 benchmark 的盲区。

适合谁

AI 算法研究员:发论文要引用第三方评测数据,OpenCompass 的开源框架和公开榜单都能直接用。

大模型开发团队:新版上线前先跑一轮70+数据集全维度自测,发现短板再迭代。有个团队靠这个发现数学推理弱,针对性优化训练数据后排名涨了5位。

企业技术决策者:选型时拿来横向对比模型能力。比厂商自吹的跑分靠谱,因为 CompassRank 不受商业利益干扰。

VC 投资分析师:做AI初创公司尽调时,要求对方模型上司南跑一轮,用第三方数据验证技术实力。

同类竞品对比

维度OpenCompassChatbot ArenaHugging Face LeaderboardHELM
评测方式客观题自动化人类盲测投票自动化基准自动化基准
数据集数量100+无固定数据集10+16+
中文优化原生中文偏英文
开源可复现完全开源数据公开开源开源
多模态支持
使用门槛

OpenCompass 的优势在中文和全栈。它的劣势是上手门槛高,你得有算力、有技术背景。如果你只是想快速对比几个模型谁更聪明,Arena 更合适。但要做严肃的技术评测和论文引用,OpenCompass 的可复现性是硬通货。

FAQ

A

OpenCompass 免费吗? 框架完全开源免费。但大规模评测需要 GPU 服务器,这是你的成本。没有平台使用费。

A

非技术人员能用吗? 看榜单可以,直接访问 rank.opencompass.org.cn 就行。但跑评测需要 Python 和机器学习基础。

A

它跟 MMBench 什么关系? MMBench 是 OpenCompass 团队自建的多模态评测数据集,是 OpenCompass 生态的一部分。你可以理解为 OpenCompass 是工具箱,MMBench 是里面的一个专用量尺。

A

评测结果可信吗? CompassRank 声明不受商业利益干扰,保持中立。工具链完全开源,别人可以复现你的结果。学术引用量也说明问题。

A

支持本地模型评测吗? 支持。HuggingFace 上的开源模型和 API 商业模型(GPT-4、Claude、Qwen 等)都能接。

更新动态

近半年最大的动作是司南 Arena 的上线。这意味着 OpenCompass 不再只靠客观题,开始引入人类主观投票数据。两种评测方式互补,客观题测"能不能答对",Arena 测"答得好不好看"。

客户评论

汇总评分:5.0/5(来源:AI工具库,39人评价)

"背靠上海AI实验室,公信力不用多说。我们实验室引用它家的数据,审稿人从没质疑过。" - 高校研究员

"工具链功能很全,但学习曲线陡。第一次配环境花了一下午。" - 大模型工程师

"中文模型评测的首选。MMLU那些英文benchmark对国产模型不公平,司南的中文题库更对路。" - 企业技术总监

开源社区里,对 OpenCompass 的评价普遍正面。争议点主要在"上手门槛太高"和"评测周期长"这两件事上。跑一轮全量评测动辄几小时甚至几天,急性子的人确实坐不住。

参考来源