| 基本信息 | 详情 |
|---|---|
| 开发公司 | 微软研究院发起,现由上海交通大学等高校联合运营 |
| 上线时间 | 2023年(原始AGIEval),2024年平台化运营 |
| 官网 | https://agi-eval.cn/mvp/home |
| 支持平台 | 网页版 / 开源框架(GitHub) |
| 价格 | 免费,开源 |
| 核心定位 | 以人类标准化考试为基准的大模型评测社区 |
AGI-Eval 最早是微软研究院2023年推出的评测集,叫 AGIEval。思路很直接:拿人类的高难度标准化考试题来考大模型。中国高考、美国SAT、法学院入学LSAT、研究生GRE和GMAT,这些题本来就是筛选人类智力精英的,拿它们测AI正好。原始数据集有8062道真实考题,覆盖20项子任务。
后来这个项目从微软独立出来,变成了 agi-eval.cn 这个评测社区平台。现在它不只是跑考试题了,而是发展成了四大板块:模型榜单、评测数据集、人机竞赛、数据工作室。2025年11月,团队把评测框架也开源了,采用插件化架构,支持按需拼装。合作的机构包括美团、同济大学、上海交通大学、华东师范大学和Datawhale,社区用户超过2万人。
AGI-Eval 跟其他评测平台最大的区别,是它的"人机协同"理念。它不只让机器做题,还搞人机竞赛--让人和模型做同样的题,对比谁做得好。这个设计挺聪明的:传统 benchmark 只有模型之间比,你不知道60分到底算高还是低。有了人类做参照系,分数的意义就清楚了。截至2026年8月,榜单上 GPT-5.5 以0.8614的得分领跑,Gemini-3.1-Pro-Preview 紧随其后。
核心功能
模型榜单:大语言模型和多模态模型两套榜单。涵盖综合评测和各能力项评测,定期更新。当前文本榜首是 GPT-5.5,国产模型里豆包和千问排名靠前。
评测数据集生态:平台官方自建+用户自建双轨。官方数据集如 OI Bench(信息学竞赛题,由高校合作建设)、Math Pro Bench(高中数学竞赛和考研题)等。用户也可以贡献专业领域数据,500+任务标签覆盖多领域。
人机竞赛:人和模型做同一套题,构建人类基准线作为参照。这让评测分数有了"人类锚点",不再是模型之间空对空地比。
开源评测框架:插件化架构,支持单机、本地调试、多进程并行。从数据处理到指标计算,每一步都可以做成插件随时插拔,不用改主框架。已适配20+公开数据集(AIME2024、AIME2025、GPQA等)。
AGI-Eval-OA-Judge:团队专门微调的打分模型,用于唯一答案类数据集的自动评分。已开源到 HuggingFace,方便复现打分结果。
Data Studio:让个人贡献专业领域数据的工具。支持单条数据、扩写数据、Arena 对战数据等多种收集方式。机审+人审多重审核保证质量。
适合谁
AI 研究者:需要用人类标准化考试的视角检验模型的推理和知识能力。AGI-Eval 的高考、SAT、LSAT 数据集提供了一种"拿人类精英的考试题考AI"的独特视角。
企业技术决策者:榜单按能力项拆分,能看出不同模型在逻辑推理、数学计算、阅读理解上的强弱分布。选型时比看总分更实用。
数据贡献者:在某个垂直领域有专业知识的人,可以通过 Data Studio 贡献评测数据,参与共建评测标准。高校研究者特别适合。
视频生成模型开发者:AGI-Eval 团队做过年度AI视频生成横评,用上百条评测数据+专家级人工团队评Sora、可灵等模型。这块评测服务其他平台不太覆盖。
同类竞品对比
| 维度 | AGI-Eval | Chatbot Arena | OpenCompass | C-Eval |
|---|---|---|---|---|
| 评测方式 | 考试题+人机竞赛 | 人类盲测投票 | 客观题自动化 | 客观题自动化 |
| 数据来源 | 人类标准化考试 | 用户实时提问 | 100+数据集 | 中国学科考试 |
| 人机对比 | 有(核心特色) | 无 | 无 | 无 |
| 开源框架 | 有(插件化) | 无 | 有 | 有 |
| 多模态支持 | 有(视频横评等) | 有 | 有 | 弱 |
| 社区生态 | 2万+用户,数据共建 | 700万+投票者 | GitHub 1万Star | 学术为主 |
AGI-Eval 的差异化在"人机协同"和"考试题视角"。它不追求覆盖面最广(那是 OpenCompass 的强项),而是在"怎么定义模型到底像不像人"这件事上做深。人机竞赛这个设计是其他平台没有的。
FAQ
AGI-Eval 是微软的产品吗? 原始 AGIEval 数据集由微软研究院2023年推出。现在的 agi-eval.cn 平台已独立运营,由上海交通大学等高校联合支持。
评测框架怎么用? pip install agi-eval,配置模型信息,启动评测。三步完成。支持本地模型和API模型。详细文档在 docs.agi-eval.cn。
人机竞赛怎么参与? 在官网"人机竞赛"板块参与。你和大模型做同样的题目,系统会对比你和模型的得分。
支持自定义数据集吗? 支持。你可以把数据转成框架标准格式(生成题或选择题),复用现有评测插件。也可以写自定义插件实现特殊评测流程。
打分准确吗? 唯一答案类数据集用团队微调的 AGI-Eval-OA-Judge 模型打分,比传统正则匹配更准。复杂开放题仍需人工复核。
更新动态
近半年最大的动作是2025年11月评测框架开源。这标志着 AGI-Eval 从一个"看榜单的平台"变成了"可以自己跑评测的工具"。框架的插件化设计降低了自定义评测的门槛,后续 Agent 数据集接入也在规划中。
客户评论
汇总评分:暂无第三方平台评分(新兴社区平台)
"人机竞赛这个设计太好了。以前看模型70分不知道意味着什么,现在有了人类做参照,一目了然。" - AI研究者
"数据贡献机制对高校很友好。我们课题组贡献了医学领域数据,也被平台采纳了。" - 医学AI教授
"视频生成横评做得比我想的细。Sora在运动质量上确实领先,但文本一致性反而不如可灵,这个结论挺反直觉的。" - 视频AI开发者
AGI-Eval 作为新兴平台,用户基数和知名度跟 Arena、OpenCompass 还有差距。但它的"人机协同"和"考试题视角"在评测领域是独特的切入点,值得持续关注。
参考来源
- ▸AGI-Eval 官网 | 评测社区 - 官方平台,含模型榜单、评测集、人机竞赛
- ▸GitHub | AGI-Eval-Official/agi-eval - 开源评测框架代码仓库
- ▸AGI-Eval 使用文档 - 框架安装、配置、自定义数据集完整教程
- ▸CSDN | AGI-Eval 评测框架开源 - 官方团队发布的框架介绍文章
