AI万址

AGI-Eval

AGI-Eval以高考、SAT、LSAT等人类标准化考试评测大模型,首创人机竞赛模式构建人类基准线,提供模型榜单、开源评测框架和数据共建社区,2万+用户参与。

AGI-Eval
访问官网
基本信息详情
开发公司微软研究院发起,现由上海交通大学等高校联合运营
上线时间2023年(原始AGIEval),2024年平台化运营
官网https://agi-eval.cn/mvp/home
支持平台网页版 / 开源框架(GitHub)
价格免费,开源
核心定位以人类标准化考试为基准的大模型评测社区

AGI-Eval 最早是微软研究院2023年推出的评测集,叫 AGIEval。思路很直接:拿人类的高难度标准化考试题来考大模型。中国高考、美国SAT、法学院入学LSAT、研究生GRE和GMAT,这些题本来就是筛选人类智力精英的,拿它们测AI正好。原始数据集有8062道真实考题,覆盖20项子任务。

后来这个项目从微软独立出来,变成了 agi-eval.cn 这个评测社区平台。现在它不只是跑考试题了,而是发展成了四大板块:模型榜单、评测数据集、人机竞赛、数据工作室。2025年11月,团队把评测框架也开源了,采用插件化架构,支持按需拼装。合作的机构包括美团、同济大学、上海交通大学、华东师范大学和Datawhale,社区用户超过2万人。

AGI-Eval 跟其他评测平台最大的区别,是它的"人机协同"理念。它不只让机器做题,还搞人机竞赛--让人和模型做同样的题,对比谁做得好。这个设计挺聪明的:传统 benchmark 只有模型之间比,你不知道60分到底算高还是低。有了人类做参照系,分数的意义就清楚了。截至2026年8月,榜单上 GPT-5.5 以0.8614的得分领跑,Gemini-3.1-Pro-Preview 紧随其后。

核心功能

模型榜单:大语言模型和多模态模型两套榜单。涵盖综合评测和各能力项评测,定期更新。当前文本榜首是 GPT-5.5,国产模型里豆包和千问排名靠前。

评测数据集生态:平台官方自建+用户自建双轨。官方数据集如 OI Bench(信息学竞赛题,由高校合作建设)、Math Pro Bench(高中数学竞赛和考研题)等。用户也可以贡献专业领域数据,500+任务标签覆盖多领域。

人机竞赛:人和模型做同一套题,构建人类基准线作为参照。这让评测分数有了"人类锚点",不再是模型之间空对空地比。

开源评测框架:插件化架构,支持单机、本地调试、多进程并行。从数据处理到指标计算,每一步都可以做成插件随时插拔,不用改主框架。已适配20+公开数据集(AIME2024、AIME2025、GPQA等)。

AGI-Eval-OA-Judge:团队专门微调的打分模型,用于唯一答案类数据集的自动评分。已开源到 HuggingFace,方便复现打分结果。

Data Studio:让个人贡献专业领域数据的工具。支持单条数据、扩写数据、Arena 对战数据等多种收集方式。机审+人审多重审核保证质量。

适合谁

AI 研究者:需要用人类标准化考试的视角检验模型的推理和知识能力。AGI-Eval 的高考、SAT、LSAT 数据集提供了一种"拿人类精英的考试题考AI"的独特视角。

企业技术决策者:榜单按能力项拆分,能看出不同模型在逻辑推理、数学计算、阅读理解上的强弱分布。选型时比看总分更实用。

数据贡献者:在某个垂直领域有专业知识的人,可以通过 Data Studio 贡献评测数据,参与共建评测标准。高校研究者特别适合。

视频生成模型开发者:AGI-Eval 团队做过年度AI视频生成横评,用上百条评测数据+专家级人工团队评Sora、可灵等模型。这块评测服务其他平台不太覆盖。

同类竞品对比

维度AGI-EvalChatbot ArenaOpenCompassC-Eval
评测方式考试题+人机竞赛人类盲测投票客观题自动化客观题自动化
数据来源人类标准化考试用户实时提问100+数据集中国学科考试
人机对比有(核心特色)
开源框架有(插件化)
多模态支持有(视频横评等)
社区生态2万+用户,数据共建700万+投票者GitHub 1万Star学术为主

AGI-Eval 的差异化在"人机协同"和"考试题视角"。它不追求覆盖面最广(那是 OpenCompass 的强项),而是在"怎么定义模型到底像不像人"这件事上做深。人机竞赛这个设计是其他平台没有的。

FAQ

A

AGI-Eval 是微软的产品吗? 原始 AGIEval 数据集由微软研究院2023年推出。现在的 agi-eval.cn 平台已独立运营,由上海交通大学等高校联合支持。

A

评测框架怎么用? pip install agi-eval,配置模型信息,启动评测。三步完成。支持本地模型和API模型。详细文档在 docs.agi-eval.cn。

A

人机竞赛怎么参与? 在官网"人机竞赛"板块参与。你和大模型做同样的题目,系统会对比你和模型的得分。

A

支持自定义数据集吗? 支持。你可以把数据转成框架标准格式(生成题或选择题),复用现有评测插件。也可以写自定义插件实现特殊评测流程。

A

打分准确吗? 唯一答案类数据集用团队微调的 AGI-Eval-OA-Judge 模型打分,比传统正则匹配更准。复杂开放题仍需人工复核。

更新动态

近半年最大的动作是2025年11月评测框架开源。这标志着 AGI-Eval 从一个"看榜单的平台"变成了"可以自己跑评测的工具"。框架的插件化设计降低了自定义评测的门槛,后续 Agent 数据集接入也在规划中。

客户评论

汇总评分:暂无第三方平台评分(新兴社区平台)

"人机竞赛这个设计太好了。以前看模型70分不知道意味着什么,现在有了人类做参照,一目了然。" - AI研究者

"数据贡献机制对高校很友好。我们课题组贡献了医学领域数据,也被平台采纳了。" - 医学AI教授

"视频生成横评做得比我想的细。Sora在运动质量上确实领先,但文本一致性反而不如可灵,这个结论挺反直觉的。" - 视频AI开发者

AGI-Eval 作为新兴平台,用户基数和知名度跟 Arena、OpenCompass 还有差距。但它的"人机协同"和"考试题视角"在评测领域是独特的切入点,值得持续关注。

参考来源