
| 基本信息 | 详情 |
|---|---|
| 开发公司 | H2O.ai(Srinivas Neppalli、Abhay Singhal、Michal Malohlava) |
| 上线时间 | 2023 年 7 月 |
| 官网 | https://evalgpt.ai/ |
| 支持平台 | Web / GitHub(开源) |
| 价格 | 免费开源 |
| 核心定位 | 基于 Elo 评分的 LLM 对决式评测排行榜 |
H2O EvalGPT 是 H2O.ai 做的一个 LLM 评测平台。它不靠 BLEU、ROUGE 这些静态指标,而是让模型两两对决,用 Elo 评分(对,就是国际象棋那套)排出名次。思路很直接:与其纠结哪个指标更"对",不如让 GPT-4 当裁判,看两个模型答同一个 prompt 谁更讨人喜欢。
评测用 60 个覆盖多类别的 prompt,涉及金融、法律、银行等行业相关数据。每对模型的对决顺序被打乱、A/B 位置随机化后才送给裁判,避免位置偏差。最终每个模型拿到一个 Elo 分,每周更新一次榜单。
说白了,H2O EvalGPT 解决的是"自动化指标测不出语义好坏"的老问题。BLEU 能抓 ngram 重合,但抓不到"这个回答更自然、更有帮助"。A/B + Elo 是当时社区公认更贴近人类偏好的路线,LMSYS 的 Chatbot Arena 走的也是同一套。H2O 的差异点是行业 prompt + 开源代码 + 每周自动更新。
核心功能
Elo 排行榜
所有模型按 Elo 分排序,gpt-4-0314 以 1188 居首,h2ogpt-4096-llama2-70b-chat 1100 次之。Elo 是相对分,意义在于"打赢了谁",而不是绝对能力值。
A/B 对决 + GPT-4 裁判
60 个 prompt,每个 prompt 让两个模型各答一次,GPT-4 判谁更好。位置随机化、对决顺序打乱,是为了防"A 位置天然占优"这种偏差。
行业相关 prompt
不是通用的闲聊题,而是银行报告摘要、法律问答这类业务场景。这对企业选型更有意义--你要的是能在生产环境干活的模型,不是会写诗的。
可复现 + 开源
评测代码在 GitHub 开源(h2oai/h2o-LLM-eval),整个 pipeline 可复现。H2O 强调"transparency",反对黑盒榜单。
手动 A/B 测试
除了自动跑,平台还开放手动 A/B,你可以自己挑两个模型比,结果和自动榜对齐校验。
适合谁
要在多个开源/闭源 LLM 里挑一个上生产的,EvalGPT 的行业 prompt 比通用榜更贴近真实场景。
想验证自家微调模型相对 GPT-4 的位置,可以提交评测。
研究人类偏好对齐、Elo 评测方法的,EvalGPT 是开源可复现的样本。
已经在用 h2oGPT、H2O LLM Studio 的,EvalGPT 是配套的选型入口。
同类竞品对比
| 平台 | 评分方式 | 裁判 | prompt 来源 | 特色 |
|---|---|---|---|---|
| H2O EvalGPT | Elo + A/B | GPT-4 | 60 个行业题 | 开源,每周更新 |
| LMSYS Chatbot Arena | Elo + 众包 | 真人投票 | 用户自由输入 | 规模最大,真人偏好 |
| MT-Bench | Elo + 多轮 | GPT-4 | 80 多轮对话 | 多轮能力 |
| HELM | 多指标聚合 | 自动指标 | 标准基准 | 指标最全 |
| Open LLM Leaderboard | 自动指标 | 自动 | 公开基准集 | HuggingFace 旗舰 |
如果你的目标是"贴近人类偏好的对决榜",Chatbot Arena 规模更大、真人更多;如果要"行业场景+开源可复现",H2O EvalGPT 更聚焦。两者其实是互补的。
FAQ
Q1:H2O EvalGPT 现在还更新吗? 官方榜单近期更新放缓,GitHub 仓库 h2oai/h2o-LLM-eval 已标注为 archived(归档)。代码仍可用,但新模型上榜需要自己跑 pipeline。
Q2:Elo 分能跨平台比吗? 不能。Elo 是相对分,依赖参赛模型池和裁判。H2O 的 Elo 和 LMSYS 的 Elo 不是一个尺度,直接对比没意义。
Q3:为什么用 GPT-4 当裁判,不会有偏吗? 会有偏,GPT-4 对自身风格的回答天然更友好,社区称之为"self-preference"。H2O 通过位置随机化缓解一部分,但根本解决需要多人裁判或换裁判模型。
Q4:60 个 prompt 够吗? 做趋势判断够,做精细排名偏少。MT-Bench 用 80 题,Chatbot Arena 靠海量用户输入。60 题的方差会比较大,榜单末尾几名的差距不一定可靠。
Q5:能本地部署吗? 能。代码开源,README 有 Docker compose 的本地部署说明,需要自己准备 GPT-4 API key 当裁判。
Q6:和 H2O 的其他产品什么关系? EvalGPT 是评测层,h2oGPT 是模型层,H2O LLM Studio 是训练层。H2O 把这三件套打包成一个开源 LLM 全栈。
更新动态
H2O EvalGPT 在 2023 年 7–8 月是活跃期,密集提交模型、更新榜单。2023 年下半年后更新节奏放缓,GitHub 仓库归档。H2O.ai 的重心转向 h2oGPTe 和 GAIA 基准上的通用智能体评测--2024 年 h2oGPTe 在 GAIA 上拿到 65%,成为首个"C 级"通用智能体。
客户评论
H2O EvalGPT 是开源工具,没有正式用户评分。社区反馈:
- H2O.ai 官方博客:强调"transparency + 每周自动更新 + 行业 prompt"是和 Chatbot Arena 的差异点,定位企业选型而非大众娱乐。
- ai-kit.cn:把它归入"AI 大模型评测"工具,强调综合执行仪表板、可配置评估器和测试用例扰动功能,适合研发和选型两场景。
- GitHub 社区:仓库归档前有 11 个 PR,主要贡献来自 H2O 内部团队,外部贡献者较少,反映出"工具好用但生态没起来"的状态。
参考来源
- ▸H2O EvalGPT 官网,Elo 排行榜与评测方法说明
- ▸H2O.ai Blog | H2O LLM EvalGPT: A Comprehensive Tool for Evaluating Large Language Models,官方介绍与评测方法详解
- ▸GitHub | h2oai/h2o-LLM-eval,开源评测代码与本地部署说明
- ▸ai-kit.cn | H2O EvalGPT,第三方功能解析
- ▸agentic-design.ai | GAIA: General AI Assistants Benchmark,H2O h2oGPTe 在 GAIA 上的表现参考
