AI万址
H2O EvalGPT

H2O EvalGPT

H2O EvalGPT 是 H2O.ai 开源的 LLM 评测平台,用 Elo 评分和 GPT-4 裁判的 A/B 对决方式排名大模型,聚焦金融法律等行业场景。

H2O EvalGPT
访问官网
基本信息详情
开发公司H2O.ai(Srinivas Neppalli、Abhay Singhal、Michal Malohlava)
上线时间2023 年 7 月
官网https://evalgpt.ai/
支持平台Web / GitHub(开源)
价格免费开源
核心定位基于 Elo 评分的 LLM 对决式评测排行榜

H2O EvalGPT 是 H2O.ai 做的一个 LLM 评测平台。它不靠 BLEU、ROUGE 这些静态指标,而是让模型两两对决,用 Elo 评分(对,就是国际象棋那套)排出名次。思路很直接:与其纠结哪个指标更"对",不如让 GPT-4 当裁判,看两个模型答同一个 prompt 谁更讨人喜欢。

评测用 60 个覆盖多类别的 prompt,涉及金融、法律、银行等行业相关数据。每对模型的对决顺序被打乱、A/B 位置随机化后才送给裁判,避免位置偏差。最终每个模型拿到一个 Elo 分,每周更新一次榜单。

说白了,H2O EvalGPT 解决的是"自动化指标测不出语义好坏"的老问题。BLEU 能抓 ngram 重合,但抓不到"这个回答更自然、更有帮助"。A/B + Elo 是当时社区公认更贴近人类偏好的路线,LMSYS 的 Chatbot Arena 走的也是同一套。H2O 的差异点是行业 prompt + 开源代码 + 每周自动更新。

核心功能

01

Elo 排行榜

所有模型按 Elo 分排序,gpt-4-0314 以 1188 居首,h2ogpt-4096-llama2-70b-chat 1100 次之。Elo 是相对分,意义在于"打赢了谁",而不是绝对能力值。

02

A/B 对决 + GPT-4 裁判

60 个 prompt,每个 prompt 让两个模型各答一次,GPT-4 判谁更好。位置随机化、对决顺序打乱,是为了防"A 位置天然占优"这种偏差。

03

行业相关 prompt

不是通用的闲聊题,而是银行报告摘要、法律问答这类业务场景。这对企业选型更有意义--你要的是能在生产环境干活的模型,不是会写诗的。

04

可复现 + 开源

评测代码在 GitHub 开源(h2oai/h2o-LLM-eval),整个 pipeline 可复现。H2O 强调"transparency",反对黑盒榜单。

05

手动 A/B 测试

除了自动跑,平台还开放手动 A/B,你可以自己挑两个模型比,结果和自动榜对齐校验。

适合谁

企业选型团队

要在多个开源/闭源 LLM 里挑一个上生产的,EvalGPT 的行业 prompt 比通用榜更贴近真实场景。

ML 工程师

想验证自家微调模型相对 GPT-4 的位置,可以提交评测。

AI 研究者

研究人类偏好对齐、Elo 评测方法的,EvalGPT 是开源可复现的样本。

H2O 生态用户

已经在用 h2oGPT、H2O LLM Studio 的,EvalGPT 是配套的选型入口。

同类竞品对比

平台评分方式裁判prompt 来源特色
H2O EvalGPTElo + A/BGPT-460 个行业题开源,每周更新
LMSYS Chatbot ArenaElo + 众包真人投票用户自由输入规模最大,真人偏好
MT-BenchElo + 多轮GPT-480 多轮对话多轮能力
HELM多指标聚合自动指标标准基准指标最全
Open LLM Leaderboard自动指标自动公开基准集HuggingFace 旗舰

如果你的目标是"贴近人类偏好的对决榜",Chatbot Arena 规模更大、真人更多;如果要"行业场景+开源可复现",H2O EvalGPT 更聚焦。两者其实是互补的。

FAQ

A

Q1:H2O EvalGPT 现在还更新吗? 官方榜单近期更新放缓,GitHub 仓库 h2oai/h2o-LLM-eval 已标注为 archived(归档)。代码仍可用,但新模型上榜需要自己跑 pipeline。

A

Q2:Elo 分能跨平台比吗? 不能。Elo 是相对分,依赖参赛模型池和裁判。H2O 的 Elo 和 LMSYS 的 Elo 不是一个尺度,直接对比没意义。

A

Q3:为什么用 GPT-4 当裁判,不会有偏吗? 会有偏,GPT-4 对自身风格的回答天然更友好,社区称之为"self-preference"。H2O 通过位置随机化缓解一部分,但根本解决需要多人裁判或换裁判模型。

A

Q4:60 个 prompt 够吗? 做趋势判断够,做精细排名偏少。MT-Bench 用 80 题,Chatbot Arena 靠海量用户输入。60 题的方差会比较大,榜单末尾几名的差距不一定可靠。

A

Q5:能本地部署吗? 能。代码开源,README 有 Docker compose 的本地部署说明,需要自己准备 GPT-4 API key 当裁判。

A

Q6:和 H2O 的其他产品什么关系? EvalGPT 是评测层,h2oGPT 是模型层,H2O LLM Studio 是训练层。H2O 把这三件套打包成一个开源 LLM 全栈。

更新动态

H2O EvalGPT 在 2023 年 7–8 月是活跃期,密集提交模型、更新榜单。2023 年下半年后更新节奏放缓,GitHub 仓库归档。H2O.ai 的重心转向 h2oGPTe 和 GAIA 基准上的通用智能体评测--2024 年 h2oGPTe 在 GAIA 上拿到 65%,成为首个"C 级"通用智能体。

客户评论

H2O EvalGPT 是开源工具,没有正式用户评分。社区反馈:

  • H2O.ai 官方博客:强调"transparency + 每周自动更新 + 行业 prompt"是和 Chatbot Arena 的差异点,定位企业选型而非大众娱乐。
  • ai-kit.cn:把它归入"AI 大模型评测"工具,强调综合执行仪表板、可配置评估器和测试用例扰动功能,适合研发和选型两场景。
  • GitHub 社区:仓库归档前有 11 个 PR,主要贡献来自 H2O 内部团队,外部贡献者较少,反映出"工具好用但生态没起来"的状态。

参考来源