AI万址

Chatbot Arena

Chatbot Arena(现更名为Arena)是全球被引用最多的大模型评测平台,累计700万张人类盲测选票、368个模型上榜。用Elo评分客观对比GPT、Claude、Gemini等主流模型,完全免费使用。

Chatbot Arena
访问官网
基本信息详情
开发公司LMSYS Organization(UC Berkeley Sky Computing Lab),2026年1月更名为 Arena
上线时间2023年5月
官网https://chat.lmsys.org/ (现域名 lmarena.ai)
支持平台网页版
价格完全免费,无付费层级
核心定位基于众包盲测的大模型人类偏好排行榜

Chatbot Arena 现在叫 Arena,是全球被引用最多的大模型评测平台。玩法很简单:你输入一个提示词,平台随机抽两个模型同时回答,两边都是匿名的,你看完投票选出更好的那个。投票结束才揭晓模型身份。这套盲测机制把品牌光环和营销话术全挡在了外面,排名只反映真实的人类偏好。

平台用的是国际象棋那套 Elo 评分体系,底层跑的是 Bradley-Terry 统计模型。截至2026年6月,累计收到超过700万张选票,覆盖368个模型。2026年1月平台从 LMSYS Chatbot Arena 正式更名 Arena,估值17亿美元,6月ARR达到1亿美元。它已经不只是文本模型的擂台,还扩展到了图像生成、视频生成、编程、数学等专项赛道。2026年6月4日上线的 Agent Arena,开始测模型在真实任务里的智能体完成能力,而不只是比谁回答得讨喜。

我们实际用下来,Arena 最值钱的地方不是榜单本身,而是它给你的选型直觉。你看 Top 5 的 Elo 差距可能只有30-50分,换算成胜率也就53%-55%,这意味着头部模型在通用对话上其实没有代差。但在编程、长上下文这类垂直赛道,差距能拉到100点以上。所以别只看总榜,看分榜。

核心功能

盲测对战:两个匿名模型同时回答你的提问,你选更好的那个。没有品牌标识,没有Logo,纯粹靠回答质量说话。这是 Arena 区别于所有静态 benchmark 的根本。

Elo 排行榜:用 Bradley-Terry 模型计算配对胜率,1000次自助法重采样算置信区间。头部模型的置信区间已经压到±4以内。50分的 Elo 差大约对应57%的胜率,100分差对应64%。

Style Control Elo:这个指标剥离了"更长更花哨就更容易被选中"的格式偏好偏差。如果一个模型的 Style Control Elo 明显低于原始 Elo,说明它的高分很大程度靠排版和篇幅撑出来的,不是真本事。

多赛道分榜:文本总榜之外,有编程 Arena、科学、长上下文、前端代码等分赛道。2026年7月,月之暗面的开源 Kimi K3 在前端代码 Arena 拿到1679 Elo,成为第一个登顶编程分榜的开源模型。

Agent Arena:2026年6月上线,测的不是回答好不好看,而是模型能不能真正完成一个多步骤的智能体任务。这比投票选谁说得更好更接近真实生产力。

适合谁

模型选型决策者:企业要在十几个模型里挑一个接入业务,Arena 的分榜比厂商自吹的跑分靠谱得多。我们建议先看总榜筛掉尾部,再到对应分榜细看。

AI 研究者:Arena 公开了投票数据和论文,做对齐研究、偏好建模的团队可以直接拿数据用。

普通用户:想免费体验 GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 这些付费模型,Arena 是少有的零成本渠道。你甚至不需要注册账号。

同类竞品对比

维度Chatbot ArenaOpenCompassSuperCLUEHugging Face Leaderboard
评测方式人类盲测投票客观题自动化评测客观题+主观对战自动化基准测试
数据来源真实用户实时提问固定数据集固定数据集固定数据集
中文支持有但偏英文原生中文优化原生中文,专攻中文
是否免费完全免费开源免费免费免费
更新频率每周按版本每月按提交

Arena 的护城河是规模——700万张选票不是任何竞品能短期复制的。但它也有短板:投票者水平参差不齐,长问题容易被跳过,所以它测的是"大众偏好"而非"专家共识"。

FAQ

A

Arena 的排名公平吗? 基本公平。平台做了左右位置偏差校正和厂商偏好校正。但投票者自选、水平不一是客观存在的偏差。Style Control Elo 是用来抵消"更长就更好"这个已知偏差的补充指标。

A

需要注册才能用吗? 不需要。打开网页就能开始对战。注册账号只是为了保存对话历史。

A

能拿来当日常聊天工具吗? 不推荐。Arena 是评测平台,不是生产力工具。模型随机分配,没法稳定用同一个,也不支持文件上传这类功能。

A

开源模型为什么排名偏低? 头部20个席位几乎被闭源模型包揽。开源模型在指令遵循和安全对齐上有架构层面的差距。但2026年7月 Kimi K3 登顶编程分榜,说明开源在垂直赛道已经开始翻盘。

A

Arena 自己会做模型吗? 不会。它的价值就是中立。一旦下场做模型,公信力就没了。

更新动态

近半年最大的变化是 Agent Arena 的上线。它标志着评测范式从"回答好不好看"转向"任务完不完成得了"。另外 Claude Fable 5 在6月12日因美国出口管制令全球下线,虽然它在下线前排到了文本总榜第一,但只有4366张选票,置信区间±9,是头部里最宽的。

客户评论

汇总评分:4.4/5(来源:ToolChase,2026年7月)

"最 unbiased 的模型对比工具,没有之一。" — AI 研究者

"免费就能试到所有付费模型,这点太香了。但高峰期排队有点慢。" — 独立开发者

"我们公司选型第一步就是看 Arena 分榜,第二步才看价格。" — 企业技术负责人

客观说,Arena 的差评主要集中在两点:高峰期响应慢,以及非英语提示词的样本量不够。但作为免费的众包平台,这两点很难苛责。

参考来源