← 返回总览

LMArena (Chatbot Arena) medium

online-leaderboardgeneralchatbothuman-preferencetextimage

2023 · https://lmarena.ai · freshness: fresh 实时 leaderboard ~每日更新;任何具体排名都是快照。票数持续增长。

专家判语 Expert verdict medium

人工署名(chenhao)。值得回答: 偏好-Elo 在 MoA 选型里该占多少权重 vs 任务-准确率榜? 我认为,情感居多的场景Elo高,其他场景准确率好些。 每日变动的排名不能作为证据? 我认为,每周/每月均值比较好。

— 署名 chenhao · 2026-06-16

它是什么 Agent summary 事实 · AI 整理

LMArena(原名 LMSYS Chatbot Arena,由 UC Berkeley SkyLab 团队 Chiang 等人发起)是目前关注度最高的 通用大模型排行榜,比的是“哪个 AI 的回答更讨人喜欢”(human preference,人类偏好)。它也是本集合里第一个 跟医疗无关的参照标杆。玩法很简单:真实用户输入一个问题(prompt),系统把它同时发给两个隐藏身份的模型, 用户投票觉得哪个回答更好,投完票才揭晓刚才是哪两个模型。然后用一个统计模型(Bradley-Terry,由两两胜负 反推各模型实力分)把这些两两投票换算成一个带误差范围的分数,形式上类似棋类等级分(Elo,按两两对战胜负 算出的分)。这个榜 2023 年上线;奠基论文(arXiv 2403.04132,2024 年 3 月)分析了 24 万票,实时榜此后 累计了数百万票,大约每天更新一次,还分出了按题型分类、控制行文风格的子榜,以及看图读文的多模态(multimodal, 能同时处理图和文字)arena。

它最大的优点是不容易作弊取巧:题目是网友现场产生、由真人当场评判的新鲜内容,这是固定题库的基准测试 (benchmark,给 AI 出的标准考卷)做不到的——固定题库容易被模型提前见过、靠背答案虚高(数据污染, contamination)。但它有个根子上的局限:它量的是“讨喜程度”,不是“对不对”。语气、排版、回答长度都会 影响投票,刷票和提问分布的偏差也会干扰结果,而且它是通用榜,几乎不涉及临床这类领域的安全把关。所以在 组队用模型(MoA,把多个模型组队、各管一块)的选型里,它适合当一个宽泛参考——看“人类愿不愿意跟它聊天”, 而不能当成判断对错或安全的门槛。

① 权威 Authority
学术/机构/引用

维护方 maintainersLMArena (formerly LMSYS), UC Berkeley SkyLab — Wei-Lin Chiang et al.
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 general-chat-qualityinstruction-followinghuman-preference

模态 textimage   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览