← 返回总览

EQ-Bench medium

online-leaderboardgeneralemotional-intelligencetext

2023 · https://eqbench.com/ · freshness: fresh live leaderboard;EQ-Bench 3 当前主榜,LLM-judge + Elo,持续加入新模型。

专家判语 Expert verdict medium

人工署名(chenhao)。值得回答: 情商/共情是否值得在 MoA 里作为一个独立选型维度, 还是被通用对话质量涵盖(r≈0.97 与 MMLU)? 若场景分前台、后台,则可以成为独立选型。 默认 Claude 当 judge 的自偏好风险, 会不会让你在给 Claude 系模型选型时打折看待它的排名? 不会,只要该榜单有名、更新率高、模型全、自动评判者与专家一致性好。 独立研究者维护 (无机构背书) 对"可信度"是加分还是减分?

— 署名 chenhao · 2026-06-17

它是什么 Agent summary 事实 · AI 整理

EQ-Bench 是一份专门测 AI 情商(EQ)的基准测试,也就是给 AI 出的一套标准考卷(benchmark),看它在理解人的情绪上表现如何。它由独立研究者 Samuel J. Paech 提出(arXiv 2312.06281,2023 年 12 月),也是本项目最初的任务说明里点名的例子:一个常更新、引用率高、多个模型同台在线比拼的情商榜。

最早的版本让模型读一段对话,然后预测里面角色的情绪有多强烈(约 60 道英文题),结果稳定、容易复现。有意思的是,它的分数跟另一份通用知识考卷 MMLU 的分数几乎同涨同跌(相关系数 r≈0.97,意思是两个分数高度同步,很可能在测同一种能力),这说明它测到的很大程度上是 AI 的总体聪明程度,而不只是情商。

现在的主榜是 EQ-Bench 3(挂在 eqbench.com 上),改成了两种新题:多轮角色扮演(roleplay,让模型扮演角色对话)和文稿分析。打分的不是人,而是另一个 AI 充当“阅卷老师”(LLM judge,即 LLM 评判),按一份评分标准给分。默认用的阅卷 AI 是 Claude(先用 Sonnet 3.7,正式跑榜的成绩用 Opus 4.6,也可以换成任意 OpenAI 兼容的接口)。最后用 Elo 来排名,Elo 是借用棋类等级分的算法,按两两对战的胜负折算出分数(归一化后 o3=1500、llama-3.2-1b=200)。同一个网站上还挂着创意写作、长篇创意写作、阅卷 AI 校准(Judgemark)等几个姊妹榜。

它的价值在于补上了一个少见、又一直更新的维度:情感和社交能力,而大多数榜单只看答得对不对。但用它时要留意两点。第一,负责打分的是 AI(默认是 Claude),可能存在模型家族自偏好,也就是评判 AI 倾向给自家同门的模型打高分。第二,它跟 MMLU 高度相关,意味着高分可能更多反映的是 AI 的通用能力,而不是单纯的情商。

① 权威 Authority
学术/机构/引用

维护方 maintainersSamuel J. Paech (独立研究者)
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 emotional-intelligenceempathy-social-reasoningroleplay

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览