MTEB medium
online-leaderboardgeneralembeddingsretrievaltext
2022 · https://huggingface.co/spaces/mteb/leaderboard · freshness: fresh live;嵌入模型选型的标准参考。注意子榜/语种很多,需按任务读。
专家判语 Expert verdict medium
为 RAG 选嵌入模型时我只看 retrieval 子榜,不信 overall 综合分;112 语覆盖对中文、尤其中文医疗检索的迁移性有限,加上公开数据集泄漏风险,最终一定要配自建的中文(医疗)私域检索评测来定。
— 署名 chenhao · 2026-06-22
它是什么 Agent summary 事实 · AI 整理
先说“文本嵌入”(text embedding)是什么:把一段文字转成一串数字向量,机器靠比较这些向量来判断两段话语义有多接近。做这种转换的模型叫文本嵌入模型(text embedding model)。MTEB(Massive Text Embedding Benchmark;Muennighoff 等,2022,arXiv 2210.07316)就是给这类模型出的一套标准考卷(benchmark,即基准测试),托管在开源模型平台 HuggingFace 上,如今基本是这个领域公认的主榜。
它一共考 8 类任务,共 58 个数据集、覆盖 112 种语言。8 类任务包括:bitext mining(跨语言找对应句)、分类、聚类(clustering,把相近的内容自动归堆)、pair classification、reranking(给搜索结果重新排序)、retrieval(按语义找相关文档,这是搜索和 RAG 的核心)、STS(判断两句话语义相似度)、摘要。所有模型用同一套口径打分排名,所以你想给 RAG、检索、语义相似度这类场景挑嵌入模型,从这里入手最直接。
读榜要注意两点。一是它是通用嵌入榜,overall 那个总分会把各类任务的差异平均掉:你要做 retrieval,就直接去看 retrieval 子榜,别只盯综合分。二是它用的都是公开数据集,模型有可能提前见过这些考题、靠背答案把分刷高(数据污染),所以榜上分数高,放到你自己的私有语料上未必同样好用。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Niklas Muennighoff et al. (Hugging Face / Cohere 等社区) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | live |
| 在线榜 online | 是 |
引用
- MTEB: Massive Text Embedding Benchmark (Muennighoff et al., 2022) · 2026-06-17
- MTEB Leaderboard (HuggingFace Space) · 2026-06-17
② 人气 Popularity
≠ 质量
HF Space③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 text-embeddingsretrievalrerankingsemantic-similarity
模态 text 部署 apiopen-weights
适合 recommended for
- 为 RAG/检索/聚类选嵌入模型——这是该领域事实上的标准榜
- 多语种(112 语)嵌入能力对比
注意 caveats
- 总分会掩盖任务差异;按你的任务(如 retrieval)读子榜,别只看 overall
- 公开数据集存在训练泄漏风险;高分未必迁移到你的私有语料