← 返回总览

MTEB medium

online-leaderboardgeneralembeddingsretrievaltext

2022 · https://huggingface.co/spaces/mteb/leaderboard · freshness: fresh live;嵌入模型选型的标准参考。注意子榜/语种很多,需按任务读。

专家判语 Expert verdict medium

为 RAG 选嵌入模型时我只看 retrieval 子榜,不信 overall 综合分;112 语覆盖对中文、尤其中文医疗检索的迁移性有限,加上公开数据集泄漏风险,最终一定要配自建的中文(医疗)私域检索评测来定。

— 署名 chenhao · 2026-06-22

它是什么 Agent summary 事实 · AI 整理

先说“文本嵌入”(text embedding)是什么:把一段文字转成一串数字向量,机器靠比较这些向量来判断两段话语义有多接近。做这种转换的模型叫文本嵌入模型(text embedding model)。MTEB(Massive Text Embedding Benchmark;Muennighoff 等,2022,arXiv 2210.07316)就是给这类模型出的一套标准考卷(benchmark,即基准测试),托管在开源模型平台 HuggingFace 上,如今基本是这个领域公认的主榜。

它一共考 8 类任务,共 58 个数据集、覆盖 112 种语言。8 类任务包括:bitext mining(跨语言找对应句)、分类、聚类(clustering,把相近的内容自动归堆)、pair classification、reranking(给搜索结果重新排序)、retrieval(按语义找相关文档,这是搜索和 RAG 的核心)、STS(判断两句话语义相似度)、摘要。所有模型用同一套口径打分排名,所以你想给 RAG、检索、语义相似度这类场景挑嵌入模型,从这里入手最直接。

读榜要注意两点。一是它是通用嵌入榜,overall 那个总分会把各类任务的差异平均掉:你要做 retrieval,就直接去看 retrieval 子榜,别只盯综合分。二是它用的都是公开数据集,模型有可能提前见过这些考题、靠背答案把分刷高(数据污染),所以榜上分数高,放到你自己的私有语料上未必同样好用。

① 权威 Authority
学术/机构/引用

维护方 maintainersNiklas Muennighoff et al. (Hugging Face / Cohere 等社区)
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 text-embeddingsretrievalrerankingsemantic-similarity

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览