← 返回总览

MLE-bench low

paper-boundgeneralmachine-learningml-engineeringagentictext

2024 · https://openai.com/index/mle-bench/ · freshness: fresh ML-engineering agent 的事实标准基准;题集固定(非滚动),但仍是该轴的主要参照。

专家判语 Expert verdict low

人工署名(chenhao)。值得回答: 1) 分数是"模型×脚手架"的合成——给 MoA 选 ML 工程冠军时,你怎么把脚手架红利和底座能力分开? 信号/特征工程时,我还是信任它的。 2) 16.9% 铜牌:你把它读成"agent 还不能自动做 ML"的证据,还是"在窄任务上已可用"的下限? 我认为是"在窄任务上已可用"的下限 3) Kaggle 方案公开 → 污染;你信 MLE-bench 分到什么程度,要不要配一道私域、无公开解的 ML 任务复核? 不用

— 署名 chenhao · 2026-06-17

它是什么 Agent summary 事实 · AI 整理

MLE-bench 由 OpenAI 出品(收录于 ICLR 2025 oral),是给“AI 智能体(agent,能自己分步骤、调用工具干活的 AI)做机器学习工程”打分的一份标准考卷,目前业内基本都拿它当参照。机器学习工程(ML engineering)说白了就是自己写代码训练模型。这套考卷把 75 个 Kaggle(知名数据科学竞赛平台)上的竞赛打包成一道道完整任务:智能体得从头到尾自己来,先处理数据,再训练模型、跑实验,最后交出参赛结果。评级方式很关键:它直接套用每场竞赛里真实的人类排行榜奖牌线(铜、银、金,medal 即 Kaggle 竞赛里的奖牌名次),也就是说,成绩好不好是跟真人高手比出来的,不是靠人主观打分。

结论说得很实在:就算用目前表现最好的组合(o1-preview 模型,加上一个叫 AIDE 的“脚手架”——也就是帮模型把活儿安排好流程的外挂工具),也只在 16.9% 的竞赛里拿到了铜牌以上,离 Kaggle 的人类高手还差得远。有两点要留意。第一,题目都来自公开的 Kaggle 竞赛,网上早有大量现成解法,所以存在明确的数据污染风险(模型可能提前见过题、靠背答案虚高),看到高分得先排除掉这种“背出来”的成分。第二,成绩很大程度上靠脚手架撑着,分数其实是“模型本身 × 脚手架”两者合在一起的结果,不能全算到模型头上。它考的能力比 [swe-bench](那个主要看改代码)更上游一层:能不能从头到尾自动做完一整套机器学习。

① 权威 Authority
学术/机构/引用

维护方 maintainersOpenAI(Jun Shern Chan, Neil Chowdhury 等)
机构数 institutions0
更新节奏 cadenceirregular
在线榜 online

引用

② 人气 Popularity
≠ 质量

trending

③ 能力 Capability
榜内排名

模型轴 axis名次许可备注
o1-preview + AIDE(脚手架)ml-engineering1closed16.9% 的竞赛达到≥铜牌;距 Kaggle 人类高手仍远

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 ml-engineeringmodel-trainingdata-preparationexperimentationagentic

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览