MLE-bench low
paper-boundgeneralmachine-learningml-engineeringagentictext
2024 · https://openai.com/index/mle-bench/ · freshness: fresh ML-engineering agent 的事实标准基准;题集固定(非滚动),但仍是该轴的主要参照。
专家判语 Expert verdict low
人工署名(chenhao)。值得回答: 1) 分数是"模型×脚手架"的合成——给 MoA 选 ML 工程冠军时,你怎么把脚手架红利和底座能力分开? 信号/特征工程时,我还是信任它的。 2) 16.9% 铜牌:你把它读成"agent 还不能自动做 ML"的证据,还是"在窄任务上已可用"的下限? 我认为是"在窄任务上已可用"的下限 3) Kaggle 方案公开 → 污染;你信 MLE-bench 分到什么程度,要不要配一道私域、无公开解的 ML 任务复核? 不用
— 署名 chenhao · 2026-06-17
它是什么 Agent summary 事实 · AI 整理
MLE-bench 由 OpenAI 出品(收录于 ICLR 2025 oral),是给“AI 智能体(agent,能自己分步骤、调用工具干活的 AI)做机器学习工程”打分的一份标准考卷,目前业内基本都拿它当参照。机器学习工程(ML engineering)说白了就是自己写代码训练模型。这套考卷把 75 个 Kaggle(知名数据科学竞赛平台)上的竞赛打包成一道道完整任务:智能体得从头到尾自己来,先处理数据,再训练模型、跑实验,最后交出参赛结果。评级方式很关键:它直接套用每场竞赛里真实的人类排行榜奖牌线(铜、银、金,medal 即 Kaggle 竞赛里的奖牌名次),也就是说,成绩好不好是跟真人高手比出来的,不是靠人主观打分。
结论说得很实在:就算用目前表现最好的组合(o1-preview 模型,加上一个叫 AIDE 的“脚手架”——也就是帮模型把活儿安排好流程的外挂工具),也只在 16.9% 的竞赛里拿到了铜牌以上,离 Kaggle 的人类高手还差得远。有两点要留意。第一,题目都来自公开的 Kaggle 竞赛,网上早有大量现成解法,所以存在明确的数据污染风险(模型可能提前见过题、靠背答案虚高),看到高分得先排除掉这种“背出来”的成分。第二,成绩很大程度上靠脚手架撑着,分数其实是“模型本身 × 脚手架”两者合在一起的结果,不能全算到模型头上。它考的能力比 [swe-bench](那个主要看改代码)更上游一层:能不能从头到尾自动做完一整套机器学习。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | OpenAI(Jun Shern Chan, Neil Chowdhury 等) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | irregular |
| 在线榜 online | 否 |
引用
② 人气 Popularity
≠ 质量
trending③ 能力 Capability
榜内排名
| 模型 | 轴 axis | 名次 | 许可 | 备注 |
|---|---|---|---|---|
| o1-preview + AIDE(脚手架) | ml-engineering | 1 | closed | 16.9% 的竞赛达到≥铜牌;距 Kaggle 人类高手仍远 |
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 ml-engineeringmodel-trainingdata-preparationexperimentationagentic
模态 text 部署 apiopen-weights
适合 recommended for
- 评估‘把模型/agent 当 ML 工程师用’的可行性——端到端训模型/跑实验,而非只改代码(补 [swe-bench] 之上的上游能力)
- 用真实 Kaggle 奖牌线做参照,横比 agent 的 ML 工程水平
注意 caveats
- 题源是公开 Kaggle 赛 → 方案泄漏/抄解风险;高分需排除记忆成分
- 成绩高度依赖**脚手架**(AIDE 等),不只是底座模型——分数是‘模型×scaffold’的合成
- 16.9% 铜牌≈仍远未达人类高手;别据此高估 agent 的自动 ML 能力