BFCL (Berkeley Function-Calling Leaderboard) medium
online-leaderboardgeneraltool-useagenticfunction-callingtext
2024 · https://gorilla.cs.berkeley.edu/leaderboard.html · freshness: fresh live;函数调用/工具使用的标准榜,V3 已扩到多轮 agentic。持续加入新模型。
专家判语 Expert verdict medium
BFCL 的 AST 结构匹配分对衡量 function-calling 已经够用,我不强求再叠一层真跑执行的私域评测;选 agent 模型时多轮 agentic(V3)分可比单轮稍高权重,但二者都直接信 BFCL 自身分即可。
— 署名 chenhao · 2026-06-22
它是什么 Agent summary 事实 · AI 整理
BFCL(Berkeley Function-Calling Leaderboard)出自 UC Berkeley 的 Gorilla 项目,Patil 等人,发表于 ICML 2025。它是一份给 AI 出的标准考卷(benchmark),专门考大模型(LLM)会不会按格式调用外部函数、工具,也就是“function/tool calling”。这件事现在公认要看它的分。它的考法是真去跑代码:覆盖一次只调一个工具、一次并排调好几个工具的情况,也覆盖多种编程语言。最关键的一招,是它不真把每个工具都执行一遍,而是用“抽象语法树(AST,可以理解成把代码拆成一棵结构树)”去核对每次调用写得对不对,这样才扛得住上千个函数的规模。
到了 V3 版本,考的范围从“调一次工具”扩到了能自己分步骤、调工具干活的 AI(agent/智能体)场景:要多轮来回、分多步、还要记住前面发生过什么。它还顺带考一件事:模型什么时候该承认自己答不了、又该怎么一步步推理。结论挺有用:最前沿的模型在“调一次工具”上已经很强了,但记忆、临场决策、长链条推理还是难关。
有两点要留神。第一,AST 只核对调用的结构对不对,不等于真跑成功;有些调用结构没错、意思却错了,也可能被算对。第二,它只考函数调用这一件事,不管日常对话好不好、也不管具体领域答得对不对。
① 权威 Authority
学术/机构/引用
| 维护方 maintainers | Shishir Patil et al. (UC Berkeley — Gorilla 项目) |
|---|---|
| 机构数 institutions | 0 |
| 更新节奏 cadence | live |
| 在线榜 online | 是 |
引用
② 人气 Popularity
≠ 质量
HF Space③ 能力 Capability
榜内排名
无榜内排名(本身不是排名榜 / 数据集)。
拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考
能力轴 function-callingtool-usemulti-turn-agenticplanning
模态 text 部署 apiopen-weights
适合 recommended for
- 为 agent/工具调用选模型——这是 function-calling 事实上的标准榜
- 区分单轮工具调用 vs 多轮、有状态、长链路 agentic 能力(V3)
注意 caveats
- AST 结构核对≠真实执行成功;结构对但语义错的调用可能被算对
- 聚焦函数调用;不测一般对话质量或领域正确性