← 返回总览

BFCL (Berkeley Function-Calling Leaderboard) medium

online-leaderboardgeneraltool-useagenticfunction-callingtext

2024 · https://gorilla.cs.berkeley.edu/leaderboard.html · freshness: fresh live;函数调用/工具使用的标准榜,V3 已扩到多轮 agentic。持续加入新模型。

专家判语 Expert verdict medium

BFCL 的 AST 结构匹配分对衡量 function-calling 已经够用,我不强求再叠一层真跑执行的私域评测;选 agent 模型时多轮 agentic(V3)分可比单轮稍高权重,但二者都直接信 BFCL 自身分即可。

— 署名 chenhao · 2026-06-22

它是什么 Agent summary 事实 · AI 整理

BFCL(Berkeley Function-Calling Leaderboard)出自 UC Berkeley 的 Gorilla 项目,Patil 等人,发表于 ICML 2025。它是一份给 AI 出的标准考卷(benchmark),专门考大模型(LLM)会不会按格式调用外部函数、工具,也就是“function/tool calling”。这件事现在公认要看它的分。它的考法是真去跑代码:覆盖一次只调一个工具、一次并排调好几个工具的情况,也覆盖多种编程语言。最关键的一招,是它不真把每个工具都执行一遍,而是用“抽象语法树(AST,可以理解成把代码拆成一棵结构树)”去核对每次调用写得对不对,这样才扛得住上千个函数的规模。

到了 V3 版本,考的范围从“调一次工具”扩到了能自己分步骤、调工具干活的 AI(agent/智能体)场景:要多轮来回、分多步、还要记住前面发生过什么。它还顺带考一件事:模型什么时候该承认自己答不了、又该怎么一步步推理。结论挺有用:最前沿的模型在“调一次工具”上已经很强了,但记忆、临场决策、长链条推理还是难关。

有两点要留神。第一,AST 只核对调用的结构对不对,不等于真跑成功;有些调用结构没错、意思却错了,也可能被算对。第二,它只考函数调用这一件事,不管日常对话好不好、也不管具体领域答得对不对。

① 权威 Authority
学术/机构/引用

维护方 maintainersShishir Patil et al. (UC Berkeley — Gorilla 项目)
机构数 institutions0
更新节奏 cadencelive
在线榜 online

引用

② 人气 Popularity
≠ 质量

HF Space

③ 能力 Capability
榜内排名

无榜内排名(本身不是排名榜 / 数据集)。

拿它挑模型用(MoA 选型输入)
如果你要把几个模型搭成团队,这里是从这个榜能取到的参考

能力轴 function-callingtool-usemulti-turn-agenticplanning

模态 text   部署 apiopen-weights

适合 recommended for

注意 caveats

↑ 返回顶部 · ← 返回总览