Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

Completing tasks over several turns with stateful tools, including when functions or parameters are missing.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: multi-turn tasks, % correct, higher is better
#ModelBFCL: multi-turn tasks
% correct, higher is better
1 xlam-2-70b-fc-rSalesforce
77.4%
2 xlam-2-8b-fc-rSalesforce
70.0%
3 xlam-2-32b-fc-rSalesforce
69.5%
4 Claude Opus 4.5Anthropic · claude-opus-4.5
68.4%
5 GLM 4.6Z.ai · glm-4.6
68.0%
6 gemini-3-pro-previewGoogle
63.1%
7 bitagent-bounty-8bBittensor
62.4%
8 o3OpenAI
62.2%
9 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
61.4%
10 gemini-3-pro-previewGoogle
60.8%
11 grok-4-1-fast-reasoningxAI
58.9%
12 xlam-2-3b-fc-rSalesforce
58.4%
13 arch-agent-32bKatanemo
54.2%
14 Claude Haiku 4.5Anthropic · claude-haiku-4.5
53.6%
15 nanbeige4-3b-thinking-2511Nanbeige
51.1%
16 Kimi K2 0711Moonshot AI · kimi-k2
50.6%
17 command-a-reasoningCohere
50.1%
18 Qwen3 32BAlibaba · qwen3-32b
47.9%
19 grok-4-0709xAI
47.0%
20 grok-4-1-fast-non-reasoningxAI
46.8%
21 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
45.4%
22 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
44.9%
23 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
44.6%
24 GPT-5.2OpenAI · gpt-5.2
43.8%
25 Qwen3 32BAlibaba · qwen3-32b
43.2%
26 Qwen3 8BAlibaba · qwen3-8b
41.8%
26 o4 MiniOpenAI · o4-mini
41.8%
28 nanbeige3.5-pro-thinkingNanbeige
40.0%
29 GPT-4.1OpenAI · gpt-4.1
38.9%
30 toolace-2-8bHuawei Noah And Ustc
38.4%
31 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
37.4%
32 Gemini 2.5 FlashGoogle · gemini-2.5-flash
36.2%
33 xlam-2-1b-fc-rSalesforce
36.0%
34 arch-agent-3bKatanemo
34.9%
35 Qwen3 14BAlibaba · qwen3-14b
34.8%
36 GPT-5 NanoOpenAI · gpt-5-nano
34.5%
37 GPT-4.1 MiniOpenAI · gpt-4.1-mini
34.1%
38 grok-4-0709xAI
33.9%
39 Qwen3 8BAlibaba · qwen3-8b
33.4%
40 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
30.0%
41 Command ACohere · command-a
29.5%
42 GPT-5.2OpenAI · gpt-5.2
28.1%
43 GPT-5 MiniOpenAI · gpt-5-mini
27.5%
44 arch-agent-1.5bKatanemo
26.6%
45 Qwen3 14BAlibaba · qwen3-14b
26.1%
46 hammer2.1-7bMadeagents
23.9%
47 GPT-4.1 NanoOpenAI · gpt-4.1-nano
23.6%
48 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
23.5%
49 qwen3-4b-instruct-2507Alibaba
22.1%
50 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
21.5%
51 qwen3-4b-instruct-2507Alibaba
20.5%
52 llama-4-maverick-17b-128e-instruct-fp8Meta
20.2%
53 Gemini 2.5 FlashGoogle · gemini-2.5-flash
16.8%
54 o4 MiniOpenAI · o4-mini
16.6%
55 hammer2.1-3bMadeagents
16.5%
56 Claude Opus 4.5Anthropic · claude-opus-4.5
16.1%
57 hammer2.1-1.5bMadeagents
15.6%
58 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
14.8%
58 o3OpenAI
14.8%
60 mistral-large-2411Mistral
14.1%
61 mistral-large-2411Mistral
13.8%
62 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
13.5%
63 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
11.5%
64 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
11.1%
65 qwen3-1.7bAlibaba
11.0%
66 Gemma 3 27BGoogle · gemma-3-27b-it
10.8%
66 Mistral Medium 3Mistral · mistral-medium-3
10.8%
68 coalm-70bUiuc Oumi
10.6%
69 Mistral Medium 3Mistral · mistral-medium-3
9.9%
70 GPT-4.1OpenAI · gpt-4.1
9.8%
71 Llama 4 ScoutMeta · llama-4-scout
9.0%
72 Command R7B (12-2024)Cohere · command-r7b-12-2024
8.2%
73 coalm-8bUiuc Oumi
8.0%
74 Mistral NemoMistral · mistral-nemo
7.8%
75 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
7.6%
76 granite-3.1-8b-instructIBM
7.5%
77 granite-3.2-8b-instructIBM
7.4%
78 falcon3-10b-instructTII
6.5%
79 Gemma 3 12BGoogle · gemma-3-12b-it
5.8%
80 GPT-5 MiniOpenAI · gpt-5-mini
5.5%
81 granite-20b-functioncallingIBM
5.4%
82 falcon3-7b-instructTII
5.0%
83 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
4.0%
84 Phi 4Microsoft · phi-4
3.9%
84 minicpm3-4bOpenbmb
3.9%
86 qwen3-0.6bAlibaba
3.6%
87 minicpm3-4bOpenbmb
3.5%
88 hammer2.1-0.5bMadeagents
2.9%
88 rzn-tPhronetic Ai
2.9%
90 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
2.6%
91 granite-4.0-350mIBM
2.5%
91 GPT-4.1 MiniOpenAI · gpt-4.1-mini
2.5%
93 Nova 2 LiteAmazon · nova-2-lite-v1
2.1%
94 GPT-4.1 NanoOpenAI · gpt-4.1-nano
2.0%
95 Nova Pro 1.0Amazon · nova-pro-v1
1.9%
96 Claude Haiku 4.5Anthropic · claude-haiku-4.5
1.8%
97 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
1.6%
98 qwen3-0.6bAlibaba
1.4%
98 Nova Micro 1.0Amazon · nova-micro-v1
1.4%
100 falcon3-3b-instructTII
1.0%
101 Mistral NemoMistral · mistral-nemo
0.8%
101 GPT-5 NanoOpenAI · gpt-5-nano
0.8%
103 Gemma 3 4BGoogle · gemma-3-4b-it
0.4%
103 palmyra-x-004Writer
0.4%
105 gemma-3-1b-itGoogle
0.0%
105 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
0.0%
105 ministral-8b-2410Mistral
0.0%
105 llama-3.1-nemotron-ultra-253b-v1NVIDIA
0.0%
105 falcon3-1b-instructTII
0.0%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

Completing tasks over several turns with stateful tools, including when functions or parameters are missing.

What it does not measure

Not open-ended agent work: the tools and tasks are BFCL's simulated APIs.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.