Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

Answering multi-step questions with a web-search tool.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: web search, % correct, higher is better
#ModelBFCL: web search
% correct, higher is better
1 Claude Opus 4.5Anthropic · claude-opus-4.5
84.5%
2 Claude Haiku 4.5Anthropic · claude-haiku-4.5
83.5%
3 grok-4-1-fast-reasoningxAI
82.5%
4 GPT-5 MiniOpenAI · gpt-5-mini
82.0%
4 grok-4-0709xAI
82.0%
6 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
81.0%
7 gemini-3-pro-previewGoogle
80.0%
8 GLM 4.6Z.ai · glm-4.6
77.5%
9 o3OpenAI
77.0%
10 GPT-5.2OpenAI · gpt-5.2
75.5%
10 o4 MiniOpenAI · o4-mini
75.5%
12 grok-4-1-fast-non-reasoningxAI
75.0%
13 grok-4-0709xAI
74.0%
14 GPT-5 NanoOpenAI · gpt-5-nano
72.5%
15 o4 MiniOpenAI · o4-mini
71.5%
16 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
69.5%
17 gemini-3-pro-previewGoogle
68.5%
18 GPT-4.1OpenAI · gpt-4.1
68.0%
19 Kimi K2 0711Moonshot AI · kimi-k2
66.5%
20 Gemini 2.5 FlashGoogle · gemini-2.5-flash
62.0%
21 Gemini 2.5 FlashGoogle · gemini-2.5-flash
59.0%
22 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
58.0%
23 GPT-4.1 MiniOpenAI · gpt-4.1-mini
57.0%
24 command-a-reasoningCohere
55.5%
25 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
54.0%
26 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
50.5%
26 o3OpenAI
50.5%
28 Command ACohere · command-a
46.5%
29 nanbeige3.5-pro-thinkingNanbeige
42.0%
30 GPT-5.2OpenAI · gpt-5.2
40.5%
31 Mistral Medium 3Mistral · mistral-medium-3
39.0%
32 Mistral Medium 3Mistral · mistral-medium-3
35.0%
32 GPT-4.1OpenAI · gpt-4.1
35.0%
34 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
31.0%
35 llama-4-maverick-17b-128e-instruct-fp8Meta
28.0%
35 mistral-large-2411Mistral
28.0%
37 Command R7B (12-2024)Cohere · command-r7b-12-2024
27.0%
38 Qwen3 32BAlibaba · qwen3-32b
26.0%
39 xlam-2-32b-fc-rSalesforce
25.5%
40 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
22.5%
41 Qwen3 32BAlibaba · qwen3-32b
21.5%
41 nanbeige4-3b-thinking-2511Nanbeige
21.5%
43 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
21.0%
44 mistral-large-2411Mistral
20.0%
45 Claude Haiku 4.5Anthropic · claude-haiku-4.5
19.5%
46 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
17.5%
47 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
16.0%
48 xlam-2-70b-fc-rSalesforce
15.0%
49 Llama 4 ScoutMeta · llama-4-scout
14.5%
50 Qwen3 8BAlibaba · qwen3-8b
13.5%
50 GPT-5 NanoOpenAI · gpt-5-nano
13.5%
52 Claude Opus 4.5Anthropic · claude-opus-4.5
13.0%
53 Qwen3 8BAlibaba · qwen3-8b
12.0%
54 GPT-4.1 NanoOpenAI · gpt-4.1-nano
11.0%
55 Qwen3 14BAlibaba · qwen3-14b
10.5%
56 Qwen3 14BAlibaba · qwen3-14b
10.0%
56 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
10.0%
58 toolace-2-8bHuawei Noah And Ustc
8.5%
58 GPT-5 MiniOpenAI · gpt-5-mini
8.5%
60 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
7.5%
61 Mistral NemoMistral · mistral-nemo
7.0%
62 xlam-2-8b-fc-rSalesforce
6.5%
63 Nova 2 LiteAmazon · nova-2-lite-v1
5.0%
63 arch-agent-32bKatanemo
5.0%
65 qwen3-4b-instruct-2507Alibaba
4.5%
65 Phi 4Microsoft · phi-4
4.5%
67 Gemma 3 12BGoogle · gemma-3-12b-it
4.0%
67 GPT-4.1 MiniOpenAI · gpt-4.1-mini
4.0%
69 qwen3-4b-instruct-2507Alibaba
3.0%
69 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
3.0%
71 qwen3-1.7bAlibaba
2.5%
71 Nova Pro 1.0Amazon · nova-pro-v1
2.5%
71 Mistral NemoMistral · mistral-nemo
2.5%
71 xlam-2-3b-fc-rSalesforce
2.5%
71 palmyra-x-004Writer
2.5%
76 minicpm3-4bOpenbmb
2.0%
77 Nova Micro 1.0Amazon · nova-micro-v1
1.5%
77 GPT-4.1 NanoOpenAI · gpt-4.1-nano
1.5%
77 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
1.5%
77 falcon3-10b-instructTII
1.5%
81 qwen3-0.6bAlibaba
1.0%
81 Gemma 3 4BGoogle · gemma-3-4b-it
1.0%
81 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
1.0%
81 ministral-8b-2410Mistral
1.0%
81 falcon3-3b-instructTII
1.0%
86 qwen3-0.6bAlibaba
0.5%
86 granite-3.1-8b-instructIBM
0.5%
86 granite-3.2-8b-instructIBM
0.5%
86 granite-4.0-350mIBM
0.5%
86 arch-agent-3bKatanemo
0.5%
86 falcon3-7b-instructTII
0.5%
92 bitagent-bounty-8bBittensor
0.0%
92 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
0.0%
92 gemma-3-1b-itGoogle
0.0%
92 Gemma 3 27BGoogle · gemma-3-27b-it
0.0%
92 granite-20b-functioncallingIBM
0.0%
92 arch-agent-1.5bKatanemo
0.0%
92 hammer2.1-0.5bMadeagents
0.0%
92 hammer2.1-1.5bMadeagents
0.0%
92 hammer2.1-3bMadeagents
0.0%
92 hammer2.1-7bMadeagents
0.0%
92 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
0.0%
92 llama-3.1-nemotron-ultra-253b-v1NVIDIA
0.0%
92 minicpm3-4bOpenbmb
0.0%
92 rzn-tPhronetic Ai
0.0%
92 xlam-2-1b-fc-rSalesforce
0.0%
92 falcon3-1b-instructTII
0.0%
92 coalm-70bUiuc Oumi
0.0%
92 coalm-8bUiuc Oumi
0.0%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

Answering multi-step questions with a web-search tool.

What it does not measure

Not general research quality: questions have short, checkable answers.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.