Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

Declining to call a function when none of those offered fits.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: irrelevance detection, % correct, higher is better
#ModelBFCL: irrelevance detection
% correct, higher is better
1 ministral-8b-2410Mistral
100.0%
1 llama-3.1-nemotron-ultra-253b-v1NVIDIA
100.0%
3 bitagent-bounty-8bBittensor
97.5%
4 Claude Haiku 4.5Anthropic · claude-haiku-4.5
95.3%
5 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
95.0%
6 Gemini 2.5 FlashGoogle · gemini-2.5-flash
93.7%
7 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
93.3%
8 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
93.2%
9 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
92.5%
10 Mistral Medium 3Mistral · mistral-medium-3
92.0%
11 Gemini 2.5 FlashGoogle · gemini-2.5-flash
91.1%
12 GPT-5 MiniOpenAI · gpt-5-mini
91.0%
13 toolace-2-8bHuawei Noah And Ustc
90.8%
14 Claude Opus 4.5Anthropic · claude-opus-4.5
90.8%
15 hammer2.1-7bMadeagents
90.1%
16 GPT-5 NanoOpenAI · gpt-5-nano
89.1%
17 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
87.9%
18 Phi 4Microsoft · phi-4
87.5%
19 Kimi K2 0711Moonshot AI · kimi-k2
87.3%
20 falcon3-1b-instructTII
87.3%
21 GPT-5.2OpenAI · gpt-5.2
87.3%
22 Qwen3 14BAlibaba · qwen3-14b
87.2%
23 o4 MiniOpenAI · o4-mini
87.2%
24 coalm-8bUiuc Oumi
86.9%
25 command-a-reasoningCohere
86.8%
26 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
86.6%
27 GPT-4.1OpenAI · gpt-4.1
86.5%
28 o3OpenAI
86.1%
29 hammer2.1-3bMadeagents
86.1%
30 coalm-70bUiuc Oumi
85.7%
31 gemini-3-pro-previewGoogle
85.6%
32 Claude Haiku 4.5Anthropic · claude-haiku-4.5
85.1%
33 GLM 4.6Z.ai · glm-4.6
85.0%
34 qwen3-4b-instruct-2507Alibaba
84.9%
35 Claude Opus 4.5Anthropic · claude-opus-4.5
84.7%
36 grok-4-0709xAI
84.3%
37 Command ACohere · command-a
84.2%
38 GPT-4.1OpenAI · gpt-4.1
84.0%
39 o3OpenAI
84.0%
40 o4 MiniOpenAI · o4-mini
83.9%
41 GPT-4.1 NanoOpenAI · gpt-4.1-nano
83.4%
42 nanbeige4-3b-thinking-2511Nanbeige
83.1%
43 qwen3-0.6bAlibaba
82.5%
44 rzn-tPhronetic Ai
82.4%
45 Qwen3 32BAlibaba · qwen3-32b
82.4%
46 Qwen3 8BAlibaba · qwen3-8b
82.3%
47 arch-agent-32bKatanemo
82.2%
48 Nova 2 LiteAmazon · nova-2-lite-v1
82.1%
49 Qwen3 14BAlibaba · qwen3-14b
81.9%
50 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
81.7%
51 GPT-4.1 MiniOpenAI · gpt-4.1-mini
81.7%
52 Command R7B (12-2024)Cohere · command-r7b-12-2024
81.7%
53 palmyra-x-004Writer
81.0%
54 qwen3-0.6bAlibaba
80.8%
55 hammer2.1-0.5bMadeagents
80.8%
56 granite-3.2-8b-instructIBM
80.5%
57 xlam-2-32b-fc-rSalesforce
80.2%
58 granite-3.1-8b-instructIBM
80.0%
59 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
79.9%
60 grok-4-1-fast-reasoningxAI
79.4%
61 GPT-5.2OpenAI · gpt-5.2
79.4%
62 hammer2.1-1.5bMadeagents
79.4%
63 xlam-2-70b-fc-rSalesforce
79.1%
64 Qwen3 8BAlibaba · qwen3-8b
79.1%
65 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
78.9%
66 gemini-3-pro-previewGoogle
77.8%
67 qwen3-1.7bAlibaba
76.5%
68 Qwen3 32BAlibaba · qwen3-32b
76.4%
69 qwen3-4b-instruct-2507Alibaba
75.9%
70 grok-4-0709xAI
75.4%
71 granite-20b-functioncallingIBM
75.1%
72 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
74.8%
73 arch-agent-1.5bKatanemo
74.8%
74 arch-agent-3bKatanemo
74.7%
75 Mistral Medium 3Mistral · mistral-medium-3
74.5%
76 nanbeige3.5-pro-thinkingNanbeige
74.2%
77 grok-4-1-fast-non-reasoningxAI
74.1%
78 GPT-4.1 MiniOpenAI · gpt-4.1-mini
73.9%
79 minicpm3-4bOpenbmb
73.7%
80 Gemma 3 27BGoogle · gemma-3-27b-it
73.7%
81 minicpm3-4bOpenbmb
72.8%
82 Nova Micro 1.0Amazon · nova-micro-v1
70.7%
83 Gemma 3 12BGoogle · gemma-3-12b-it
70.3%
84 Nova Pro 1.0Amazon · nova-pro-v1
70.1%
85 mistral-large-2411Mistral
68.9%
86 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
67.0%
87 GPT-4.1 NanoOpenAI · gpt-4.1-nano
66.0%
88 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
65.7%
89 xlam-2-1b-fc-rSalesforce
64.5%
90 xlam-2-3b-fc-rSalesforce
63.5%
91 xlam-2-8b-fc-rSalesforce
63.3%
92 Mistral NemoMistral · mistral-nemo
61.8%
93 granite-4.0-350mIBM
60.8%
94 llama-4-maverick-17b-128e-instruct-fp8Meta
56.0%
95 GPT-5 MiniOpenAI · gpt-5-mini
55.7%
96 Gemma 3 4BGoogle · gemma-3-4b-it
53.9%
97 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
53.5%
98 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
52.1%
99 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
51.6%
100 GPT-5 NanoOpenAI · gpt-5-nano
45.8%
101 Llama 4 ScoutMeta · llama-4-scout
44.9%
102 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
42.7%
103 mistral-large-2411Mistral
38.8%
104 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
36.0%
105 gemma-3-1b-itGoogle
33.2%
106 falcon3-3b-instructTII
32.9%
107 falcon3-10b-instructTII
32.1%
108 falcon3-7b-instructTII
32.0%
109 Mistral NemoMistral · mistral-nemo
6.3%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

Declining to call a function when none of those offered fits.

What it does not measure

Not general refusal or safety behaviour.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.