Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4
Reported by Berkeley Function Calling Leaderboard (BFCL) V4
Berkeley Function Calling Leaderboard (BFCL) V4
Declining to call a function when none of those offered fits.
- Results dated
- 16 Dec 2025
- Models
- 109
- Unit
- % correct
- Licence
- Apache License 2.0
| # | Model | BFCL: irrelevance detection % correct, higher is better |
|---|---|---|
| 1 | ministral-8b-2410Mistral |
100.0%
|
| 1 | llama-3.1-nemotron-ultra-253b-v1NVIDIA |
100.0%
|
| 3 | bitagent-bounty-8bBittensor |
97.5%
|
| 4 | Claude Haiku 4.5Anthropic · claude-haiku-4.5 |
95.3%
|
| 5 | Claude Sonnet 4.5Anthropic · claude-sonnet-4.5 |
95.0%
|
| 6 | Gemini 2.5 FlashGoogle · gemini-2.5-flash |
93.7%
|
| 7 | Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite |
93.3%
|
| 8 | DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp |
93.2%
|
| 9 | Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite |
92.5%
|
| 10 | Mistral Medium 3Mistral · mistral-medium-3 |
92.0%
|
| 11 | Gemini 2.5 FlashGoogle · gemini-2.5-flash |
91.1%
|
| 12 | GPT-5 MiniOpenAI · gpt-5-mini |
91.0%
|
| 13 | toolace-2-8bHuawei Noah And Ustc |
90.8%
|
| 14 | Claude Opus 4.5Anthropic · claude-opus-4.5 |
90.8%
|
| 15 | hammer2.1-7bMadeagents |
90.1%
|
| 16 | GPT-5 NanoOpenAI · gpt-5-nano |
89.1%
|
| 17 | Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct |
87.9%
|
| 18 | Phi 4Microsoft · phi-4 |
87.5%
|
| 19 | Kimi K2 0711Moonshot AI · kimi-k2 |
87.3%
|
| 20 | falcon3-1b-instructTII |
87.3%
|
| 21 | GPT-5.2OpenAI · gpt-5.2 |
87.3%
|
| 22 | Qwen3 14BAlibaba · qwen3-14b |
87.2%
|
| 23 | o4 MiniOpenAI · o4-mini |
87.2%
|
| 24 | coalm-8bUiuc Oumi |
86.9%
|
| 25 | command-a-reasoningCohere |
86.8%
|
| 26 | Claude Sonnet 4.5Anthropic · claude-sonnet-4.5 |
86.6%
|
| 27 | GPT-4.1OpenAI · gpt-4.1 |
86.5%
|
| 28 | o3OpenAI |
86.1%
|
| 29 | hammer2.1-3bMadeagents |
86.1%
|
| 30 | coalm-70bUiuc Oumi |
85.7%
|
| 31 | gemini-3-pro-previewGoogle |
85.6%
|
| 32 | Claude Haiku 4.5Anthropic · claude-haiku-4.5 |
85.1%
|
| 33 | GLM 4.6Z.ai · glm-4.6 |
85.0%
|
| 34 | qwen3-4b-instruct-2507Alibaba |
84.9%
|
| 35 | Claude Opus 4.5Anthropic · claude-opus-4.5 |
84.7%
|
| 36 | grok-4-0709xAI |
84.3%
|
| 37 | Command ACohere · command-a |
84.2%
|
| 38 | GPT-4.1OpenAI · gpt-4.1 |
84.0%
|
| 39 | o3OpenAI |
84.0%
|
| 40 | o4 MiniOpenAI · o4-mini |
83.9%
|
| 41 | GPT-4.1 NanoOpenAI · gpt-4.1-nano |
83.4%
|
| 42 | nanbeige4-3b-thinking-2511Nanbeige |
83.1%
|
| 43 | qwen3-0.6bAlibaba |
82.5%
|
| 44 | rzn-tPhronetic Ai |
82.4%
|
| 45 | Qwen3 32BAlibaba · qwen3-32b |
82.4%
|
| 46 | Qwen3 8BAlibaba · qwen3-8b |
82.3%
|
| 47 | arch-agent-32bKatanemo |
82.2%
|
| 48 | Nova 2 LiteAmazon · nova-2-lite-v1 |
82.1%
|
| 49 | Qwen3 14BAlibaba · qwen3-14b |
81.9%
|
| 50 | Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507 |
81.7%
|
| 51 | GPT-4.1 MiniOpenAI · gpt-4.1-mini |
81.7%
|
| 52 | Command R7B (12-2024)Cohere · command-r7b-12-2024 |
81.7%
|
| 53 | palmyra-x-004Writer |
81.0%
|
| 54 | qwen3-0.6bAlibaba |
80.8%
|
| 55 | hammer2.1-0.5bMadeagents |
80.8%
|
| 56 | granite-3.2-8b-instructIBM |
80.5%
|
| 57 | xlam-2-32b-fc-rSalesforce |
80.2%
|
| 58 | granite-3.1-8b-instructIBM |
80.0%
|
| 59 | Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507 |
79.9%
|
| 60 | grok-4-1-fast-reasoningxAI |
79.4%
|
| 61 | GPT-5.2OpenAI · gpt-5.2 |
79.4%
|
| 62 | hammer2.1-1.5bMadeagents |
79.4%
|
| 63 | xlam-2-70b-fc-rSalesforce |
79.1%
|
| 64 | Qwen3 8BAlibaba · qwen3-8b |
79.1%
|
| 65 | Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507 |
78.9%
|
| 66 | gemini-3-pro-previewGoogle |
77.8%
|
| 67 | qwen3-1.7bAlibaba |
76.5%
|
| 68 | Qwen3 32BAlibaba · qwen3-32b |
76.4%
|
| 69 | qwen3-4b-instruct-2507Alibaba |
75.9%
|
| 70 | grok-4-0709xAI |
75.4%
|
| 71 | granite-20b-functioncallingIBM |
75.1%
|
| 72 | Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507 |
74.8%
|
| 73 | arch-agent-1.5bKatanemo |
74.8%
|
| 74 | arch-agent-3bKatanemo |
74.7%
|
| 75 | Mistral Medium 3Mistral · mistral-medium-3 |
74.5%
|
| 76 | nanbeige3.5-pro-thinkingNanbeige |
74.2%
|
| 77 | grok-4-1-fast-non-reasoningxAI |
74.1%
|
| 78 | GPT-4.1 MiniOpenAI · gpt-4.1-mini |
73.9%
|
| 79 | minicpm3-4bOpenbmb |
73.7%
|
| 80 | Gemma 3 27BGoogle · gemma-3-27b-it |
73.7%
|
| 81 | minicpm3-4bOpenbmb |
72.8%
|
| 82 | Nova Micro 1.0Amazon · nova-micro-v1 |
70.7%
|
| 83 | Gemma 3 12BGoogle · gemma-3-12b-it |
70.3%
|
| 84 | Nova Pro 1.0Amazon · nova-pro-v1 |
70.1%
|
| 85 | mistral-large-2411Mistral |
68.9%
|
| 86 | DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp |
67.0%
|
| 87 | GPT-4.1 NanoOpenAI · gpt-4.1-nano |
66.0%
|
| 88 | Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct |
65.7%
|
| 89 | xlam-2-1b-fc-rSalesforce |
64.5%
|
| 90 | xlam-2-3b-fc-rSalesforce |
63.5%
|
| 91 | xlam-2-8b-fc-rSalesforce |
63.3%
|
| 92 | Mistral NemoMistral · mistral-nemo |
61.8%
|
| 93 | granite-4.0-350mIBM |
60.8%
|
| 94 | llama-4-maverick-17b-128e-instruct-fp8Meta |
56.0%
|
| 95 | GPT-5 MiniOpenAI · gpt-5-mini |
55.7%
|
| 96 | Gemma 3 4BGoogle · gemma-3-4b-it |
53.9%
|
| 97 | Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct |
53.5%
|
| 98 | Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct |
52.1%
|
| 99 | Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct |
51.6%
|
| 100 | GPT-5 NanoOpenAI · gpt-5-nano |
45.8%
|
| 101 | Llama 4 ScoutMeta · llama-4-scout |
44.9%
|
| 102 | Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct |
42.7%
|
| 103 | mistral-large-2411Mistral |
38.8%
|
| 104 | bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh |
36.0%
|
| 105 | gemma-3-1b-itGoogle |
33.2%
|
| 106 | falcon3-3b-instructTII |
32.9%
|
| 107 | falcon3-10b-instructTII |
32.1%
|
| 108 | falcon3-7b-instructTII |
32.0%
|
| 109 | Mistral NemoMistral · mistral-nemo |
6.3%
|
Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.
What it measures
Declining to call a function when none of those offered fits.
What it does not measure
Not general refusal or safety behaviour.
Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.