Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4
Reported by Berkeley Function Calling Leaderboard (BFCL) V4
Berkeley Function Calling Leaderboard (BFCL) V4
Choosing the right function and arguments in one turn, on BFCL's curated set.
- Results dated
- 16 Dec 2025
- Models
- 109
- Unit
- % correct
- Licence
- Apache License 2.0
| # | Model | BFCL: single-turn calls (curated) % correct, higher is better |
|---|---|---|
| 1 | gemini-3-pro-previewGoogle |
90.7%
|
| 2 | Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507 |
90.3%
|
| 3 | Qwen3 32BAlibaba · qwen3-32b |
90.3%
|
| 4 | Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct |
89.7%
|
| 5 | Claude Opus 4.5Anthropic · claude-opus-4.5 |
89.7%
|
| 6 | xlam-2-32b-fc-rSalesforce |
89.6%
|
| 7 | Qwen3 14BAlibaba · qwen3-14b |
89.5%
|
| 8 | Llama 4 ScoutMeta · llama-4-scout |
89.4%
|
| 9 | Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507 |
88.9%
|
| 9 | arch-agent-32bKatanemo |
88.9%
|
| 11 | Qwen3 32BAlibaba · qwen3-32b |
88.8%
|
| 12 | GPT-4.1OpenAI · gpt-4.1 |
88.7%
|
| 13 | Claude Sonnet 4.5Anthropic · claude-sonnet-4.5 |
88.7%
|
| 13 | llama-4-maverick-17b-128e-instruct-fp8Meta |
88.7%
|
| 15 | Claude Opus 4.5Anthropic · claude-opus-4.5 |
88.6%
|
| 16 | Qwen3 8BAlibaba · qwen3-8b |
88.6%
|
| 17 | Mistral NemoMistral · mistral-nemo |
88.5%
|
| 18 | xlam-2-70b-fc-rSalesforce |
88.4%
|
| 19 | grok-4-1-fast-reasoningxAI |
88.3%
|
| 20 | grok-4-1-fast-non-reasoningxAI |
88.1%
|
| 21 | Gemini 2.5 FlashGoogle · gemini-2.5-flash |
88.1%
|
| 22 | Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct |
88.0%
|
| 23 | qwen3-4b-instruct-2507Alibaba |
87.9%
|
| 24 | Qwen3 8BAlibaba · qwen3-8b |
87.6%
|
| 25 | Command ACohere · command-a |
87.6%
|
| 25 | GLM 4.6Z.ai · glm-4.6 |
87.6%
|
| 27 | palmyra-x-004Writer |
87.5%
|
| 28 | Gemma 3 27BGoogle · gemma-3-27b-it |
87.2%
|
| 29 | toolace-2-8bHuawei Noah And Ustc |
87.1%
|
| 30 | Nova 2 LiteAmazon · nova-2-lite-v1 |
87.0%
|
| 31 | arch-agent-3bKatanemo |
86.7%
|
| 32 | Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite |
86.6%
|
| 33 | Nova Pro 1.0Amazon · nova-pro-v1 |
86.6%
|
| 34 | Claude Haiku 4.5Anthropic · claude-haiku-4.5 |
86.5%
|
| 35 | qwen3-4b-instruct-2507Alibaba |
86.4%
|
| 36 | command-a-reasoningCohere |
86.3%
|
| 37 | Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507 |
85.8%
|
| 38 | gemini-3-pro-previewGoogle |
85.8%
|
| 39 | DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp |
85.5%
|
| 40 | hammer2.1-7bMadeagents |
85.5%
|
| 41 | grok-4-0709xAI |
85.4%
|
| 42 | Mistral Medium 3Mistral · mistral-medium-3 |
85.3%
|
| 43 | falcon3-10b-instructTII |
85.0%
|
| 44 | Gemini 2.5 FlashGoogle · gemini-2.5-flash |
85.0%
|
| 44 | hammer2.1-3bMadeagents |
85.0%
|
| 46 | Qwen3 14BAlibaba · qwen3-14b |
84.9%
|
| 47 | coalm-8bUiuc Oumi |
84.9%
|
| 48 | mistral-large-2411Mistral |
84.7%
|
| 49 | GPT-4.1 MiniOpenAI · gpt-4.1-mini |
84.6%
|
| 50 | xlam-2-8b-fc-rSalesforce |
84.6%
|
| 51 | Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct |
84.0%
|
| 52 | Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite |
83.9%
|
| 53 | GPT-4.1 MiniOpenAI · gpt-4.1-mini |
83.8%
|
| 54 | coalm-70bUiuc Oumi |
83.4%
|
| 55 | mistral-large-2411Mistral |
83.0%
|
| 56 | hammer2.1-1.5bMadeagents |
83.0%
|
| 57 | xlam-2-3b-fc-rSalesforce |
83.0%
|
| 58 | qwen3-1.7bAlibaba |
82.9%
|
| 59 | Mistral NemoMistral · mistral-nemo |
82.8%
|
| 60 | GPT-4.1OpenAI · gpt-4.1 |
82.8%
|
| 61 | grok-4-0709xAI |
82.8%
|
| 62 | falcon3-7b-instructTII |
82.7%
|
| 63 | arch-agent-1.5bKatanemo |
82.7%
|
| 63 | Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct |
82.7%
|
| 65 | granite-20b-functioncallingIBM |
82.3%
|
| 66 | o3OpenAI |
81.9%
|
| 67 | GPT-5.2OpenAI · gpt-5.2 |
81.8%
|
| 68 | minicpm3-4bOpenbmb |
81.8%
|
| 69 | bitagent-bounty-8bBittensor |
81.6%
|
| 69 | Kimi K2 0711Moonshot AI · kimi-k2 |
81.6%
|
| 71 | nanbeige4-3b-thinking-2511Nanbeige |
81.6%
|
| 72 | bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh |
81.5%
|
| 73 | o4 MiniOpenAI · o4-mini |
81.3%
|
| 74 | Command R7B (12-2024)Cohere · command-r7b-12-2024 |
81.0%
|
| 75 | GPT-5 NanoOpenAI · gpt-5-nano |
80.8%
|
| 76 | granite-3.2-8b-instructIBM |
79.8%
|
| 77 | Gemma 3 12BGoogle · gemma-3-12b-it |
79.4%
|
| 78 | granite-3.1-8b-instructIBM |
78.3%
|
| 79 | GPT-5.2OpenAI · gpt-5.2 |
78.3%
|
| 80 | Nova Micro 1.0Amazon · nova-micro-v1 |
74.1%
|
| 81 | Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct |
73.6%
|
| 82 | GPT-4.1 NanoOpenAI · gpt-4.1-nano |
73.0%
|
| 83 | GPT-4.1 NanoOpenAI · gpt-4.1-nano |
72.4%
|
| 84 | qwen3-0.6bAlibaba |
71.8%
|
| 85 | minicpm3-4bOpenbmb |
70.5%
|
| 86 | qwen3-0.6bAlibaba |
70.0%
|
| 87 | GPT-5 MiniOpenAI · gpt-5-mini |
69.8%
|
| 88 | Phi 4Microsoft · phi-4 |
69.6%
|
| 89 | xlam-2-1b-fc-rSalesforce |
69.0%
|
| 90 | GPT-5 MiniOpenAI · gpt-5-mini |
68.0%
|
| 91 | GPT-5 NanoOpenAI · gpt-5-nano |
68.0%
|
| 92 | rzn-tPhronetic Ai |
67.9%
|
| 93 | granite-4.0-350mIBM |
67.9%
|
| 94 | Mistral Medium 3Mistral · mistral-medium-3 |
67.4%
|
| 95 | hammer2.1-0.5bMadeagents |
66.0%
|
| 96 | Gemma 3 4BGoogle · gemma-3-4b-it |
61.1%
|
| 97 | Claude Sonnet 4.5Anthropic · claude-sonnet-4.5 |
59.8%
|
| 98 | Claude Haiku 4.5Anthropic · claude-haiku-4.5 |
55.4%
|
| 99 | falcon3-3b-instructTII |
54.6%
|
| 100 | o3OpenAI |
40.4%
|
| 101 | Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct |
38.4%
|
| 102 | nanbeige3.5-pro-thinkingNanbeige |
38.4%
|
| 103 | o4 MiniOpenAI · o4-mini |
37.7%
|
| 104 | Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507 |
37.4%
|
| 105 | DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp |
34.9%
|
| 106 | gemma-3-1b-itGoogle |
20.2%
|
| 107 | falcon3-1b-instructTII |
9.0%
|
| 108 | ministral-8b-2410Mistral |
0.0%
|
| 108 | llama-3.1-nemotron-ultra-253b-v1NVIDIA |
0.0%
|
Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.
What it measures
Choosing the right function and arguments in one turn, on BFCL's curated set.
What it does not measure
Not reliability on your own tools: BFCL's functions and queries are a fixed test set, and a correct call is judged by its form, not by what it achieved.
Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.