Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

Making a call when a suitable function is available.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: relevance detection, % correct, higher is better
#ModelBFCL: relevance detection
% correct, higher is better
1 Gemma 3 4BGoogle · gemma-3-4b-it
100.0%
1 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
100.0%
1 llama-4-maverick-17b-128e-instruct-fp8Meta
100.0%
1 Llama 4 ScoutMeta · llama-4-scout
100.0%
1 nanbeige3.5-pro-thinkingNanbeige
100.0%
1 GPT-4.1OpenAI · gpt-4.1
100.0%
1 falcon3-7b-instructTII
100.0%
8 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
93.8%
8 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
93.8%
8 Qwen3 32BAlibaba · qwen3-32b
93.8%
8 Qwen3 8BAlibaba · qwen3-8b
93.8%
8 Nova Pro 1.0Amazon · nova-pro-v1
93.8%
8 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
93.8%
8 Gemma 3 12BGoogle · gemma-3-12b-it
93.8%
8 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
93.8%
8 mistral-large-2411Mistral
93.8%
8 mistral-large-2411Mistral
93.8%
8 Mistral NemoMistral · mistral-nemo
93.8%
8 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
93.8%
8 GPT-4.1 NanoOpenAI · gpt-4.1-nano
93.8%
8 GPT-5 MiniOpenAI · gpt-5-mini
93.8%
8 GPT-5 NanoOpenAI · gpt-5-nano
93.8%
8 o3OpenAI
93.8%
8 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
93.8%
8 falcon3-10b-instructTII
93.8%
8 coalm-70bUiuc Oumi
93.8%
27 Qwen3 14BAlibaba · qwen3-14b
87.5%
27 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
87.5%
27 qwen3-4b-instruct-2507Alibaba
87.5%
27 qwen3-4b-instruct-2507Alibaba
87.5%
27 granite-20b-functioncallingIBM
87.5%
27 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
87.5%
27 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
87.5%
27 GPT-4.1 MiniOpenAI · gpt-4.1-mini
87.5%
27 GPT-4.1OpenAI · gpt-4.1
87.5%
27 xlam-2-1b-fc-rSalesforce
87.5%
27 xlam-2-3b-fc-rSalesforce
87.5%
27 xlam-2-8b-fc-rSalesforce
87.5%
27 coalm-8bUiuc Oumi
87.5%
27 grok-4-0709xAI
87.5%
41 qwen3-1.7bAlibaba
81.2%
41 Qwen3 14BAlibaba · qwen3-14b
81.2%
41 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
81.2%
41 Qwen3 32BAlibaba · qwen3-32b
81.2%
41 Nova Micro 1.0Amazon · nova-micro-v1
81.2%
41 Command ACohere · command-a
81.2%
41 Gemma 3 27BGoogle · gemma-3-27b-it
81.2%
41 granite-4.0-350mIBM
81.2%
41 arch-agent-32bKatanemo
81.2%
41 Mistral NemoMistral · mistral-nemo
81.2%
41 GPT-4.1 MiniOpenAI · gpt-4.1-mini
81.2%
41 o3OpenAI
81.2%
41 o4 MiniOpenAI · o4-mini
81.2%
41 o4 MiniOpenAI · o4-mini
81.2%
41 rzn-tPhronetic Ai
81.2%
41 xlam-2-32b-fc-rSalesforce
81.2%
41 falcon3-3b-instructTII
81.2%
41 palmyra-x-004Writer
81.2%
41 grok-4-0709xAI
81.2%
41 grok-4-1-fast-non-reasoningxAI
81.2%
41 grok-4-1-fast-reasoningxAI
81.2%
62 qwen3-0.6bAlibaba
75.0%
62 qwen3-0.6bAlibaba
75.0%
62 Qwen3 8BAlibaba · qwen3-8b
75.0%
62 Nova 2 LiteAmazon · nova-2-lite-v1
75.0%
62 Gemini 2.5 FlashGoogle · gemini-2.5-flash
75.0%
62 gemini-3-pro-previewGoogle
75.0%
62 toolace-2-8bHuawei Noah And Ustc
75.0%
62 granite-3.2-8b-instructIBM
75.0%
62 arch-agent-1.5bKatanemo
75.0%
62 hammer2.1-1.5bMadeagents
75.0%
62 Mistral Medium 3Mistral · mistral-medium-3
75.0%
62 Kimi K2 0711Moonshot AI · kimi-k2
75.0%
62 nanbeige4-3b-thinking-2511Nanbeige
75.0%
62 GPT-5.2OpenAI · gpt-5.2
75.0%
62 GPT-5.2OpenAI · gpt-5.2
75.0%
62 GPT-5 NanoOpenAI · gpt-5-nano
75.0%
62 xlam-2-70b-fc-rSalesforce
75.0%
62 GLM 4.6Z.ai · glm-4.6
75.0%
80 Claude Opus 4.5Anthropic · claude-opus-4.5
68.8%
80 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
68.8%
80 bitagent-bounty-8bBittensor
68.8%
80 command-a-reasoningCohere
68.8%
80 Command R7B (12-2024)Cohere · command-r7b-12-2024
68.8%
80 gemini-3-pro-previewGoogle
68.8%
80 granite-3.1-8b-instructIBM
68.8%
80 arch-agent-3bKatanemo
68.8%
80 hammer2.1-0.5bMadeagents
68.8%
80 GPT-4.1 NanoOpenAI · gpt-4.1-nano
68.8%
80 minicpm3-4bOpenbmb
68.8%
91 Claude Haiku 4.5Anthropic · claude-haiku-4.5
62.5%
91 Claude Opus 4.5Anthropic · claude-opus-4.5
62.5%
91 Gemini 2.5 FlashGoogle · gemini-2.5-flash
62.5%
91 Mistral Medium 3Mistral · mistral-medium-3
62.5%
91 GPT-5 MiniOpenAI · gpt-5-mini
62.5%
96 hammer2.1-3bMadeagents
56.2%
96 minicpm3-4bOpenbmb
56.2%
98 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
50.0%
98 hammer2.1-7bMadeagents
50.0%
98 Phi 4Microsoft · phi-4
50.0%
101 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
43.8%
101 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
43.8%
103 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
37.5%
103 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
37.5%
103 gemma-3-1b-itGoogle
37.5%
106 Claude Haiku 4.5Anthropic · claude-haiku-4.5
31.2%
107 ministral-8b-2410Mistral
0.0%
107 llama-3.1-nemotron-ultra-253b-v1NVIDIA
0.0%
107 falcon3-1b-instructTII
0.0%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

Making a call when a suitable function is available.

What it does not measure

Not whether the call itself was right; only that one was attempted.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.