Benchmarks / Artificial Analysis

Reported by Artificial Analysis

Artificial Analysis

Share of Terminal-Bench 2.1 tasks completed, as run by Artificial Analysis with its own harness and prompts.

Last updated 8 Oct 2026

Results dated
8 Oct 2026
Results
187 configurations of 130 models
Unit
% of tasks
Licence
Artificial Analysis commercial data licence

Terminal-Bench 2.1: Gemini 3.8 Flash

Top 15 of 187 results · % of tasks, higher is better. Choose a model to highlight it.Clear highlight

  1. 1 Claude Fable 5.1 (max reasoning)Anthropic 91.4%
  2. 2 Claude Fable 5.1 (extra-high reasoning)Anthropic 91.0%
  3. 3 Claude Fable 5.1 (high reasoning)Anthropic 89.9%
  4. 3 GPT-6 Astra (high reasoning)OpenAI 89.9%
  5. 5 GPT-5.6 Sol (extra-high reasoning)OpenAI 89.5%
  6. 5 GPT-6 Astra (medium reasoning)OpenAI 89.5%
  7. 7 Claude Opus 5 (max reasoning)Anthropic 89.1%
  8. 7 GPT-6 Astra (extra-high reasoning)OpenAI 89.1%
  9. 9 Qwen3.8-Max (0902)Alibaba 88.8%
  10. 10 GPT-6 Astra (max reasoning)OpenAI 88.4%
  11. 10 Grok 4.6 (high reasoning)xAI 88.4%
  12. 12 Claude Fable 5.1 (medium reasoning)Anthropic 88.0%
  13. 12 Claude Opus 5 (extra-high reasoning)Anthropic 88.0%
  14. 12 GPT-5.6 Sol (max reasoning)OpenAI 88.0%
  15. 12 GPT-5.6 Terra (max reasoning)OpenAI 88.0%
  16. 18 Gemini 3.8 Flash (high reasoning)Google 87.6%
  17. 34 Gemini 3.8 Flash (medium reasoning)Google 83.9%
  18. 36 Gemini 3.8 Flash (low reasoning)Google 83.1%

Full results

Artificial Analysis: Terminal-Bench 2.1, % of tasks, higher is better
#ModelTerminal-Bench 2.1
% of tasks, higher is better
Price
$ per million tokens, in / out
1 Claude Fable 5.1 (max reasoning)Anthropic
91.4%
$10 / $50
2 Claude Fable 5.1 (extra-high reasoning)Anthropic
91.0%
$10 / $50
3 Claude Fable 5.1 (high reasoning)Anthropic
89.9%
$10 / $50
3 GPT-6 Astra (high reasoning)OpenAI
89.9%
$10 / $50
5 GPT-5.6 Sol (extra-high reasoning)OpenAI
89.5%
$4 / $20
5 GPT-6 Astra (medium reasoning)OpenAI
89.5%
$10 / $50
7 Claude Opus 5 (max reasoning)Anthropic
89.1%
$5 / $25
7 GPT-6 Astra (extra-high reasoning)OpenAI
89.1%
$10 / $50
9 Qwen3.8-Max (0902)Alibaba
88.8%
$2 / $6
10 GPT-6 Astra (max reasoning)OpenAI
88.4%
$10 / $50
10 Grok 4.6 (high reasoning)xAI
88.4%
$2 / $6
12 Claude Fable 5.1 (medium reasoning)Anthropic
88.0%
$10 / $50
12 Claude Opus 5 (extra-high reasoning)Anthropic
88.0%
$5 / $25
12 GPT-5.6 Sol (max reasoning)OpenAI
88.0%
$4 / $20
12 GPT-5.6 Terra (max reasoning)OpenAI
88.0%
$2 / $12
12 GPT-6 Astra (low reasoning)OpenAI
88.0%
$10 / $50
12 Grok 4.6 (extra-high reasoning)xAI
88.0%
$2 / $6
18 Claude Opus 5 (high reasoning)Anthropic
87.6%
$5 / $25
18 Gemini 3.8 Flash (high reasoning)Google
87.6%
$1.50 / $7.50
20 GPT-5.6 Sol (high reasoning)OpenAI
87.3%
$4 / $20
21 Qwen3.8-Flash-NextAlibaba
86.1%
–
21 Claude Opus 5 (medium reasoning)Anthropic
86.1%
$5 / $25
21 GPT-5.6 Sol (medium reasoning)OpenAI
86.1%
$4 / $20
24 Gemini 3.7 Flash (high reasoning)Google
85.8%
$1.50 / $7.50
25 Muse Spark 1.3 (extra-high reasoning)Meta
85.4%
$1.25 / $4.25
26 Claude Fable 5.1 (low reasoning)Anthropic
85.0%
$10 / $50
26 Kimi K3 (max reasoning)Moonshot AI
85.0%
$3 / $15
28 Claude Fable 5 (max reasoning)Anthropic
84.6%
$10 / $50
28 Claude Opus 4.8 (max reasoning)Anthropic
84.6%
$5 / $25
30 Muse Spark 1.3 (max reasoning)Meta
84.3%
$1.25 / $4.25
30 GPT-5.5 (extra-high reasoning)OpenAI
84.3%
$5 / $30
30 Grok 4.6 (medium reasoning)xAI
84.3%
$2 / $6
30 GLM-5.3-FlashZ.ai
84.3%
$0.15 / $0.50
34 Gemini 3.8 Flash (medium reasoning)Google
83.9%
$1.50 / $7.50
34 GLM-5.3 (max reasoning)Z.ai
83.9%
$1.40 / $4.40
36 Claude Opus 4.7 (max reasoning)Anthropic
83.1%
$5 / $25
36 Gemini 3.8 Flash (low reasoning)Google
83.1%
$1.50 / $7.50
38 Kimi K3 (low reasoning)Moonshot AI
82.4%
$3 / $15
39 Qwen3.8-2.4T-A95BAlibaba
82.0%
$2 / $6
40 Grok 4.5 (high reasoning)xAI
81.6%
$2 / $6
41 Qwen3.8-Max (0803)Alibaba
81.3%
–
42 GPT-5.6 Luna (max reasoning)OpenAI
80.9%
$0.20 / $1.20
43 Claude Sonnet 5 (max reasoning)Anthropic
80.5%
$2 / $10
43 GPT-5.5 (medium reasoning)OpenAI
80.5%
$5 / $30
45 Muse Spark 1.2 (extra-high reasoning)Meta
80.2%
$1.25 / $4.25
45 GPT-5.6 Terra (extra-high reasoning)OpenAI
80.2%
$2 / $12
47 Qwen3.8-27B (extra-high reasoning)Alibaba
79.8%
$0.50 / $3
47 Gemini 3.7 Flash (low reasoning)Google
79.8%
$1.50 / $7.50
49 GPT-5.5 (high reasoning)OpenAI
79.4%
$5 / $30
50 DeepSeek-V4-Flash (0731, max reasoning)DeepSeek
78.7%
$0.14 / $0.28
50 DeepSeek-V4-Pro (0813, max reasoning)DeepSeek
78.7%
$1.32 / $3.96
50 Gemini 3.5 Flash (high reasoning)Google
78.7%
$1.50 / $9
53 Gemini 3.7 Flash (medium reasoning)Google
78.3%
$1.50 / $7.50
53 GPT-5.4 (extra-high reasoning)OpenAI
78.3%
$2.50 / $15
55 Muse Spark 1.1 (extra-high reasoning)Meta
77.9%
$1.25 / $4.25
55 GPT-5.6 Luna (extra-high reasoning)OpenAI
77.9%
$0.20 / $1.20
55 GLM-5.2 (max reasoning)Z.ai
77.9%
$1.40 / $4.40
58 Gemini 3.6 Flash (high reasoning)Google
77.5%
$1.50 / $7.50
59 GPT-5.6 Sol (low reasoning)OpenAI
76.8%
$4 / $20
60 Claude Opus 5 (low reasoning)Anthropic
76.4%
$5 / $25
61 GPT-5.6 Terra (high reasoning)OpenAI
75.7%
$2 / $12
62 Claude Sonnet 5 (no reasoning)Anthropic
75.3%
$2 / $10
62 Grok 4.6 (low reasoning)xAI
75.3%
$2 / $6
64 Qwen3.7-MaxAlibaba
74.5%
$1.48 / $4.42
65 DeepSeek-V4-Flash-Vision-Exp (max reasoning)DeepSeek
74.2%
$0.44 / $1.32
65 GPT-5.6 Sol (no reasoning)OpenAI
74.2%
$4 / $20
67 Gemini 3.1 Pro PreviewGoogle
73.8%
$2 / $12
68 GPT-5.6 Terra (medium reasoning)OpenAI
72.3%
$2 / $12
69 Claude Sonnet 4.6 (max reasoning)Anthropic
71.2%
$3 / $15
70 GPT-5.6 Luna (high reasoning)OpenAI
69.7%
$0.20 / $1.20
71 Qwen3.8-27B (low reasoning)Alibaba
67.4%
$0.50 / $3
71 Kimi K2.7 CodeMoonshot AI
67.4%
$0.95 / $4
73 Kimi K2.6Moonshot AI
65.9%
$0.95 / $4
74 GPT-5.5 (low reasoning)OpenAI
65.5%
$5 / $30
75 Qwen3.8-27B (medium reasoning)Alibaba
65.2%
$0.50 / $3
75 MiniMax-M3MiniMax
65.2%
$0.30 / $1.20
75 MiMo-V2.5-Pro (reasoning on)Xiaomi
65.2%
$0.43 / $0.87
78 DeepSeek-V4-Pro (0423, high reasoning)DeepSeek
64.8%
$1.42 / $2.83
79 Hy3Tencent
64.4%
$0.14 / $0.58
80 DeepSeek-V4-Pro (0423, max reasoning)DeepSeek
64.0%
$1.42 / $2.83
81 MiMo-V2.5Xiaomi
63.7%
$0.17 / $0.34
82 GPT-5.6 Terra (low reasoning)OpenAI
62.5%
$2 / $12
83 Muse SparkMeta
62.2%
–
84 DeepSeek-V4-Flash (0423, max reasoning)DeepSeek
61.8%
$0.14 / $0.28
84 GLM-5.1Z.ai
61.8%
$1.38 / $4.40
86 Qwen3.6-PlusAlibaba
61.4%
$0.33 / $1.95
87 Qwen3.7-PlusAlibaba
61.0%
$0.32 / $1.28
87 GPT-5.5 (no reasoning)OpenAI
61.0%
$5 / $30
89 Qwen3.6-27BAlibaba
60.7%
$0.30 / $3.20
89 GPT-5.4 nano (extra-high reasoning)OpenAI
60.7%
$0.20 / $1.25
91 GPT-5.4 mini (extra-high reasoning)OpenAI
59.2%
$0.75 / $4.50
92 Solar Pro 4Upstage
57.3%
$0.09 / $0.36
93 DeepSeek-V4-Flash (0423, high reasoning)DeepSeek
56.9%
$0.14 / $0.28
94 GPT-5.6 Terra (no reasoning)OpenAI
56.2%
$2 / $12
95 Claude Sonnet 4.5 (reasoning on)Anthropic
55.8%
$3 / $15
96 MiniMax-M2.7MiniMax
55.4%
$0.30 / $1.20
97 Inkling SmallThinking Machines
55.1%
$0.45 / $1.20
97 Inkling (extra-high reasoning)Thinking Machines
55.1%
$0.95 / $4.05
99 Gemini 3.5 Flash-LiteGoogle
53.6%
$0.30 / $2.50
100 GPT-5.6 Luna (medium reasoning)OpenAI
53.2%
$0.20 / $1.20
101 GPT-5.1 (high reasoning)OpenAI
52.4%
$1.25 / $10
102 Grok Build 0.1xAI
52.1%
$1 / $2
103 Muse Glimmer (high reasoning)Meta
51.7%
–
103 GLM-5.2 (no reasoning)Z.ai
51.7%
$1.40 / $4.40
105 Qwen3.5-397B-A17BAlibaba
51.3%
$0.55 / $3.50
105 Qwen3.6-27B (no reasoning)Alibaba
51.3%
$0.30 / $3.20
107 Mistral Medium 3.5Mistral AI
50.6%
$1.50 / $7.50
108 GLM-4.6 (reasoning on)Z.ai
49.4%
$0.50 / $2
109 Qwen3.8-27B (no reasoning)Alibaba
49.1%
$0.50 / $3
110 Qwen3.5-122B-A10BAlibaba
47.6%
$0.26 / $2.08
111 Qwen3.5-122B-A10B (no reasoning)Alibaba
47.2%
$0.26 / $2.08
112 DeepSeek-V3.2 (reasoning on)DeepSeek
46.8%
$0.30 / $0.96
113 Kimi K2.5Moonshot AI
45.7%
$0.57 / $2.85
114 GLM-4.7Z.ai
45.3%
$0.54 / $1.98
115 Qwen3.6-35B-A3BAlibaba
44.9%
$0.10 / $1
115 DeepSeek-V3.1-Terminus (reasoning on)DeepSeek
44.9%
$0.27 / $1
117 Claude Haiku 4.5 (reasoning on)Anthropic
44.2%
$1 / $5
118 Gemma 4 31BGoogle
43.4%
$0.14 / $0.40
118 GPT-5.6 Luna (low reasoning)OpenAI
43.4%
$0.20 / $1.20
120 Qwen3.6-35B-A3B (no reasoning)Alibaba
41.6%
$0.10 / $1
121 Qwen3.5-35B-A3B (no reasoning)Alibaba
40.8%
$0.16 / $1.30
122 Grok 4.3 (high reasoning)xAI
39.7%
$1.25 / $2.50
123 Gemma 4 26B A4BGoogle
39.0%
$0.10 / $0.30
123 GPT-5.6 Luna (no reasoning)OpenAI
39.0%
$0.20 / $1.20
125 Nemotron 3 Super 120B A12BNVIDIA
38.6%
$0.085 / $0.40
126 Qwen3-Coder-NextAlibaba
38.2%
$0.18 / $0.90
127 Claude Sonnet 4 (reasoning on)Anthropic
36.3%
$3 / $15
128 GPT-5 (high reasoning)OpenAI
35.2%
$1.25 / $10
129 GPT-5.5 Instant (2026-06-26)OpenAI
34.8%
–
130 Grok 4.3 (no reasoning)xAI
34.1%
$1.25 / $2.50
131 Gemini 3.1 Flash-Lite PreviewGoogle
31.1%
$0.25 / $1.50
132 Devstral 2Mistral AI
30.3%
$0.40 / $2
133 Devstral Small 2Mistral AI
29.6%
–
134 Qwen3.5-9BAlibaba
29.2%
$0.10 / $0.15
134 Gemma 4 31B (no reasoning)Google
29.2%
$0.14 / $0.40
136 Gemini 2.5 ProGoogle
28.5%
$1.25 / $10
137 Gemma 4 12BGoogle
27.3%
–
137 Mercury 2Inception
27.3%
$0.25 / $0.75
139 Mistral Small 3.1 24BMistral AI
26.2%
$0.35 / $0.56
139 gpt-oss-120b (high reasoning)OpenAI
26.2%
$0.15 / $0.60
141 Qwen3.5-4B (reasoning on)Alibaba
25.8%
–
142 Qwen3.5-4B (no reasoning)Alibaba
21.3%
–
142 Qwen3.5-9B (no reasoning)Alibaba
21.3%
$0.10 / $0.15
144 Mistral Small 4Mistral AI
21.0%
$0.15 / $0.60
145 Trinity Large ThinkingArcee AI
20.6%
$0.25 / $0.80
146 DeepSeek-R1DeepSeek
19.1%
$0.70 / $2.50
147 Granite 4.2 8BIBM
18.4%
$0.06 / $0.25
148 DeepSeek-V3DeepSeek
16.9%
$0.26 / $1.03
149 Nova 2 Lite (high reasoning)Amazon
16.1%
$0.30 / $2.50
150 DeepSeek-V3-0324DeepSeek
13.9%
$0.25 / $1
150 Mistral Medium 3.1Mistral AI
13.9%
$0.40 / $2
150 gpt-oss-120b (low reasoning)OpenAI
13.9%
$0.15 / $0.60
150 gpt-oss-20b (high reasoning)OpenAI
13.9%
$0.03 / $0.15
154 DiffusionGemma 26B A4BGoogle
12.4%
–
154 Magistral Medium 1.2Mistral AI
12.4%
–
156 Qwen3-235B-A22B-Thinking-2507Alibaba
12.0%
$0.30 / $3
156 Mistral Large 3Mistral AI
12.0%
$0.50 / $1.50
156 Solar Pro 3Upstage
12.0%
$0.15 / $0.60
159 GPT-4.1 miniOpenAI
10.1%
$0.40 / $1.60
160 Ministral 3 14BMistral AI
9.7%
$0.20 / $0.20
161 Llama 4 MaverickMeta
7.9%
$0.27 / $0.85
162 Qwen3-Next-80B-A3B-ThinkingAlibaba
6.7%
$0.15 / $1.20
162 Nemotron 3 Nano 30B A3B (reasoning on)NVIDIA
6.7%
$0.05 / $0.20
164 Mistral Small 3.2 24BMistral AI
5.6%
$0.094 / $0.25
164 GPT-4o mini (2024-07-18)OpenAI
5.6%
$0.15 / $0.60
166 Qwen3-32B (reasoning on)Alibaba
5.2%
$0.14 / $0.40
167 Qwen3-14B (reasoning on)Alibaba
4.9%
$0.12 / $0.24
167 Llama 3.3 70B InstructMeta
4.9%
$0.59 / $0.79
169 Gemma 3 27BGoogle
4.5%
$0.12 / $0.20
169 Magistral Small 1.2Mistral AI
4.5%
–
169 o3-mini (high reasoning)OpenAI
4.5%
$1.10 / $4.40
172 Ministral 3 8BMistral AI
4.1%
$0.15 / $0.15
173 Llama 4 ScoutMeta
3.7%
$0.18 / $0.59
173 GPT-4.1 nanoOpenAI
3.7%
$0.10 / $0.40
173 GPT-5 mini (high reasoning)OpenAI
3.7%
$0.25 / $2
176 Qwen3.5-2B (reasoning on)Alibaba
3.0%
–
177 Qwen3-8B (reasoning on)Alibaba
2.2%
$0.12 / $0.46
178 Gemma 4 E4BGoogle
1.9%
–
179 Qwen3-30B-A3B-Thinking-2507Alibaba
1.5%
$0.20 / $2.40
179 Llama 3.1 8B InstructMeta
1.5%
$0.05 / $0.08
181 Qwen3.5-0.8B (no reasoning)Alibaba
0.4%
–
181 Gemma 3 4BGoogle
0.4%
$0.05 / $0.10
181 Gemma 4 E2BGoogle
0.4%
–
184 Qwen3.5-0.8B (reasoning on)Alibaba
0.0%
–
184 Qwen3.5-2B (no reasoning)Alibaba
0.0%
–
184 Gemma 3 12BGoogle
0.0%
$0.05 / $0.15
184 Ministral 3 3BMistral AI
0.0%
$0.10 / $0.10

Swipe the table sideways for more columns.

Ranks follow the score as shown, so equal numbers share a rank. Results as published by Artificial Analysis; we do not re-run them.

What it measures

Share of Terminal-Bench 2.1 tasks completed, as run by Artificial Analysis with its own harness and prompts.

What it does not measure

Not other harnesses or tools; superseded by 4.0 for newer models.

282 results from Artificial Analysis not ranked here · show why

We rank a result only when we can tie it to a specific model you can use. These are left out:

  • Not on sale through the API providers we track: 268
  • A different snapshot or variant from the model we list: 13
  • An unusual combination of settings: 1

Data sourced from Artificial Analysis. Licence: Artificial Analysis commercial data licence.