Benchmarks / Artificial Analysis

Reported by Artificial Analysis

Artificial Analysis

Share of the hardest Terminal-Bench tasks completed, as run by Artificial Analysis with its own harness and prompts.

Last updated 8 Oct 2026

Results dated
8 Oct 2026
Results
282 configurations of 190 models
Unit
% of tasks
Licence
Artificial Analysis commercial data licence

Terminal-Bench Hard: Qwen3.5-Omni-Plus

Top 15 of 282 results · % of tasks, higher is better. Choose a model to highlight it.Clear highlight

  1. 1 GPT-5.6 Sol (max reasoning)OpenAI 65.9%
  2. 2 Claude Fable 5 (max reasoning)Anthropic 62.9%
  3. 2 GPT-5.6 Sol (medium reasoning)OpenAI 62.9%
  4. 2 GPT-5.6 Terra (extra-high reasoning)OpenAI 62.9%
  5. 5 GPT-5.6 Sol (high reasoning)OpenAI 62.1%
  6. 6 GPT-5.6 Sol (extra-high reasoning)OpenAI 61.4%
  7. 7 GPT-5.5 (extra-high reasoning)OpenAI 60.6%
  8. 7 GPT-5.6 Sol (low reasoning)OpenAI 60.6%
  9. 9 GPT-5.5 (high reasoning)OpenAI 59.8%
  10. 10 Claude Opus 4.8 (max reasoning)Anthropic 58.3%
  11. 11 GPT-5.4 (extra-high reasoning)OpenAI 57.6%
  12. 11 GPT-5.5 (medium reasoning)OpenAI 57.6%
  13. 11 GPT-5.6 Terra (high reasoning)OpenAI 57.6%
  14. 11 GPT-5.6 Terra (max reasoning)OpenAI 57.6%
  15. 15 Claude Opus 4.7 (no reasoning)Anthropic 54.5%
  16. 145 Qwen3.5-Omni-PlusAlibaba 21.2%

Full results

Artificial Analysis: Terminal-Bench Hard, % of tasks, higher is better
#ModelTerminal-Bench Hard
% of tasks, higher is better
Price
$ per million tokens, in / out
1 GPT-5.6 Sol (max reasoning)OpenAI
65.9%
$4 / $20
2 Claude Fable 5 (max reasoning)Anthropic
62.9%
$10 / $50
2 GPT-5.6 Sol (medium reasoning)OpenAI
62.9%
$4 / $20
2 GPT-5.6 Terra (extra-high reasoning)OpenAI
62.9%
$2 / $12
5 GPT-5.6 Sol (high reasoning)OpenAI
62.1%
$4 / $20
6 GPT-5.6 Sol (extra-high reasoning)OpenAI
61.4%
$4 / $20
7 GPT-5.5 (extra-high reasoning)OpenAI
60.6%
$5 / $30
7 GPT-5.6 Sol (low reasoning)OpenAI
60.6%
$4 / $20
9 GPT-5.5 (high reasoning)OpenAI
59.8%
$5 / $30
10 Claude Opus 4.8 (max reasoning)Anthropic
58.3%
$5 / $25
11 GPT-5.4 (extra-high reasoning)OpenAI
57.6%
$2.50 / $15
11 GPT-5.5 (medium reasoning)OpenAI
57.6%
$5 / $30
11 GPT-5.6 Terra (high reasoning)OpenAI
57.6%
$2 / $12
11 GPT-5.6 Terra (max reasoning)OpenAI
57.6%
$2 / $12
15 Claude Opus 4.7 (no reasoning)Anthropic
54.5%
$5 / $25
16 Gemini 3.1 Pro PreviewGoogle
53.8%
$2 / $12
17 Claude Sonnet 4.6 (max reasoning)Anthropic
53.0%
$3 / $15
17 GPT-5.3-Codex (extra-high reasoning)OpenAI
53.0%
$1.75 / $14
19 GPT-5.4 mini (extra-high reasoning)OpenAI
52.3%
$0.75 / $4.50
19 GPT-5.5 (low reasoning)OpenAI
52.3%
$5 / $30
21 Claude Opus 4.7 (max reasoning)Anthropic
51.5%
$5 / $25
22 Qwen3.7-MaxAlibaba
50.8%
$1.48 / $4.42
22 GLM-5.2 (max reasoning)Z.ai
50.8%
$1.40 / $4.40
24 GPT-5.5 (no reasoning)OpenAI
49.2%
$5 / $30
25 Claude Opus 4.6 (no reasoning)Anthropic
48.5%
$5 / $25
26 Qwen3.7-PlusAlibaba
47.0%
$0.32 / $1.28
26 Claude Opus 4.5 (reasoning on)Anthropic
47.0%
$5 / $25
26 GPT-5.2 (extra-high reasoning)OpenAI
47.0%
$1.75 / $14
29 Claude Opus 4.6 (max reasoning)Anthropic
46.2%
$5 / $25
29 Claude Sonnet 4.6 (no reasoning)Anthropic
46.2%
$3 / $15
29 DeepSeek-V4-Pro (0423, max reasoning)DeepSeek
46.2%
$1.42 / $2.83
29 Gemini 3.5 Flash (minimal reasoning)Google
46.2%
$1.50 / $9
33 Muse SparkMeta
45.5%
–
33 GPT-5.1 (high reasoning)OpenAI
45.5%
$1.25 / $10
35 Kimi K2.7 CodeMoonshot AI
44.7%
$0.95 / $4
36 Qwen3.6-Max-PreviewAlibaba
43.9%
$1.03 / $6.16
36 Qwen3.6-PlusAlibaba
43.9%
$0.33 / $1.95
36 Kimi K2.6Moonshot AI
43.9%
$0.95 / $4
36 GPT-5.6 Terra (low reasoning)OpenAI
43.9%
$2 / $12
40 GPT-5.2 (medium reasoning)OpenAI
43.2%
$1.75 / $14
40 GPT-5.4 (low reasoning)OpenAI
43.2%
$2.50 / $15
40 MiMo-V2.5-Pro (reasoning on)Xiaomi
43.2%
$0.43 / $0.87
40 GLM-5.1Z.ai
43.2%
$1.38 / $4.40
40 GLM-5Z.ai
43.2%
$0.95 / $2.55
45 MiniMax-M3MiniMax
42.4%
$0.30 / $1.20
45 GPT-5.4 nano (extra-high reasoning)OpenAI
42.4%
$0.20 / $1.25
45 GPT-5.5 Instant (2026-05-26)OpenAI
42.4%
–
48 DeepSeek-V4-Pro (0423, high reasoning)DeepSeek
41.7%
$1.42 / $2.83
48 Gemini 3 Pro Preview (high reasoning)Google
41.7%
–
48 MiMo-V2.5Xiaomi
41.7%
$0.17 / $0.34
51 Qwen3.5-397B-A17BAlibaba
40.9%
$0.55 / $3.50
51 Claude Opus 4.5 (no reasoning)Anthropic
40.9%
$5 / $25
51 Gemini 3.5 Flash (high reasoning)Google
40.9%
$1.50 / $9
51 Grok 4.20 (0309, reasoning)xAI
40.9%
–
55 Gemini 3.5 Flash (medium reasoning)Google
39.4%
$1.50 / $9
55 MiniMax-M2.7MiniMax
39.4%
$0.30 / $1.20
55 GLM-5 (no reasoning)Z.ai
39.4%
$0.95 / $2.55
58 DeepSeek-V4-Flash (0423, high reasoning)DeepSeek
38.6%
$0.14 / $0.28
58 Gemini 3 Flash Preview (reasoning on)Google
38.6%
$0.50 / $3
60 Kimi K2.6 (no reasoning)Moonshot AI
37.9%
$0.95 / $4
60 GPT-5.4 (no reasoning)OpenAI
37.9%
$2.50 / $15
60 GPT-5-Codex (high reasoning)OpenAI
37.9%
–
60 GPT-5 (medium reasoning)OpenAI
37.9%
$1.25 / $10
60 Grok 4.20xAI
37.9%
$1.25 / $2.50
60 Grok 4.3 (high reasoning)xAI
37.9%
$1.25 / $2.50
60 Grok 4xAI
37.9%
–
67 GPT-5.2-Codex (extra-high reasoning)OpenAI
37.1%
$1.75 / $14
67 o3OpenAI
37.1%
$2 / $8
69 DeepSeek-V4-Pro (0423, no reasoning)DeepSeek
36.4%
$1.42 / $2.83
69 Gemma 4 31BGoogle
36.4%
$0.14 / $0.40
71 Qwen3.5-397B-A17B (no reasoning)Alibaba
35.6%
$0.55 / $3.50
71 Claude Sonnet 4.5 (reasoning on)Anthropic
35.6%
$3 / $15
71 DeepSeek-V3.2 (reasoning on)DeepSeek
35.6%
$0.30 / $0.96
71 DeepSeek-V4-Flash (0423, max reasoning)DeepSeek
35.6%
$0.14 / $0.28
71 MiMo-V2.5-Pro (no reasoning)Xiaomi
35.6%
$0.43 / $0.87
71 GLM-5.1 (no reasoning)Z.ai
35.6%
$1.38 / $4.40
77 Qwen3.6-27BAlibaba
34.8%
$0.30 / $3.20
77 Qwen3.6-35B-A3BAlibaba
34.8%
$0.10 / $1
77 DeepSeek-V3.2-SpecialeDeepSeek
34.8%
–
77 MiniMax-M2.5MiniMax
34.8%
$0.30 / $1.20
77 Kimi K2.5Moonshot AI
34.8%
$0.57 / $2.85
77 GPT-5.1-Codex (high reasoning)OpenAI
34.8%
$1.25 / $10
83 Claude Opus 4.1 (reasoning on)Anthropic
34.3%
$15 / $75
84 DeepSeek-V4-Flash (0423, no reasoning)DeepSeek
34.1%
$0.14 / $0.28
84 Gemini 3 Pro Preview (low reasoning)Google
34.1%
–
84 GPT-5.4 mini (medium reasoning)OpenAI
34.1%
$0.75 / $4.50
84 Hy3 Preview (reasoning on)Tencent
34.1%
$0.18 / $0.60
88 Mistral Medium 3.5Mistral AI
33.3%
$1.50 / $7.50
88 GPT-5.1-Codex-Mini (high reasoning)OpenAI
33.3%
$0.25 / $2
88 GPT-5.4 nano (medium reasoning)OpenAI
33.3%
$0.20 / $1.25
88 GPT-5 mini (high reasoning)OpenAI
33.3%
$0.25 / $2
88 GLM-5-TurboZ.ai
33.3%
$1.20 / $4
93 Qwen3.5-27BAlibaba
32.6%
$0.27 / $2.16
93 DeepSeek-V3.2 (no reasoning)DeepSeek
32.6%
$0.30 / $0.96
93 GPT-5 (high reasoning)OpenAI
32.6%
$1.25 / $10
93 GLM-5V-TurboZ.ai
32.6%
$1.20 / $4
97 Qwen3.5-27B (no reasoning)Alibaba
31.8%
$0.27 / $2.16
97 DeepSeek-V3.1-Terminus (no reasoning)DeepSeek
31.8%
$0.27 / $1
97 Gemini 3 Flash Preview (no reasoning)Google
31.8%
$0.50 / $3
97 GPT-5.2 (no reasoning)OpenAI
31.8%
$1.75 / $14
97 Hy3 Preview (no reasoning)Tencent
31.8%
$0.18 / $0.60
97 GLM-4.7Z.ai
31.8%
$0.54 / $1.98
103 Qwen3.5-122B-A10BAlibaba
31.1%
$0.26 / $2.08
103 Claude Sonnet 4 (reasoning on)Anthropic
31.1%
$3 / $15
103 DeepSeek-V3.2-Exp (reasoning on)DeepSeek
31.1%
$0.27 / $0.41
103 Kimi K2 ThinkingMoonshot AI
31.1%
$0.60 / $2.50
107 DeepSeek-V3.1-Terminus (reasoning on)DeepSeek
30.3%
$0.27 / $1
107 Gemma 4 31B (no reasoning)Google
30.3%
$0.14 / $0.40
107 Grok 4.3 (medium reasoning)xAI
30.3%
$1.25 / $2.50
107 GLM-4.7 (no reasoning)Z.ai
30.3%
$0.54 / $1.98
111 Qwen3.5-122B-A10B (no reasoning)Alibaba
29.5%
$0.26 / $2.08
112 Claude Sonnet 4.5 (no reasoning)Anthropic
28.8%
$3 / $15
112 MiniMax-M2.1MiniMax
28.8%
$0.30 / $1.20
112 Nemotron 3 Super 120B A12BNVIDIA
28.8%
$0.085 / $0.40
112 GPT-5 mini (medium reasoning)OpenAI
28.8%
$0.25 / $2
112 GLM-4.6 (no reasoning)Z.ai
28.8%
$0.50 / $2
117 Claude Haiku 4.5 (no reasoning)Anthropic
27.3%
$1 / $5
117 Claude Haiku 4.5 (reasoning on)Anthropic
27.3%
$1 / $5
117 Claude Sonnet 4 (no reasoning)Anthropic
27.3%
$3 / $15
117 Step 3.5 FlashStepFun
27.3%
$0.10 / $0.30
121 Qwen3.5-35B-A3BAlibaba
26.5%
$0.16 / $1.30
121 Gemini 2.5 ProGoogle
26.5%
$1.25 / $10
121 Mercury 2Inception
26.5%
$0.25 / $0.75
121 GPT-5 (low reasoning)OpenAI
26.5%
$1.25 / $10
121 Grok 4.3 (low reasoning)xAI
26.5%
$1.25 / $2.50
126 Qwen3.6-35B-A3B (no reasoning)Alibaba
25.8%
$0.10 / $1
126 MiniMax-M2MiniMax
25.8%
$0.30 / $1.20
128 DeepSeek-V3.1 (reasoning on)DeepSeek
25.0%
$0.55 / $1.65
128 DeepSeek-V3.2-Exp (no reasoning)DeepSeek
25.0%
$0.27 / $0.41
128 Gemma 4 26B A4B (no reasoning)Google
25.0%
$0.10 / $0.30
128 GLM-4.6 (reasoning on)Z.ai
25.0%
$0.50 / $2
132 Qwen3.5-9BAlibaba
24.2%
$0.10 / $0.15
132 Qwen3-Max-ThinkingAlibaba
24.2%
$0.78 / $3.90
132 DeepSeek-V3.1 (no reasoning)DeepSeek
24.2%
$0.55 / $1.65
132 Gemini 3.1 Flash-Lite PreviewGoogle
24.2%
$0.25 / $1.50
132 GPT-5.4 nano (no reasoning)OpenAI
24.2%
$0.20 / $1.25
132 Grok 4.1 Fast (reasoning)xAI
24.2%
–
138 Kimi K2 (0905)Moonshot AI
23.5%
$0.60 / $2.50
138 gpt-oss-120b (high reasoning)OpenAI
23.5%
$0.15 / $0.60
140 Trinity Large ThinkingArcee AI
22.7%
$0.25 / $0.80
140 GPT-5.1 (no reasoning)OpenAI
22.7%
$1.25 / $10
142 Grok 4.20 (0309, non-reasoning, no reasoning)xAI
22.0%
–
142 GLM-4.5Z.ai
22.0%
$0.60 / $2.20
142 GLM-4.7-FlashZ.ai
22.0%
$0.06 / $0.40
145 Qwen3.5-Omni-PlusAlibaba
21.2%
–
145 Qwen3.6-27B (no reasoning)Alibaba
21.2%
$0.30 / $3.20
147 Qwen3-MaxAlibaba
20.5%
$0.78 / $3.90
147 GLM-4.5-AirZ.ai
20.5%
$0.14 / $0.86
149 Qwen3-Max-PreviewAlibaba
19.7%
–
150 Qwen3-Coder-480B-A35BAlibaba
18.9%
$0.35 / $1.50
150 Devstral 2Mistral AI
18.9%
$0.40 / $2
150 Kimi K2.5 (no reasoning)Moonshot AI
18.9%
$0.57 / $2.85
150 Grok 4.3 (no reasoning)xAI
18.9%
$1.25 / $2.50
150 Grok 4 Fast (reasoning)xAI
18.9%
–
155 Qwen3.5-4B (reasoning on)Alibaba
18.2%
–
155 Qwen3.5-9B (no reasoning)Alibaba
18.2%
$0.10 / $0.15
155 Qwen3-Coder-NextAlibaba
18.2%
$0.18 / $0.90
155 Gemma 4 12BGoogle
18.2%
–
155 GPT-5.4 mini (no reasoning)OpenAI
18.2%
$0.75 / $4.50
155 GPT-5 (minimal reasoning)OpenAI
18.2%
$1.25 / $10
161 Qwen3-Max-Thinking-PreviewAlibaba
17.4%
–
161 Nova 2 Lite (medium reasoning)Amazon
17.4%
$0.30 / $2.50
161 Mistral Small 4Mistral AI
17.4%
$0.15 / $0.60
161 GPT-5 nano (medium reasoning)OpenAI
17.4%
$0.05 / $0.40
161 Grok Code Fast 1xAI
17.4%
–
166 Nova 2 Lite (high reasoning)Amazon
16.7%
$0.30 / $2.50
166 Gemini 2.5 Flash Preview (09-2025, reasoning on)Google
16.7%
–
166 Devstral Small 2Mistral AI
16.7%
–
166 Grok 4.20 (no reasoning)xAI
16.7%
$1.25 / $2.50
170 DeepSeek-R1-0528DeepSeek
15.9%
$0.50 / $2.18
170 Mistral Large 3Mistral AI
15.9%
$0.50 / $1.50
170 Kimi K2 (0711)Moonshot AI
15.9%
$0.57 / $2.30
173 Qwen3-235B-A22B-Instruct-2507Alibaba
15.2%
$0.15 / $0.75
173 Qwen3-Coder-30B-A3B-InstructAlibaba
15.2%
$0.07 / $0.28
173 DeepSeek-V3-0324DeepSeek
15.2%
$0.25 / $1
173 o4-mini (high reasoning)OpenAI
15.2%
$1.10 / $4.40
177 Gemini 2.5 Flash Preview (09-2025, no reasoning)Google
14.4%
–
177 GPT-5 mini (minimal reasoning)OpenAI
14.4%
$0.25 / $2
177 Grok 4.1 Fast (non-reasoning, no reasoning)xAI
14.4%
–
177 GLM-4.6V (reasoning on)Z.ai
14.4%
$0.30 / $0.90
181 Gemma 4 26B A4BGoogle
13.6%
$0.10 / $0.30
181 Qwen3-235B-A22B-Thinking-2507Alibaba
13.6%
$0.30 / $3
181 Gemini 2.5 Flash (reasoning on)Google
13.6%
$0.30 / $2.50
181 Nemotron 3 Nano 30B A3B (reasoning on)NVIDIA
13.6%
$0.05 / $0.20
181 GPT-4.1OpenAI
13.6%
$2 / $8
186 Gemini 2.5 Flash-Lite Preview (09-2025, reasoning on)Google
12.9%
–
186 Magistral Medium 1.2Mistral AI
12.9%
–
186 GPT-5 ChatOpenAI
12.9%
–
186 o1OpenAI
12.9%
$15 / $60
190 Gemini 2.5 Flash (no reasoning)Google
12.1%
$0.30 / $2.50
190 Nemotron 3 Nano 30B A3B (no reasoning)NVIDIA
12.1%
$0.05 / $0.20
190 GPT-5 nano (high reasoning)OpenAI
12.1%
$0.05 / $0.40
190 Grok 4 Fast (non-reasoning, no reasoning)xAI
12.1%
–
194 Qwen3.5-4B (no reasoning)Alibaba
11.4%
–
194 Qwen3-VL-235B-A22B-ThinkingAlibaba
11.4%
$0.40 / $4
194 Gemma 4 12B (no reasoning)Google
11.4%
–
194 Kimi Linear 48B A3B InstructMoonshot AI
11.4%
–
198 Qwen3.5-35B-A3B (no reasoning)Alibaba
10.6%
$0.16 / $1.30
198 Mistral Medium 3.1Mistral AI
10.6%
$0.40 / $2
198 Mistral Small 4 (no reasoning)Mistral AI
10.6%
$0.15 / $0.60
198 gpt-oss-20b (high reasoning)OpenAI
10.6%
$0.03 / $0.15
202 Qwen3-Next-80B-A3B-ThinkingAlibaba
9.8%
$0.15 / $1.20
203 Devstral MediumMistral AI
9.1%
–
204 Qwen3.5-Omni-FlashAlibaba
8.3%
–
204 Qwen3-VL-32B-InstructAlibaba
8.3%
$0.10 / $0.42
204 Gemma 4 E4BGoogle
8.3%
–
204 GPT-4o (2024-08-06)OpenAI
8.3%
$2.50 / $10
208 Qwen3-Next-80B-A3B-InstructAlibaba
7.6%
$0.10 / $1.10
208 Qwen3-VL-32B-ThinkingAlibaba
7.6%
–
208 Gemini 2.5 Flash-Lite Preview (09-2025, no reasoning)Google
7.6%
–
208 Gemma 4 E4B (no reasoning)Google
7.6%
–
208 Mistral Small 3.1 24BMistral AI
7.6%
$0.35 / $0.56
208 GPT-4.1 miniOpenAI
7.6%
$0.40 / $1.60
208 Solar Pro 3Upstage
7.6%
$0.15 / $0.60
215 Qwen3-30B-A3B (no reasoning)Alibaba
6.8%
$0.12 / $0.50
215 Qwen3-VL-235B-A22B-InstructAlibaba
6.8%
$0.30 / $1.50
215 Nova 2 Lite (no reasoning)Amazon
6.8%
$0.30 / $2.50
215 DeepSeek-V3DeepSeek
6.8%
$0.26 / $1.03
215 Llama 4 MaverickMeta
6.8%
$0.27 / $0.85
215 Mistral Small 3.2 24BMistral AI
6.8%
$0.094 / $0.25
215 GPT-5 nano (minimal reasoning)OpenAI
6.8%
$0.05 / $0.40
215 o3-miniOpenAI
6.8%
$1.10 / $4.40
215 GLM-4.5V (no reasoning)Z.ai
6.8%
$0.60 / $1.80
224 Qwen3-235B-A22B (no reasoning)Alibaba
6.1%
$0.46 / $1.82
224 Qwen3-235B-A22B (reasoning on)Alibaba
6.1%
$0.46 / $1.82
224 Qwen3-30B-A3B-Instruct-2507Alibaba
6.1%
$0.09 / $0.30
224 Qwen3-VL-30B-A3B-InstructAlibaba
6.1%
$0.15 / $0.60
224 Nova Pro 1.0Amazon
6.1%
$0.80 / $3.20
224 DeepSeek-R1DeepSeek
6.1%
$0.70 / $2.50
224 Devstral Small 1.1Mistral AI
6.1%
–
224 o3-mini (high reasoning)OpenAI
6.1%
$1.10 / $4.40
232 Qwen3-14B (no reasoning)Alibaba
5.3%
$0.12 / $0.24
232 Qwen3-30B-A3B-Thinking-2507Alibaba
5.3%
$0.20 / $2.40
232 Qwen3-VL-30B-A3B-ThinkingAlibaba
5.3%
$0.29 / $1
232 gpt-oss-120b (low reasoning)OpenAI
5.3%
$0.15 / $0.60
232 GLM-4.5V (reasoning on)Z.ai
5.3%
$0.60 / $1.80
237 Qwen2.5-72B-InstructAlibaba
4.5%
$0.36 / $0.40
237 Qwen3-4B-Instruct-2507Alibaba
4.5%
–
237 Gemini 2.5 Flash-Lite (reasoning on)Google
4.5%
$0.10 / $0.40
237 Magistral Small 1.2Mistral AI
4.5%
–
237 Ministral 3 14BMistral AI
4.5%
$0.20 / $0.20
237 Ministral 3 8BMistral AI
4.5%
$0.15 / $0.15
237 gpt-oss-20b (low reasoning)OpenAI
4.5%
$0.03 / $0.15
244 Qwen3-14B (reasoning on)Alibaba
3.8%
$0.12 / $0.24
244 Qwen3.5-2B (no reasoning)Alibaba
3.8%
–
244 Qwen3.5-2B (reasoning on)Alibaba
3.8%
–
244 Qwen3-Omni-30B-A3B-ThinkingAlibaba
3.8%
–
244 Qwen3-VL-8B-ThinkingAlibaba
3.8%
$0.18 / $2.10
244 Nova 2 Lite (low reasoning)Amazon
3.8%
$0.30 / $2.50
244 Gemma 3 27BGoogle
3.8%
$0.12 / $0.20
244 Phi-4Microsoft
3.8%
$0.07 / $0.14
244 Mistral Medium 3Mistral AI
3.8%
$0.40 / $2
244 GPT-4.1 nanoOpenAI
3.8%
$0.10 / $0.40
244 GLM-4.7-Flash (no reasoning)Z.ai
3.8%
$0.06 / $0.40
255 Qwen3-32B (reasoning on)Alibaba
3.0%
$0.14 / $0.40
255 Gemma 4 E2BGoogle
3.0%
–
255 Llama 3.1 70B InstructMeta
3.0%
$0.40 / $0.40
255 Llama 3.3 70B InstructMeta
3.0%
$0.59 / $0.79
255 GLM-4.6V (no reasoning)Z.ai
3.0%
$0.30 / $0.90
260 Qwen3-30B-A3B (reasoning on)Alibaba
2.3%
$0.12 / $0.50
260 Qwen3-8B (no reasoning)Alibaba
2.3%
$0.12 / $0.46
260 Qwen3-8B (reasoning on)Alibaba
2.3%
$0.12 / $0.46
260 Qwen3-VL-8B-InstructAlibaba
2.3%
$0.12 / $0.46
260 Gemini 2.5 Flash-Lite (no reasoning)Google
2.3%
$0.10 / $0.40
260 Gemma 4 E2B (no reasoning)Google
2.3%
–
266 Qwen3-4B-Thinking-2507Alibaba
1.5%
–
266 Qwen3-Omni-30B-A3B-InstructAlibaba
1.5%
–
266 Qwen3-VL-4B-ThinkingAlibaba
1.5%
–
266 Nova Micro 1.0Amazon
1.5%
$0.035 / $0.14
266 Llama 4 ScoutMeta
1.5%
$0.18 / $0.59
271 Nova Lite 1.0Amazon
0.8%
$0.06 / $0.24
271 Command ACohere
0.8%
$2.50 / $10
271 Gemma 3 12BGoogle
0.8%
$0.05 / $0.15
271 Gemma 3 4BGoogle
0.8%
$0.05 / $0.10
271 Llama 3.1 8B InstructMeta
0.8%
$0.05 / $0.08
276 Qwen3.5-0.8B (no reasoning)Alibaba
0.0%
–
276 Qwen3.5-0.8B (reasoning on)Alibaba
0.0%
–
276 Qwen3-VL-4B-InstructAlibaba
0.0%
–
276 Gemma 3 270MGoogle
0.0%
–
276 Llama 3.2 1B InstructMeta
0.0%
$0.027 / $0.20
276 Ministral 3 3BMistral AI
0.0%
$0.10 / $0.10
276 Reka Flash 3Reka AI
0.0%
$0.10 / $0.20

Swipe the table sideways for more columns.

Ranks follow the score as shown, so equal numbers share a rank. Results as published by Artificial Analysis; we do not re-run them.

What it measures

Share of the hardest Terminal-Bench tasks completed, as run by Artificial Analysis with its own harness and prompts.

What it does not measure

Not other harnesses; Artificial Analysis no longer runs it on new models.

282 results from Artificial Analysis not ranked here · show why

We rank a result only when we can tie it to a specific model you can use. These are left out:

  • Not on sale through the API providers we track: 268
  • A different snapshot or variant from the model we list: 13
  • An unusual combination of settings: 1

Data sourced from Artificial Analysis. Licence: Artificial Analysis commercial data licence.