Benchmarks / Artificial Analysis

Reported by Artificial Analysis

Artificial Analysis

Share of expert-written exam questions answered correctly, as run by Artificial Analysis with its own harness and prompts.

Last updated 8 Oct 2026

Results dated
8 Oct 2026
Results
405 configurations of 242 models
Unit
% of questions
Licence
Artificial Analysis commercial data licence

Humanity's Last Exam: GPT-6 Sol

Top 15 of 405 results · % of questions, higher is better. Choose a model to highlight it.Clear highlight

  1. 1 Claude Opus 5.5 (max reasoning)Anthropic 61.4%
  2. 2 Claude Fable 5.1 (max reasoning)Anthropic 59.1%
  3. 3 Claude Fable 5.1 (extra-high reasoning)Anthropic 58.7%
  4. 4 Claude Opus 5.5 (extra-high reasoning)Anthropic 57.5%
  5. 5 Gemini 4 Argon (high reasoning)Google 57.1%
  6. 6 Claude Fable 5.1 (high reasoning)Anthropic 55.9%
  7. 7 Claude Opus 5.5 (high reasoning)Anthropic 55.6%
  8. 8 Claude Fable 5 (max reasoning)Anthropic 55.5%
  9. 9 Claude Sonnet 5.5 (max reasoning)Anthropic 55.0%
  10. 10 Claude Opus 5 (max reasoning)Anthropic 54.9%
  11. 11 Claude Opus 5.5 (medium reasoning)Anthropic 54.7%
  12. 11 GPT-6 Astra (max reasoning)OpenAI 54.7%
  13. 13 GPT-6 Astra (extra-high reasoning)OpenAI 54.6%
  14. 14 Claude Opus 5 (extra-high reasoning)Anthropic 54.4%
  15. 15 Claude Fable 5.1 (medium reasoning)Anthropic 53.8%
  16. 32 GPT-6 Sol (max reasoning)OpenAI 47.9%
  17. 40 GPT-6 Sol (extra-high reasoning)OpenAI 46.3%
  18. 48 GPT-6 Sol (high reasoning)OpenAI 44.1%
  19. 73 GPT-6 Sol (medium reasoning)OpenAI 41.0%
  20. 113 GPT-6 Sol (low reasoning)OpenAI 34.9%
  21. 202 GPT-6 Sol (no reasoning)OpenAI 18.4%

Full results

Artificial Analysis: Humanity's Last Exam, % of questions, higher is better
#ModelHumanity's Last Exam
% of questions, higher is better
Price
$ per million tokens, in / out
1 Claude Opus 5.5 (max reasoning)Anthropic
61.4%
$4 / $20
2 Claude Fable 5.1 (max reasoning)Anthropic
59.1%
$10 / $50
3 Claude Fable 5.1 (extra-high reasoning)Anthropic
58.7%
$10 / $50
4 Claude Opus 5.5 (extra-high reasoning)Anthropic
57.5%
$4 / $20
5 Gemini 4 Argon (high reasoning)Google
57.1%
–
6 Claude Fable 5.1 (high reasoning)Anthropic
55.9%
$10 / $50
7 Claude Opus 5.5 (high reasoning)Anthropic
55.6%
$4 / $20
8 Claude Fable 5 (max reasoning)Anthropic
55.5%
$10 / $50
9 Claude Sonnet 5.5 (max reasoning)Anthropic
55.0%
$2 / $10
10 Claude Opus 5 (max reasoning)Anthropic
54.9%
$5 / $25
11 Claude Opus 5.5 (medium reasoning)Anthropic
54.7%
$4 / $20
11 GPT-6 Astra (max reasoning)OpenAI
54.7%
$10 / $50
13 GPT-6 Astra (extra-high reasoning)OpenAI
54.6%
$10 / $50
14 Claude Opus 5 (extra-high reasoning)Anthropic
54.4%
$5 / $25
15 Claude Fable 5.1 (medium reasoning)Anthropic
53.8%
$10 / $50
16 GPT-6 Astra (high reasoning)OpenAI
53.1%
$10 / $50
17 GPT-6.1 Sol (max reasoning)OpenAI
52.9%
$2 / $10
18 Claude Opus 5 (high reasoning)Anthropic
52.8%
$5 / $25
19 GPT-6 Astra (medium reasoning)OpenAI
52.7%
$10 / $50
20 GPT-6.1 Sol (extra-high reasoning)OpenAI
52.6%
$2 / $10
21 GPT-6.1 Sol (high reasoning)OpenAI
51.4%
$2 / $10
22 Claude Opus 5 (medium reasoning)Anthropic
51.3%
$5 / $25
23 Claude Sonnet 5.5 (extra-high reasoning)Anthropic
50.0%
$2 / $10
24 GPT-6.1 Sol (medium reasoning)OpenAI
49.9%
$2 / $10
25 GPT-5.6 Sol (max reasoning)OpenAI
49.5%
$4 / $20
26 MiMo-V2.6-ProXiaomi
49.4%
$0.43 / $0.87
27 GPT-6 Astra (low reasoning)OpenAI
49.2%
$10 / $50
28 Claude Fable 5.1 (low reasoning)Anthropic
48.9%
$10 / $50
29 Claude Opus 4.8 (max reasoning)Anthropic
48.7%
$5 / $25
29 Muse Spark 1.3 (max reasoning)Meta
48.7%
$1.25 / $4.25
31 Claude Opus 5.5 (low reasoning)Anthropic
48.3%
$4 / $20
32 Gemini 3.7 Flash (high reasoning)Google
47.9%
$1.50 / $7.50
32 GPT-6 Sol (max reasoning)OpenAI
47.9%
$2 / $10
34 Gemini 3.8 Flash (high reasoning)Google
47.8%
$1.50 / $7.50
35 Muse Spark 1.3 (extra-high reasoning)Meta
47.5%
$1.25 / $4.25
36 GPT-6.1 Sol (low reasoning)OpenAI
47.4%
$2 / $10
37 GPT-5.6 Sol (extra-high reasoning)OpenAI
47.3%
$4 / $20
38 Gemini 3.1 Pro PreviewGoogle
47.0%
$2 / $12
39 Kimi K3 (max reasoning)Moonshot AI
46.9%
$3 / $15
40 GPT-6 Sol (extra-high reasoning)OpenAI
46.3%
$2 / $10
41 Muse Spark 1.1 (extra-high reasoning)Meta
46.2%
$1.25 / $4.25
42 GPT-5.6 Sol (high reasoning)OpenAI
46.0%
$4 / $20
43 Claude Sonnet 5.5 (high reasoning)Anthropic
45.8%
$2 / $10
43 GPT-5.5 (extra-high reasoning)OpenAI
45.8%
$5 / $30
45 Muse Spark 1.2 (extra-high reasoning)Meta
45.5%
$1.25 / $4.25
46 GPT-5.5 (high reasoning)OpenAI
45.0%
$5 / $30
47 Claude Haiku 5.5 (max reasoning)Anthropic
44.4%
$0.10 / $0.50
48 GPT-6 Sol (high reasoning)OpenAI
44.1%
$2 / $10
48 Grok 4.6 (extra-high reasoning)xAI
44.1%
$2 / $6
50 GPT-5.4 (extra-high reasoning)OpenAI
43.7%
$2.50 / $15
51 Claude Opus 5 (low reasoning)Anthropic
43.4%
$5 / $25
52 Qwen3.8-Max (0902)Alibaba
43.1%
$2 / $6
52 Grok 4.7 (extra-high reasoning)xAI
43.1%
$2 / $6
54 Qwen3.8-Max (0803)Alibaba
43.0%
–
55 GPT-5.6 Terra (max reasoning)OpenAI
42.9%
$2 / $12
55 Grok 4.6 (high reasoning)xAI
42.9%
$2 / $6
57 Claude Haiku 5.5 (extra-high reasoning)Anthropic
42.7%
$0.10 / $0.50
57 Gemini 3.5 Flash (high reasoning)Google
42.7%
$1.50 / $9
57 Grok 4.5 (high reasoning)xAI
42.7%
$2 / $6
60 GPT-5.3-Codex (extra-high reasoning)OpenAI
42.5%
$1.75 / $14
61 Qwen3.8-2.4T-A95BAlibaba
42.4%
$2 / $6
61 GPT-5.5 (medium reasoning)OpenAI
42.4%
$5 / $30
63 Claude Opus 4.7 (max reasoning)Anthropic
42.3%
$5 / $25
63 Grok 4.7 (high reasoning)xAI
42.3%
$2 / $6
63 GLM-5.3 (max reasoning)Z.ai
42.3%
$1.40 / $4.40
66 GPT-5.6 Sol (medium reasoning)OpenAI
42.2%
$4 / $20
67 Gemini 3.8 Flash (medium reasoning)Google
42.1%
$1.50 / $7.50
67 Grok 4.6 (medium reasoning)xAI
42.1%
$2 / $6
69 GPT-5.6 Terra (extra-high reasoning)OpenAI
41.9%
$2 / $12
70 Claude Sonnet 5 (max reasoning)Anthropic
41.3%
$2 / $10
70 Gemini 3.5 Flash (medium reasoning)Google
41.3%
$1.50 / $9
72 GLM-5.2 (max reasoning)Z.ai
41.1%
$1.40 / $4.40
73 DeepSeek-V4-Pro (0813, max reasoning)DeepSeek
41.0%
$1.32 / $3.96
73 GPT-6 Sol (medium reasoning)OpenAI
41.0%
$2 / $10
75 Gemini 3.6 Flash (high reasoning)Google
40.8%
$1.50 / $7.50
76 Muse SparkMeta
40.7%
–
77 Qwen3.7-MaxAlibaba
40.5%
$1.48 / $4.42
78 Claude Opus 4.6 (max reasoning)Anthropic
39.9%
$5 / $25
78 GLM-5.3-FlashZ.ai
39.9%
$0.15 / $0.50
80 Claude Sonnet 5.5 (medium reasoning)Anthropic
39.8%
$2 / $10
81 Gemini 3 Pro Preview (high reasoning)Google
39.7%
–
82 GPT-5.6 Luna (max reasoning)OpenAI
39.5%
$0.20 / $1.20
83 GPT-5.6 Sol (low reasoning)OpenAI
39.4%
$4 / $20
84 DeepSeek-V4.1-Flash (max reasoning)DeepSeek
39.2%
$0.30 / $1.20
84 Grok 4.7 (low reasoning)xAI
39.2%
$2 / $6
86 Claude Sonnet 5 (extra-high reasoning)Anthropic
39.0%
$2 / $10
86 Gemini 3.7 Flash (medium reasoning)Google
39.0%
$1.50 / $7.50
86 MiniMax-M3MiniMax
39.0%
$0.30 / $1.20
89 DeepSeek-V4-Flash (0731, max reasoning)DeepSeek
38.6%
$0.14 / $0.28
90 GPT-5.6 Terra (high reasoning)OpenAI
38.5%
$2 / $12
90 GPT-6 Luna (max reasoning)OpenAI
38.5%
$0.10 / $0.50
92 Grok Build 0.1xAI
38.3%
$1 / $2
93 Qwen3.8-Flash-NextAlibaba
38.0%
–
94 GPT-5.2 (extra-high reasoning)OpenAI
37.7%
$1.75 / $14
95 DeepSeek-V4-Pro (0423, max reasoning)DeepSeek
37.5%
$1.42 / $2.83
95 Kimi K2.6Moonshot AI
37.5%
$0.95 / $4
97 Claude Haiku 5.5 (high reasoning)Anthropic
37.3%
$0.10 / $0.50
98 Grok 4.3 (high reasoning)xAI
37.2%
$1.25 / $2.50
99 Gemini 3.8 Flash (low reasoning)Google
37.1%
$1.50 / $7.50
100 GPT-5.6 Luna (extra-high reasoning)OpenAI
37.0%
$0.20 / $1.20
101 Gemini 3 Flash Preview (reasoning on)Google
36.6%
$0.50 / $3
101 GLM-5.3 (low reasoning)Z.ai
36.6%
$1.40 / $4.40
103 Claude Sonnet 5.5 (low reasoning)Anthropic
36.2%
$2 / $10
104 Claude Sonnet 5 (high reasoning)Anthropic
35.7%
$2 / $10
104 GPT-5.2-Codex (extra-high reasoning)OpenAI
35.7%
$1.75 / $14
104 MiMo-V2.5-Pro (reasoning on)Xiaomi
35.7%
$0.43 / $0.87
107 Qwen3.7-PlusAlibaba
35.6%
$0.32 / $1.28
108 DeepSeek-V4-Pro (0423, high reasoning)DeepSeek
35.2%
$1.42 / $2.83
109 Gemini 3.7 Flash (low reasoning)Google
35.1%
$1.50 / $7.50
109 MiMo-V2.6-FlashXiaomi
35.1%
$0.14 / $0.28
111 Mistral Large 4Mistral AI
35.0%
$1.36 / $4.18
111 Kimi K2.7 CodeMoonshot AI
35.0%
$0.95 / $4
113 GPT-6 Sol (low reasoning)OpenAI
34.9%
$2 / $10
114 DeepSeek-V4-Flash (0423, max reasoning)DeepSeek
34.8%
$0.14 / $0.28
115 DeepSeek-V4-Flash-Vision-Exp (max reasoning)DeepSeek
34.5%
$0.44 / $1.32
115 Grok 4.20xAI
34.5%
$1.25 / $2.50
117 GPT-6 Luna (extra-high reasoning)OpenAI
34.3%
$0.10 / $0.50
118 Qwen3.8-27B (extra-high reasoning)Alibaba
33.9%
$0.50 / $3
119 Claude Haiku 5.5 (medium reasoning)Anthropic
33.8%
$0.10 / $0.50
120 Claude Sonnet 4.6 (max reasoning)Anthropic
33.6%
$3 / $15
121 Hy3Tencent
33.5%
$0.14 / $0.58
122 GPT-5.6 Luna (high reasoning)OpenAI
33.4%
$0.20 / $1.20
123 Claude Opus 4.7 (no reasoning)Anthropic
33.3%
$5 / $25
123 GPT-5.6 Terra (medium reasoning)OpenAI
33.3%
$2 / $12
123 Inkling SmallThinking Machines
33.3%
$0.45 / $1.20
126 GPT-6 Luna (high reasoning)OpenAI
32.9%
$0.10 / $0.50
127 GPT-5.5 (low reasoning)OpenAI
32.7%
$5 / $30
128 Grok 4.20 (0309, reasoning)xAI
32.4%
–
129 Inkling (extra-high reasoning)Thinking Machines
31.9%
$0.95 / $4.05
130 Qwen3.6-Max-PreviewAlibaba
30.8%
$1.03 / $6.16
130 GPT-5.4 (low reasoning)OpenAI
30.8%
$2.50 / $15
132 Kimi K2.5Moonshot AI
30.7%
$0.57 / $2.85
133 DeepSeek-V4-Flash (0423, high reasoning)DeepSeek
30.3%
$0.14 / $0.28
134 Claude Opus 4.5 (reasoning on)Anthropic
30.1%
$5 / $25
134 GLM-5.1Z.ai
30.1%
$1.38 / $4.40
136 Claude Sonnet 5 (medium reasoning)Anthropic
30.0%
$2 / $10
136 Grok 4.3 (medium reasoning)xAI
30.0%
$1.25 / $2.50
138 MiniMax-M2.7MiniMax
29.6%
$0.30 / $1.20
139 Gemini 3 Pro Preview (low reasoning)Google
29.5%
–
140 GLM-5Z.ai
29.3%
$0.95 / $2.55
141 GPT-5.6 Terra (low reasoning)OpenAI
29.2%
$2 / $12
141 Solar Pro 4Upstage
29.2%
$0.09 / $0.36
143 Qwen3.5-397B-A17BAlibaba
29.0%
$0.55 / $3.50
144 DeepSeek-V3.2-SpecialeDeepSeek
28.7%
–
145 GPT-5.1 (high reasoning)OpenAI
28.5%
$1.25 / $10
145 GPT-5 (high reasoning)OpenAI
28.5%
$1.25 / $10
147 GPT-5.4 nano (extra-high reasoning)OpenAI
28.3%
$0.20 / $1.25
147 GPT-6 Luna (medium reasoning)OpenAI
28.3%
$0.10 / $0.50
149 GPT-5.4 mini (extra-high reasoning)OpenAI
28.1%
$0.75 / $4.50
150 Qwen3-Max-ThinkingAlibaba
28.0%
$0.78 / $3.90
151 Grok 4.20 (no reasoning)xAI
27.9%
$1.25 / $2.50
151 GLM-5.1 (no reasoning)Z.ai
27.9%
$1.38 / $4.40
153 Qwen3.6-PlusAlibaba
27.8%
$0.33 / $1.95
153 GPT-5-Codex (high reasoning)OpenAI
27.8%
–
153 Hy3 Preview (reasoning on)Tencent
27.8%
$0.18 / $0.60
153 GLM-5-TurboZ.ai
27.8%
$1.20 / $4
157 Grok 4.6 (low reasoning)xAI
27.6%
$2 / $6
158 GLM-4.7Z.ai
27.4%
$0.54 / $1.98
159 MiMo-V2.5Xiaomi
27.2%
$0.17 / $0.34
160 Claude Haiku 5.5 (low reasoning)Anthropic
27.0%
$0.10 / $0.50
161 GPT-5.2 (medium reasoning)OpenAI
26.7%
$1.75 / $14
161 Grok 4xAI
26.7%
–
163 GPT-5.6 Luna (medium reasoning)OpenAI
25.8%
$0.20 / $1.20
164 GPT-5.1-Codex (high reasoning)OpenAI
25.7%
$1.25 / $10
165 GPT-5 (medium reasoning)OpenAI
25.4%
$1.25 / $10
166 Qwen3.5-122B-A10BAlibaba
25.2%
$0.26 / $2.08
167 Kimi K3 (low reasoning)Moonshot AI
25.0%
$3 / $15
168 DeepSeek-V3.2 (reasoning on)DeepSeek
24.6%
$0.30 / $0.96
169 Grok 4.20 (0309, non-reasoning, no reasoning)xAI
24.5%
–
170 Gemini 3.5 Flash (minimal reasoning)Google
24.1%
$1.50 / $9
171 Qwen3.5-27BAlibaba
23.9%
$0.27 / $2.16
172 Kimi K2 ThinkingMoonshot AI
23.8%
$0.60 / $2.50
173 Gemma 4 31BGoogle
23.6%
$0.14 / $0.40
174 MiniMax-M2.1MiniMax
23.2%
$0.30 / $1.20
175 Qwen3.6-27BAlibaba
23.1%
$0.30 / $3.20
176 Gemini 2.5 ProGoogle
22.5%
$1.25 / $10
177 Qwen3.6-35B-A3BAlibaba
22.2%
$0.10 / $1
178 Muse Glimmer (high reasoning)Meta
22.0%
–
179 Claude Sonnet 5 (low reasoning)Anthropic
21.9%
$2 / $10
180 GPT-5.5 Instant (2026-05-26)OpenAI
21.6%
–
181 GPT-5 mini (high reasoning)OpenAI
21.5%
$0.25 / $2
182 Step 3.5 FlashStepFun
21.1%
$0.10 / $0.30
183 Qwen3.5-35B-A3BAlibaba
21.0%
$0.16 / $1.30
184 Nemotron 3 Super 120B A12BNVIDIA
20.8%
$0.085 / $0.40
185 MiniMax-M2.5MiniMax
20.5%
$0.30 / $1.20
186 GPT-6 Luna (low reasoning)OpenAI
20.3%
$0.10 / $0.50
187 o3OpenAI
20.1%
$2 / $8
188 GPT-5.5 Instant (2026-06-26)OpenAI
19.9%
–
189 Qwen3.5-397B-A17B (no reasoning)Alibaba
19.8%
$0.55 / $3.50
189 GPT-5.6 Luna (low reasoning)OpenAI
19.8%
$0.20 / $1.20
191 Kimi K2.6 (no reasoning)Moonshot AI
19.6%
$0.95 / $4
191 GPT-5 (low reasoning)OpenAI
19.6%
$1.25 / $10
191 gpt-oss-120b (high reasoning)OpenAI
19.6%
$0.15 / $0.60
194 Gemma 4 26B A4BGoogle
19.3%
$0.10 / $0.30
194 Grok 4.1 Fast (reasoning)xAI
19.3%
–
196 Claude Opus 4.6 (no reasoning)Anthropic
19.1%
$5 / $25
196 Grok 4 Fast (reasoning)xAI
19.1%
–
198 Claude Sonnet 5 (no reasoning)Anthropic
19.0%
$2 / $10
199 Gemini 3.5 Flash-LiteGoogle
18.8%
$0.30 / $2.50
200 GPT-5.4 mini (medium reasoning)OpenAI
18.6%
$0.75 / $4.50
201 GPT-5.1-Codex-Mini (high reasoning)OpenAI
18.5%
$0.25 / $2
202 GPT-6 Sol (no reasoning)OpenAI
18.4%
$2 / $10
202 Grok 4.3 (low reasoning)xAI
18.4%
$1.25 / $2.50
204 Claude Sonnet 4.5 (reasoning on)Anthropic
17.8%
$3 / $15
205 Gemini 3.1 Flash-Lite PreviewGoogle
17.2%
$0.25 / $1.50
206 Mercury 2Inception
17.1%
$0.25 / $0.75
206 GLM-5V-TurboZ.ai
17.1%
$1.20 / $4
208 GPT-5.6 Sol (no reasoning)OpenAI
16.7%
$4 / $20
209 o4-mini (high reasoning)OpenAI
16.5%
$1.10 / $4.40
210 DeepSeek-V3.1-Terminus (reasoning on)DeepSeek
16.4%
$0.27 / $1
211 Qwen3-235B-A22B-Thinking-2507Alibaba
15.9%
$0.30 / $3
211 Qwen3.5-122B-A10B (no reasoning)Alibaba
15.9%
$0.26 / $2.08
211 GPT-5.4 nano (medium reasoning)OpenAI
15.9%
$0.20 / $1.25
211 GPT-5 mini (medium reasoning)OpenAI
15.9%
$0.25 / $2
215 Trinity Large ThinkingArcee AI
15.8%
$0.25 / $0.80
215 DeepSeek-R1-0528DeepSeek
15.8%
$0.50 / $2.18
217 Gemma 4 12BGoogle
15.7%
–
218 Qwen3.6-27B (no reasoning)Alibaba
15.1%
$0.30 / $3.20
219 Gemini 3 Flash Preview (no reasoning)Google
15.0%
$0.50 / $3
220 Qwen3.5-9BAlibaba
14.9%
$0.10 / $0.15
220 Qwen3.5-Omni-PlusAlibaba
14.9%
–
220 DeepSeek-V3.2-Exp (reasoning on)DeepSeek
14.9%
$0.27 / $0.41
223 MiMo-V2.5-Pro (no reasoning)Xiaomi
14.8%
$0.43 / $0.87
224 GLM-4.6 (reasoning on)Z.ai
14.5%
$0.50 / $2
225 DeepSeek-V3.1 (reasoning on)DeepSeek
14.3%
$0.55 / $1.65
226 Qwen3.8-27B (medium reasoning)Alibaba
14.1%
$0.50 / $3
227 Qwen3.8-27B (low reasoning)Alibaba
14.0%
$0.50 / $3
228 Qwen3.5-27B (no reasoning)Alibaba
13.9%
$0.27 / $2.16
228 Qwen3.6-35B-A3B (no reasoning)Alibaba
13.9%
$0.10 / $1
230 Gemini 2.5 Flash Preview (09-2025, reasoning on)Google
13.8%
–
230 Mistral Medium 3.5Mistral AI
13.8%
$1.50 / $7.50
232 MiniMax-M2MiniMax
13.7%
$0.30 / $1.20
232 GPT-5.5 (no reasoning)OpenAI
13.7%
$5 / $30
234 Qwen3.5-35B-A3B (no reasoning)Alibaba
13.4%
$0.16 / $1.30
235 Claude Sonnet 4.6 (no reasoning)Anthropic
13.3%
$3 / $15
236 Claude Opus 4.5 (no reasoning)Anthropic
13.2%
$5 / $25
236 Kimi K2.5 (no reasoning)Moonshot AI
13.2%
$0.57 / $2.85
238 GLM-4.5Z.ai
13.0%
$0.60 / $2.20
239 Qwen3-Max-Thinking-PreviewAlibaba
12.7%
–
240 Qwen3-Next-80B-A3B-ThinkingAlibaba
12.6%
$0.15 / $1.20
241 Claude Opus 4.1 (reasoning on)Anthropic
12.5%
$15 / $75
242 Qwen3.8-27B (no reasoning)Alibaba
12.1%
$0.50 / $3
242 Gemini 2.5 Flash (reasoning on)Google
12.1%
$0.30 / $2.50
244 o3-mini (high reasoning)OpenAI
12.0%
$1.10 / $4.40
245 Qwen3-MaxAlibaba
11.9%
$0.78 / $3.90
245 Qwen3-VL-235B-A22B-ThinkingAlibaba
11.9%
$0.40 / $4
247 Gemma 4 31B (no reasoning)Google
11.8%
$0.14 / $0.40
248 Nova 2 Lite (high reasoning)Amazon
11.6%
$0.30 / $2.50
249 Gemma 4 26B A4B (no reasoning)Google
11.5%
$0.10 / $0.30
250 Nemotron 3 Nano 30B A3B (reasoning on)NVIDIA
11.4%
$0.05 / $0.20
250 GPT-5.6 Terra (no reasoning)OpenAI
11.4%
$2 / $12
252 GPT-5.4 (no reasoning)OpenAI
11.3%
$2.50 / $15
253 DeepSeek-V3.2 (no reasoning)DeepSeek
11.2%
$0.30 / $0.96
254 Qwen3-235B-A22B-Instruct-2507Alibaba
11.1%
$0.15 / $0.75
255 Qwen3-235B-A22B (reasoning on)Alibaba
11.0%
$0.46 / $1.82
255 gpt-oss-20b (high reasoning)OpenAI
11.0%
$0.03 / $0.15
257 DeepSeek-V4.1-Flash (no reasoning)DeepSeek
10.8%
$0.30 / $1.20
257 DiffusionGemma 26B A4BGoogle
10.8%
–
259 Claude Sonnet 4 (reasoning on)Anthropic
10.7%
$3 / $15
260 DeepSeek-V4-Pro (0813, no reasoning)DeepSeek
10.6%
$1.32 / $3.96
261 Claude Haiku 4.5 (reasoning on)Anthropic
10.4%
$1 / $5
262 Qwen3-30B-A3B-Thinking-2507Alibaba
10.3%
$0.20 / $2.40
262 Magistral Medium 1.2Mistral AI
10.3%
–
262 Solar Pro 3Upstage
10.3%
$0.15 / $0.60
265 Qwen3-Coder-NextAlibaba
10.1%
$0.18 / $0.90
265 Qwen3-Max-PreviewAlibaba
10.1%
–
265 Qwen3-VL-32B-ThinkingAlibaba
10.1%
–
268 Qwen3.5-4B (reasoning on)Alibaba
9.9%
–
268 Mistral Small 4Mistral AI
9.9%
$0.15 / $0.60
270 GLM-5.2 (no reasoning)Z.ai
9.8%
$1.40 / $4.40
271 Granite 4.2 8BIBM
9.7%
$0.06 / $0.25
272 GLM-4.6V (reasoning on)Z.ai
9.6%
$0.30 / $0.90
273 GPT-5 nano (high reasoning)OpenAI
9.5%
$0.05 / $0.40
274 Qwen3.5-9B (no reasoning)Alibaba
9.4%
$0.10 / $0.15
275 Nova 2 Lite (medium reasoning)Amazon
9.0%
$0.30 / $2.50
275 DeepSeek-V3.2-Exp (no reasoning)DeepSeek
9.0%
$0.27 / $0.41
277 Qwen3-VL-30B-A3B-ThinkingAlibaba
8.9%
$0.29 / $1
278 DeepSeek-V3.1-Terminus (no reasoning)DeepSeek
8.7%
$0.27 / $1
278 Gemini 2.5 Flash Preview (09-2025, no reasoning)Google
8.7%
–
278 GPT-5 nano (medium reasoning)OpenAI
8.7%
$0.05 / $0.40
281 GPT-6 Luna (no reasoning)OpenAI
8.6%
$0.10 / $0.50
282 DeepSeek-R1DeepSeek
8.5%
$0.70 / $2.50
283 DeepSeek-V4-Pro (0423, no reasoning)DeepSeek
8.2%
$1.42 / $2.83
284 Qwen3.5-4B (no reasoning)Alibaba
8.0%
–
284 GPT-5.2 (no reasoning)OpenAI
8.0%
$1.75 / $14
284 Grok Code Fast 1xAI
8.0%
–
287 o3-miniOpenAI
7.9%
$1.10 / $4.40
288 DeepSeek-V4-Flash (0423, no reasoning)DeepSeek
7.8%
$0.14 / $0.28
289 Qwen3.5-Omni-FlashAlibaba
7.6%
–
289 Qwen3-Next-80B-A3B-InstructAlibaba
7.6%
$0.10 / $1.10
289 GLM-4.7-FlashZ.ai
7.6%
$0.06 / $0.40
289 GLM-5 (no reasoning)Z.ai
7.6%
$0.95 / $2.55
293 Qwen3-Omni-30B-A3B-ThinkingAlibaba
7.5%
–
294 Qwen3-32B (reasoning on)Alibaba
7.4%
$0.14 / $0.40
294 Kimi K2 (0711)Moonshot AI
7.4%
$0.57 / $2.30
296 Claude Sonnet 4.5 (no reasoning)Anthropic
7.2%
$3 / $15
296 GPT-5.6 Luna (no reasoning)OpenAI
7.2%
$0.20 / $1.20
298 Gemini 2.5 Flash-Lite Preview (09-2025, reasoning on)Google
7.0%
–
298 o1OpenAI
7.0%
$15 / $60
298 Hy3 Preview (no reasoning)Tencent
7.0%
$0.18 / $0.60
298 GLM-4.5-AirZ.ai
7.0%
$0.14 / $0.86
302 Qwen3-30B-A3B-Instruct-2507Alibaba
6.9%
$0.09 / $0.30
303 Qwen3-VL-32B-InstructAlibaba
6.8%
$0.10 / $0.42
303 Gemini 2.5 Flash-Lite (reasoning on)Google
6.8%
$0.10 / $0.40
303 Grok 4.3 (no reasoning)xAI
6.8%
$1.25 / $2.50
306 DeepSeek-V3.1 (no reasoning)DeepSeek
6.7%
$0.55 / $1.65
307 Qwen3-VL-235B-A22B-InstructAlibaba
6.6%
$0.30 / $1.50
307 GPT-5 ChatOpenAI
6.6%
–
309 Magistral Small 1.2Mistral AI
6.4%
–
309 Kimi K2 (0905)Moonshot AI
6.4%
$0.60 / $2.50
309 GLM-4.7 (no reasoning)Z.ai
6.4%
$0.54 / $1.98
312 Qwen3-VL-30B-A3B-InstructAlibaba
6.3%
$0.15 / $0.60
312 Gemma 4 12B (no reasoning)Google
6.3%
–
312 GLM-4.5V (reasoning on)Z.ai
6.3%
$0.60 / $1.80
315 Qwen3-30B-A3B (reasoning on)Alibaba
6.2%
$0.12 / $0.50
315 Qwen3-4B-Thinking-2507Alibaba
6.2%
–
317 GPT-5 (minimal reasoning)OpenAI
6.0%
$1.25 / $10
318 GPT-5.4 mini (no reasoning)OpenAI
5.9%
$0.75 / $4.50
318 gpt-oss-120b (low reasoning)OpenAI
5.9%
$0.15 / $0.60
320 Llama 3.2 1B InstructMeta
5.5%
$0.027 / $0.20
320 GLM-4.6 (no reasoning)Z.ai
5.5%
$0.50 / $2
322 Ministral 3 3BMistral AI
5.4%
$0.10 / $0.10
323 Gemma 3 4BGoogle
5.3%
$0.05 / $0.10
323 Llama 3.1 8B InstructMeta
5.3%
$0.05 / $0.08
323 Llama 3.2 3B InstructMeta
5.3%
$0.05 / $0.33
323 GPT-5.1 (no reasoning)OpenAI
5.3%
$1.25 / $10
323 gpt-oss-20b (low reasoning)OpenAI
5.3%
$0.03 / $0.15
328 Qwen3.5-0.8B (no reasoning)Alibaba
5.1%
–
328 Gemini 2.5 Flash-Lite Preview (09-2025, no reasoning)Google
5.1%
–
328 GPT-5 mini (minimal reasoning)OpenAI
5.1%
$0.25 / $2
328 Grok 4.1 Fast (non-reasoning, no reasoning)xAI
5.1%
–
332 Qwen3.5-2B (no reasoning)Alibaba
5.0%
–
332 GPT-4.1 miniOpenAI
5.0%
$0.40 / $1.60
332 GLM-4.7-Flash (no reasoning)Z.ai
5.0%
$0.06 / $0.40
335 Llama 4 MaverickMeta
4.9%
$0.27 / $0.85
336 Gemma 4 E2BGoogle
4.8%
–
336 Gemma 4 E4B (no reasoning)Google
4.8%
–
338 DeepSeek-V3-0324DeepSeek
4.7%
$0.25 / $1
338 Gemini 2.5 Flash (no reasoning)Google
4.7%
$0.30 / $2.50
338 Gemma 4 E2B (no reasoning)Google
4.7%
–
338 Mistral Medium 3.1Mistral AI
4.7%
$0.40 / $2
342 Qwen3-30B-A3B (no reasoning)Alibaba
4.6%
$0.12 / $0.50
342 Qwen3-Omni-30B-A3B-InstructAlibaba
4.6%
–
342 Qwen3-VL-4B-ThinkingAlibaba
4.6%
–
342 Nova Micro 1.0Amazon
4.6%
$0.035 / $0.14
342 Ministral 3 14BMistral AI
4.6%
$0.20 / $0.20
342 Nemotron 3 Nano 30B A3B (no reasoning)NVIDIA
4.6%
$0.05 / $0.20
348 Qwen3-14B (reasoning on)Alibaba
4.5%
$0.12 / $0.24
348 Qwen3-4B-Instruct-2507Alibaba
4.5%
–
348 Qwen3-Coder-480B-A35BAlibaba
4.5%
$0.35 / $1.50
348 Llama 3.1 70B InstructMeta
4.5%
$0.40 / $0.40
348 Grok 4 Fast (non-reasoning, no reasoning)xAI
4.5%
–
353 Gemma 3 27BGoogle
4.4%
$0.12 / $0.20
353 Reka Flash 3Reka AI
4.4%
$0.10 / $0.20
355 Nova Lite 1.0Amazon
4.3%
$0.06 / $0.24
355 Claude Sonnet 4 (no reasoning)Anthropic
4.3%
$3 / $15
355 Ministral 3 8BMistral AI
4.3%
$0.15 / $0.15
355 Mistral Small 3.1 24BMistral AI
4.3%
$0.35 / $0.56
355 Mistral Small 3.2 24BMistral AI
4.3%
$0.094 / $0.25
360 Qwen3-235B-A22B (no reasoning)Alibaba
4.2%
$0.46 / $1.82
360 Claude Haiku 4.5 (no reasoning)Anthropic
4.2%
$1 / $5
360 Gemma 3 12BGoogle
4.2%
$0.05 / $0.15
360 Mistral Large 3Mistral AI
4.2%
$0.50 / $1.50
360 GPT-4.1OpenAI
4.2%
$2 / $8
360 GPT-4o mini (2024-07-18)OpenAI
4.2%
$0.15 / $0.60
366 Qwen3-14B (no reasoning)Alibaba
4.1%
$0.12 / $0.24
366 Qwen3-32B (no reasoning)Alibaba
4.1%
$0.14 / $0.40
366 Mistral Medium 3Mistral AI
4.1%
$0.40 / $2
366 GPT-5.4 nano (no reasoning)OpenAI
4.1%
$0.20 / $1.25
370 Nova 2 Lite (low reasoning)Amazon
4.0%
$0.30 / $2.50
370 Command ACohere
4.0%
$2.50 / $10
370 Mixtral 8x22B InstructMistral AI
4.0%
$2 / $6
370 GPT-5 nano (minimal reasoning)OpenAI
4.0%
$0.05 / $0.40
374 Qwen3-8B (reasoning on)Alibaba
3.9%
$0.12 / $0.46
375 Qwen3-Coder-30B-A3B-InstructAlibaba
3.8%
$0.07 / $0.28
375 Qwen3-VL-8B-ThinkingAlibaba
3.8%
$0.18 / $2.10
375 Gemma 4 E4BGoogle
3.8%
–
375 Llama 4 ScoutMeta
3.8%
$0.18 / $0.59
375 Phi-4Microsoft
3.8%
$0.07 / $0.14
375 Devstral MediumMistral AI
3.8%
–
375 Devstral Small 1.1Mistral AI
3.8%
–
375 Mistral Small 3Mistral AI
3.8%
$0.05 / $0.08
375 Mistral Small 4 (no reasoning)Mistral AI
3.8%
$0.15 / $0.60
375 GPT-4.1 nanoOpenAI
3.8%
$0.10 / $0.40
385 Gemini 2.5 Flash-Lite (no reasoning)Google
3.7%
$0.10 / $0.40
385 GLM-4.6V (no reasoning)Z.ai
3.7%
$0.30 / $0.90
387 Qwen2.5-72B-InstructAlibaba
3.6%
$0.36 / $0.40
387 Qwen3-VL-4B-InstructAlibaba
3.6%
–
387 Gemma 3 270MGoogle
3.6%
–
387 Llama 3.3 70B InstructMeta
3.6%
$0.59 / $0.79
387 Devstral 2Mistral AI
3.6%
$0.40 / $2
392 Qwen2.5-Coder-32B-InstructAlibaba
3.5%
$0.66 / $1
392 Devstral Small 2Mistral AI
3.5%
–
392 GLM-4.5V (no reasoning)Z.ai
3.5%
$0.60 / $1.80
395 Nova Pro 1.0Amazon
3.2%
$0.80 / $3.20
396 Nova 2 Lite (no reasoning)Amazon
2.9%
$0.30 / $2.50
396 DeepSeek-V3DeepSeek
2.9%
$0.26 / $1.03
396 Mistral Large 2 (2407)Mistral AI
2.9%
$2 / $6
399 Qwen3-VL-8B-InstructAlibaba
2.7%
$0.12 / $0.46
400 Qwen3.5-2B (reasoning on)Alibaba
2.6%
–
401 Kimi Linear 48B A3B InstructMoonshot AI
2.5%
–
402 GPT-4o (2024-08-06)OpenAI
2.3%
$2.50 / $10
403 Qwen3-8B (no reasoning)Alibaba
1.9%
$0.12 / $0.46
404 GPT-4o (2024-05-13)OpenAI
1.8%
$5 / $15
405 Qwen3.5-0.8B (reasoning on)Alibaba
1.1%
–

Swipe the table sideways for more columns.

Ranks follow the score as shown, so equal numbers share a rank. Results as published by Artificial Analysis; we do not re-run them.

What it measures

Share of expert-written exam questions answered correctly, as run by Artificial Analysis with its own harness and prompts.

What it does not measure

Not everyday work; academic questions at the edge of expertise.

282 results from Artificial Analysis not ranked here · show why

We rank a result only when we can tie it to a specific model you can use. These are left out:

  • Not on sale through the API providers we track: 268
  • A different snapshot or variant from the model we list: 13
  • An unusual combination of settings: 1

Data sourced from Artificial Analysis. Licence: Artificial Analysis commercial data licence.