Benchmarks / Artificial Analysis

Reported by Artificial Analysis

Artificial Analysis

Share of graduate-level science questions answered correctly, as run by Artificial Analysis with its own harness and prompts.

Last updated 8 Oct 2026

Results dated
8 Oct 2026
Results
359 configurations of 231 models
Unit
% of questions
Licence
Artificial Analysis commercial data licence

GPQA Diamond: DiffusionGemma 26B A4B

Top 15 of 359 results · % of questions, higher is better. Choose a model to highlight it.Clear highlight

  1. 1 GPT-6 Astra (extra-high reasoning)OpenAI 96.3%
  2. 2 GPT-6 Astra (max reasoning)OpenAI 96.1%
  3. 3 Gemini 3.8 Flash (high reasoning)Google 95.3%
  4. 4 GPT-6 Astra (high reasoning)OpenAI 94.9%
  5. 4 Grok 4.6 (high reasoning)xAI 94.9%
  6. 6 Gemini 3.7 Flash (high reasoning)Google 94.5%
  7. 7 Gemini 3.1 Pro PreviewGoogle 94.1%
  8. 7 Muse Spark 1.3 (extra-high reasoning)Meta 94.1%
  9. 7 GPT-5.6 Sol (max reasoning)OpenAI 94.1%
  10. 10 GPT-6 Astra (medium reasoning)OpenAI 93.9%
  11. 11 Claude Fable 5.1 (max reasoning)Anthropic 93.7%
  12. 11 Claude Opus 5 (high reasoning)Anthropic 93.7%
  13. 11 Claude Opus 5 (extra-high reasoning)Anthropic 93.7%
  14. 14 Qwen3.8-2.4T-A95BAlibaba 93.5%
  15. 14 Gemini 3.8 Flash (medium reasoning)Google 93.5%
  16. 265 DiffusionGemma 26B A4BGoogle 66.9%

Full results

Artificial Analysis: GPQA Diamond, % of questions, higher is better
#ModelGPQA Diamond
% of questions, higher is better
Price
$ per million tokens, in / out
1 GPT-6 Astra (extra-high reasoning)OpenAI
96.3%
$10 / $50
2 GPT-6 Astra (max reasoning)OpenAI
96.1%
$10 / $50
3 Gemini 3.8 Flash (high reasoning)Google
95.3%
$1.50 / $7.50
4 GPT-6 Astra (high reasoning)OpenAI
94.9%
$10 / $50
4 Grok 4.6 (high reasoning)xAI
94.9%
$2 / $6
6 Gemini 3.7 Flash (high reasoning)Google
94.5%
$1.50 / $7.50
7 Gemini 3.1 Pro PreviewGoogle
94.1%
$2 / $12
7 Muse Spark 1.3 (extra-high reasoning)Meta
94.1%
$1.25 / $4.25
7 GPT-5.6 Sol (max reasoning)OpenAI
94.1%
$4 / $20
10 GPT-6 Astra (medium reasoning)OpenAI
93.9%
$10 / $50
11 Claude Fable 5.1 (max reasoning)Anthropic
93.7%
$10 / $50
11 Claude Opus 5 (high reasoning)Anthropic
93.7%
$5 / $25
11 Claude Opus 5 (extra-high reasoning)Anthropic
93.7%
$5 / $25
14 Qwen3.8-2.4T-A95BAlibaba
93.5%
$2 / $6
14 Gemini 3.8 Flash (medium reasoning)Google
93.5%
$1.50 / $7.50
14 Muse Spark 1.3 (max reasoning)Meta
93.5%
$1.25 / $4.25
14 Kimi K3 (max reasoning)Moonshot AI
93.5%
$3 / $15
14 GPT-5.5 (extra-high reasoning)OpenAI
93.5%
$5 / $30
14 Grok 4.6 (medium reasoning)xAI
93.5%
$2 / $6
14 Grok 4.6 (extra-high reasoning)xAI
93.5%
$2 / $6
21 Claude Fable 5.1 (extra-high reasoning)Anthropic
93.4%
$10 / $50
22 Claude Opus 5 (max reasoning)Anthropic
93.2%
$5 / $25
22 GPT-5.5 (high reasoning)OpenAI
93.2%
$5 / $30
24 GPT-5.6 Sol (extra-high reasoning)OpenAI
93.1%
$4 / $20
24 GPT-6 Astra (low reasoning)OpenAI
93.1%
$10 / $50
24 Grok 4.5 (high reasoning)xAI
93.1%
$2 / $6
27 MiniMax-M3MiniMax
92.9%
$0.30 / $1.20
28 Qwen3.8-Max (0902)Alibaba
92.8%
$2 / $6
28 DeepSeek-V4-Pro (0813, max reasoning)DeepSeek
92.8%
$1.32 / $3.96
28 Gemini 3.6 Flash (high reasoning)Google
92.8%
$1.50 / $7.50
28 GPT-5.6 Sol (high reasoning)OpenAI
92.8%
$4 / $20
32 Qwen3.8-Max (0803)Alibaba
92.7%
–
33 Claude Fable 5 (max reasoning)Anthropic
92.6%
$10 / $50
33 GPT-5.5 (medium reasoning)OpenAI
92.6%
$5 / $30
33 GPT-5.6 Sol (medium reasoning)OpenAI
92.6%
$4 / $20
36 GPT-5.6 Terra (max reasoning)OpenAI
92.5%
$2 / $12
37 Qwen3.7-MaxAlibaba
92.3%
$1.48 / $4.42
37 Qwen3.8-Flash-NextAlibaba
92.3%
–
39 Gemini 3.5 Flash (high reasoning)Google
92.2%
$1.50 / $9
40 Gemini 3.5 Flash (medium reasoning)Google
92.1%
$1.50 / $9
40 Gemini 3.7 Flash (medium reasoning)Google
92.1%
$1.50 / $7.50
42 Claude Opus 4.8 (max reasoning)Anthropic
92.0%
$5 / $25
42 Gemini 3.8 Flash (low reasoning)Google
92.0%
$1.50 / $7.50
42 GPT-5.4 (extra-high reasoning)OpenAI
92.0%
$2.50 / $15
45 Claude Opus 5 (medium reasoning)Anthropic
91.9%
$5 / $25
46 GLM-5.3 (max reasoning)Z.ai
91.7%
$1.40 / $4.40
47 GPT-5.3-Codex (extra-high reasoning)OpenAI
91.5%
$1.75 / $14
48 Claude Opus 4.7 (max reasoning)Anthropic
91.4%
$5 / $25
49 DeepSeek-V4-Flash-Vision-Exp (max reasoning)DeepSeek
91.3%
$0.44 / $1.32
50 GLM-5.3-FlashZ.ai
91.2%
$0.15 / $0.50
51 Claude Sonnet 5 (max reasoning)Anthropic
91.1%
$2 / $10
51 Kimi K2.6Moonshot AI
91.1%
$0.95 / $4
51 GPT-5.6 Luna (max reasoning)OpenAI
91.1%
$0.20 / $1.20
51 Grok 4.20xAI
91.1%
$1.25 / $2.50
55 GPT-5.5 (low reasoning)OpenAI
91.0%
$5 / $30
56 DeepSeek-V4-Flash (0731, max reasoning)DeepSeek
90.8%
$0.14 / $0.28
56 Gemini 3 Pro Preview (high reasoning)Google
90.8%
–
56 GPT-5.6 Terra (extra-high reasoning)OpenAI
90.8%
$2 / $12
59 Claude Fable 5.1 (high reasoning)Anthropic
90.6%
$10 / $50
60 Qwen3.8-27B (extra-high reasoning)Alibaba
90.5%
$0.50 / $3
60 DeepSeek-V4-Pro (0423, high reasoning)DeepSeek
90.5%
$1.42 / $2.83
62 Muse Spark 1.2 (extra-high reasoning)Meta
90.4%
$1.25 / $4.25
63 GPT-5.2 (extra-high reasoning)OpenAI
90.3%
$1.75 / $14
64 Gemini 3.7 Flash (low reasoning)Google
90.1%
$1.50 / $7.50
64 Grok 4.3 (high reasoning)xAI
90.1%
$1.25 / $2.50
66 Qwen3.7-PlusAlibaba
90.0%
$0.32 / $1.28
67 GPT-5.2-Codex (extra-high reasoning)OpenAI
89.9%
$1.75 / $14
68 Gemini 3 Flash Preview (reasoning on)Google
89.8%
$0.50 / $3
68 Muse Spark 1.1 (extra-high reasoning)Meta
89.8%
$1.25 / $4.25
68 GPT-5.6 Sol (low reasoning)OpenAI
89.8%
$4 / $20
71 Hy3Tencent
89.7%
$0.14 / $0.58
72 Claude Opus 4.6 (max reasoning)Anthropic
89.6%
$5 / $25
72 Kimi K2.7 CodeMoonshot AI
89.6%
$0.95 / $4
72 GPT-5.6 Terra (high reasoning)OpenAI
89.6%
$2 / $12
75 GPT-5.6 Luna (extra-high reasoning)OpenAI
89.5%
$0.20 / $1.20
75 Inkling SmallThinking Machines
89.5%
$0.45 / $1.20
75 Grok Build 0.1xAI
89.5%
$1 / $2
75 GLM-5.2 (max reasoning)Z.ai
89.5%
$1.40 / $4.40
79 DeepSeek-V4-Flash (0423, max reasoning)DeepSeek
89.4%
$0.14 / $0.28
80 Qwen3.5-397B-A17BAlibaba
89.3%
$0.55 / $3.50
81 GPT-5.6 Luna (high reasoning)OpenAI
89.2%
$0.20 / $1.20
82 Solar Pro 4Upstage
89.1%
$0.09 / $0.36
83 Grok 4.3 (medium reasoning)xAI
89.0%
$1.25 / $2.50
84 Claude Opus 5 (low reasoning)Anthropic
88.9%
$5 / $25
85 Qwen3.6-Max-PreviewAlibaba
88.8%
$1.03 / $6.16
85 DeepSeek-V4-Pro (0423, max reasoning)DeepSeek
88.8%
$1.42 / $2.83
87 Gemini 3 Pro Preview (low reasoning)Google
88.7%
–
88 Claude Fable 5.1 (medium reasoning)Anthropic
88.6%
$10 / $50
89 Claude Opus 4.7 (no reasoning)Anthropic
88.5%
$5 / $25
89 Grok 4.20 (0309, reasoning)xAI
88.5%
–
91 Muse SparkMeta
88.4%
–
92 Qwen3.6-PlusAlibaba
88.2%
$0.33 / $1.95
93 Claude Fable 5.1 (low reasoning)Anthropic
88.1%
$10 / $50
94 Kimi K2.5Moonshot AI
87.9%
$0.57 / $2.85
94 Grok 4.6 (low reasoning)xAI
87.9%
$2 / $6
96 Grok 4xAI
87.7%
–
97 Claude Sonnet 4.6 (max reasoning)Anthropic
87.5%
$3 / $15
97 GPT-5.4 mini (extra-high reasoning)OpenAI
87.5%
$0.75 / $4.50
99 MiniMax-M2.7MiniMax
87.4%
$0.30 / $1.20
100 GPT-5.1 (high reasoning)OpenAI
87.3%
$1.25 / $10
101 GPT-5.6 Terra (medium reasoning)OpenAI
87.2%
$2 / $12
101 Inkling (extra-high reasoning)Thinking Machines
87.2%
$0.95 / $4.05
103 DeepSeek-V3.2-SpecialeDeepSeek
87.1%
–
103 GPT-5.4 (low reasoning)OpenAI
87.1%
$2.50 / $15
105 GLM-5.1Z.ai
86.8%
$1.38 / $4.40
106 DeepSeek-V4-Flash (0423, high reasoning)DeepSeek
86.7%
$0.14 / $0.28
106 Hy3 Preview (reasoning on)Tencent
86.7%
$0.18 / $0.60
108 Claude Opus 4.5 (reasoning on)Anthropic
86.6%
$5 / $25
108 MiMo-V2.5-Pro (reasoning on)Xiaomi
86.6%
$0.43 / $0.87
110 GPT-5.2 (medium reasoning)OpenAI
86.4%
$1.75 / $14
111 Qwen3.5-397B-A17B (no reasoning)Alibaba
86.1%
$0.55 / $3.50
111 Qwen3-Max-ThinkingAlibaba
86.1%
$0.78 / $3.90
113 GPT-5.1-Codex (high reasoning)OpenAI
86.0%
$1.25 / $10
114 GPT-5.6 Luna (medium reasoning)OpenAI
85.9%
$0.20 / $1.20
114 GLM-4.7Z.ai
85.9%
$0.54 / $1.98
116 Qwen3.5-27BAlibaba
85.8%
$0.27 / $2.16
117 Qwen3.5-122B-A10BAlibaba
85.7%
$0.26 / $2.08
117 Gemma 4 31BGoogle
85.7%
$0.14 / $0.40
119 GPT-5 (high reasoning)OpenAI
85.4%
$1.25 / $10
120 Grok 4.1 Fast (reasoning)xAI
85.3%
–
121 MiMo-V2.5Xiaomi
84.9%
$0.17 / $0.34
122 MiniMax-M2.5MiniMax
84.8%
$0.30 / $1.20
123 Grok 4 Fast (reasoning)xAI
84.7%
–
123 GLM-5-TurboZ.ai
84.7%
$1.20 / $4
125 GPT-5.5 Instant (2026-05-26)OpenAI
84.6%
–
126 Qwen3.5-35B-A3BAlibaba
84.5%
$0.16 / $1.30
126 Qwen3.8-27B (low reasoning)Alibaba
84.5%
$0.50 / $3
126 Qwen3.8-27B (medium reasoning)Alibaba
84.5%
$0.50 / $3
126 o3-proOpenAI
84.5%
$20 / $80
130 Gemini 2.5 ProGoogle
84.4%
$1.25 / $10
131 GPT-5.6 Terra (low reasoning)OpenAI
84.3%
$2 / $12
131 Grok 4.3 (low reasoning)xAI
84.3%
$1.25 / $2.50
133 Qwen3.5-27B (no reasoning)Alibaba
84.2%
$0.27 / $2.16
133 Qwen3.6-27BAlibaba
84.2%
$0.30 / $3.20
133 Kimi K3 (low reasoning)Moonshot AI
84.2%
$3 / $15
133 GPT-5 (medium reasoning)OpenAI
84.2%
$1.25 / $10
137 Qwen3.6-35B-A3BAlibaba
84.1%
$0.10 / $1
138 Claude Opus 4.6 (no reasoning)Anthropic
84.0%
$5 / $25
138 DeepSeek-V3.2 (reasoning on)DeepSeek
84.0%
$0.30 / $0.96
140 GLM-5.1 (no reasoning)Z.ai
83.9%
$1.38 / $4.40
141 Gemini 3.5 Flash-LiteGoogle
83.8%
$0.30 / $2.50
141 Kimi K2 ThinkingMoonshot AI
83.8%
$0.60 / $2.50
143 GPT-5-Codex (high reasoning)OpenAI
83.7%
–
144 Muse Glimmer (high reasoning)Meta
83.5%
–
144 GPT-5.6 Luna (low reasoning)OpenAI
83.5%
$0.20 / $1.20
146 Claude Sonnet 4.5 (reasoning on)Anthropic
83.4%
$3 / $15
147 Step 3.5 FlashStepFun
83.1%
$0.10 / $0.30
148 MiniMax-M2.1MiniMax
83.0%
$0.30 / $1.20
149 Qwen3.6-27B (no reasoning)Alibaba
82.9%
$0.30 / $3.20
150 Gemini 3.5 Flash (minimal reasoning)Google
82.8%
$1.50 / $9
150 GPT-5 mini (high reasoning)OpenAI
82.8%
$0.25 / $2
152 Qwen3.5-122B-A10B (no reasoning)Alibaba
82.7%
$0.26 / $2.08
152 o3OpenAI
82.7%
$2 / $8
154 Qwen3.5-Omni-PlusAlibaba
82.6%
–
155 GPT-5.4 mini (medium reasoning)OpenAI
82.3%
$0.75 / $4.50
155 GPT-5.5 Instant (2026-06-26)OpenAI
82.3%
–
157 Gemini 3.1 Flash-Lite PreviewGoogle
82.2%
$0.25 / $1.50
158 GLM-5Z.ai
82.0%
$0.95 / $2.55
159 Qwen3.5-35B-A3B (no reasoning)Alibaba
81.9%
$0.16 / $1.30
160 Qwen3.8-27B (no reasoning)Alibaba
81.8%
$0.50 / $3
161 Qwen3.6-35B-A3B (no reasoning)Alibaba
81.7%
$0.10 / $1
161 GPT-5.4 nano (extra-high reasoning)OpenAI
81.7%
$0.20 / $1.25
163 DeepSeek-R1-0528DeepSeek
81.3%
$0.50 / $2.18
163 GPT-5.1-Codex-Mini (high reasoning)OpenAI
81.3%
$0.25 / $2
165 Gemini 3 Flash Preview (no reasoning)Google
81.2%
$0.50 / $3
166 Nova 2 Lite (high reasoning)Amazon
81.1%
$0.30 / $2.50
167 Claude Opus 4.5 (no reasoning)Anthropic
81.0%
$5 / $25
168 Claude Opus 4.1 (reasoning on)Anthropic
80.9%
$15 / $75
168 GLM-5V-TurboZ.ai
80.9%
$1.20 / $4
170 GPT-5 (low reasoning)OpenAI
80.8%
$1.25 / $10
171 Qwen3.5-9BAlibaba
80.6%
$0.10 / $0.15
172 GPT-5 mini (medium reasoning)OpenAI
80.3%
$0.25 / $2
173 Claude Sonnet 5 (no reasoning)Anthropic
80.0%
$2 / $10
173 Nemotron 3 Super 120B A12BNVIDIA
80.0%
$0.085 / $0.40
175 Claude Sonnet 4.6 (no reasoning)Anthropic
79.9%
$3 / $15
176 DeepSeek-V3.2-Exp (reasoning on)DeepSeek
79.7%
$0.27 / $0.41
177 Gemini 2.5 Flash Preview (09-2025, reasoning on)Google
79.3%
–
178 DeepSeek-V3.1-Terminus (reasoning on)DeepSeek
79.2%
$0.27 / $1
178 Gemma 4 26B A4BGoogle
79.2%
$0.10 / $0.30
180 Qwen3-235B-A22B-Thinking-2507Alibaba
79.0%
$0.30 / $3
180 Gemini 2.5 Flash (reasoning on)Google
79.0%
$0.30 / $2.50
180 GPT-5.6 Sol (no reasoning)OpenAI
79.0%
$4 / $20
183 Kimi K2.5 (no reasoning)Moonshot AI
78.9%
$0.57 / $2.85
184 Kimi K2.6 (no reasoning)Moonshot AI
78.8%
$0.95 / $4
185 Qwen3.5-9B (no reasoning)Alibaba
78.6%
$0.10 / $0.15
186 Grok 4.20 (0309, non-reasoning, no reasoning)xAI
78.5%
–
187 o4-mini (high reasoning)OpenAI
78.4%
$1.10 / $4.40
188 gpt-oss-120b (high reasoning)OpenAI
78.2%
$0.15 / $0.60
188 GLM-4.5Z.ai
78.2%
$0.60 / $2.20
190 GLM-4.6 (reasoning on)Z.ai
78.0%
$0.50 / $2
191 DeepSeek-V3.1 (reasoning on)DeepSeek
77.9%
$0.55 / $1.65
192 Claude Sonnet 4 (reasoning on)Anthropic
77.7%
$3 / $15
192 MiniMax-M2MiniMax
77.7%
$0.30 / $1.20
194 Qwen3-Max-Thinking-PreviewAlibaba
77.6%
–
194 Grok 4.20 (no reasoning)xAI
77.6%
$1.25 / $2.50
196 o3-mini (high reasoning)OpenAI
77.3%
$1.10 / $4.40
197 Qwen3-VL-235B-A22B-ThinkingAlibaba
77.2%
$0.40 / $4
198 Qwen3.5-4B (reasoning on)Alibaba
77.1%
–
199 Mercury 2Inception
77.0%
$0.25 / $0.75
200 Mistral Small 4Mistral AI
76.9%
$0.15 / $0.60
201 Nova 2 Lite (medium reasoning)Amazon
76.8%
$0.30 / $2.50
201 GPT-5.5 (no reasoning)OpenAI
76.8%
$5 / $30
203 Kimi K2 (0905)Moonshot AI
76.7%
$0.60 / $2.50
204 Gemini 2.5 Flash Preview (09-2025, no reasoning)Google
76.6%
–
204 Kimi K2 (0711)Moonshot AI
76.6%
$0.57 / $2.30
206 Qwen3-Max-PreviewAlibaba
76.4%
–
206 Qwen3-MaxAlibaba
76.4%
$0.78 / $3.90
208 Gemma 4 31B (no reasoning)Google
76.3%
$0.14 / $0.40
209 MiMo-V2.5-Pro (no reasoning)Xiaomi
76.2%
$0.43 / $0.87
210 GPT-5.4 nano (medium reasoning)OpenAI
76.1%
$0.20 / $1.25
211 Qwen3-Next-80B-A3B-ThinkingAlibaba
75.9%
$0.15 / $1.20
212 Nemotron 3 Nano 30B A3B (reasoning on)NVIDIA
75.7%
$0.05 / $0.20
213 Qwen3-235B-A22B-Instruct-2507Alibaba
75.3%
$0.15 / $0.75
213 Gemma 4 12BGoogle
75.3%
–
215 Trinity Large ThinkingArcee AI
75.2%
$0.25 / $0.80
216 DeepSeek-V3.1-Terminus (no reasoning)DeepSeek
75.1%
$0.27 / $1
216 DeepSeek-V3.2 (no reasoning)DeepSeek
75.1%
$0.30 / $0.96
218 Mistral Medium 3.5Mistral AI
74.8%
$1.50 / $7.50
218 GPT-5.4 (no reasoning)OpenAI
74.8%
$2.50 / $15
218 o3-miniOpenAI
74.8%
$1.10 / $4.40
221 o1OpenAI
74.7%
$15 / $60
222 GPT-5.6 Terra (no reasoning)OpenAI
74.6%
$2 / $12
223 Qwen3.5-Omni-FlashAlibaba
74.2%
–
224 Magistral Medium 1.2Mistral AI
73.9%
–
225 Qwen3-Next-80B-A3B-InstructAlibaba
73.8%
$0.10 / $1.10
225 DeepSeek-V3.2-Exp (no reasoning)DeepSeek
73.8%
$0.27 / $0.41
227 Qwen3-Coder-NextAlibaba
73.7%
$0.18 / $0.90
228 DeepSeek-V3.1 (no reasoning)DeepSeek
73.5%
$0.55 / $1.65
229 Qwen3-VL-32B-ThinkingAlibaba
73.3%
–
229 GLM-4.5-AirZ.ai
73.3%
$0.14 / $0.86
231 Hy3 Preview (no reasoning)Tencent
73.2%
$0.18 / $0.60
232 Claude Sonnet 4.5 (no reasoning)Anthropic
72.7%
$3 / $15
232 Grok Code Fast 1xAI
72.7%
–
234 Qwen3-Omni-30B-A3B-ThinkingAlibaba
72.6%
–
235 Solar Pro 3Upstage
72.4%
$0.15 / $0.60
236 Qwen3-VL-30B-A3B-ThinkingAlibaba
72.0%
$0.29 / $1
237 GLM-4.6V (reasoning on)Z.ai
71.9%
$0.30 / $0.90
238 DeepSeek-V4-Pro (0423, no reasoning)DeepSeek
71.7%
$1.42 / $2.83
239 DeepSeek-V4-Flash (0423, no reasoning)DeepSeek
71.6%
$0.14 / $0.28
240 Gemma 4 26B A4B (no reasoning)Google
71.4%
$0.10 / $0.30
241 Qwen3.5-4B (no reasoning)Alibaba
71.2%
–
241 Qwen3-VL-235B-A22B-InstructAlibaba
71.2%
$0.30 / $1.50
241 GPT-5.2 (no reasoning)OpenAI
71.2%
$1.75 / $14
244 Gemini 2.5 Flash-Lite Preview (09-2025, reasoning on)Google
70.9%
–
245 DeepSeek-R1DeepSeek
70.8%
$0.70 / $2.50
246 Qwen3-30B-A3B-Thinking-2507Alibaba
70.7%
$0.20 / $2.40
247 Qwen3-235B-A22B (reasoning on)Alibaba
70.0%
$0.46 / $1.82
248 Nova 2 Lite (low reasoning)Amazon
69.8%
$0.30 / $2.50
249 Qwen3-VL-30B-A3B-InstructAlibaba
69.5%
$0.15 / $0.60
250 gpt-oss-20b (high reasoning)OpenAI
68.8%
$0.03 / $0.15
251 GPT-5 mini (minimal reasoning)OpenAI
68.7%
$0.25 / $2
252 GPT-5 ChatOpenAI
68.6%
–
252 GLM-5.2 (no reasoning)Z.ai
68.6%
$1.40 / $4.40
254 GLM-4.5V (reasoning on)Z.ai
68.4%
$0.60 / $1.80
255 Claude Sonnet 4 (no reasoning)Anthropic
68.3%
$3 / $15
255 Gemini 2.5 Flash (no reasoning)Google
68.3%
$0.30 / $2.50
257 Mistral Large 3Mistral AI
68.0%
$0.50 / $1.50
258 GPT-5 nano (high reasoning)OpenAI
67.6%
$0.05 / $0.40
259 GPT-5 (minimal reasoning)OpenAI
67.3%
$1.25 / $10
260 Claude Haiku 4.5 (reasoning on)Anthropic
67.2%
$1 / $5
260 gpt-oss-120b (low reasoning)OpenAI
67.2%
$0.15 / $0.60
262 Qwen3-VL-32B-InstructAlibaba
67.1%
$0.10 / $0.42
262 Llama 4 MaverickMeta
67.1%
$0.27 / $0.85
264 GPT-5 nano (medium reasoning)OpenAI
67.0%
$0.05 / $0.40
265 DiffusionGemma 26B A4BGoogle
66.9%
–
266 Qwen3-32B (reasoning on)Alibaba
66.8%
$0.14 / $0.40
267 Qwen3-4B-Thinking-2507Alibaba
66.7%
–
268 GPT-4.1OpenAI
66.6%
$2 / $8
268 GLM-5 (no reasoning)Z.ai
66.6%
$0.95 / $2.55
270 GPT-4.1 miniOpenAI
66.4%
$0.40 / $1.60
270 GLM-4.7 (no reasoning)Z.ai
66.4%
$0.54 / $1.98
272 Magistral Small 1.2Mistral AI
66.3%
–
273 Gemma 4 12B (no reasoning)Google
66.1%
–
274 Qwen3-30B-A3B-Instruct-2507Alibaba
65.9%
$0.09 / $0.30
275 Grok 4.3 (no reasoning)xAI
65.8%
$1.25 / $2.50
276 DeepSeek-V3-0324DeepSeek
65.5%
$0.25 / $1
277 Gemini 2.5 Flash-Lite Preview (09-2025, no reasoning)Google
65.1%
–
278 Claude Haiku 4.5 (no reasoning)Anthropic
64.6%
$1 / $5
279 GPT-5.6 Luna (no reasoning)OpenAI
64.5%
$0.20 / $1.20
280 GPT-5.1 (no reasoning)OpenAI
64.3%
$1.25 / $10
281 Grok 4.1 Fast (non-reasoning, no reasoning)xAI
63.7%
–
282 GLM-4.6 (no reasoning)Z.ai
63.2%
$0.50 / $2
283 Granite 4.2 8BIBM
63.1%
$0.06 / $0.25
284 Gemini 2.5 Flash-Lite (reasoning on)Google
62.5%
$0.10 / $0.40
285 Qwen3-Omni-30B-A3B-InstructAlibaba
62.0%
–
286 Qwen3-Coder-480B-A35BAlibaba
61.8%
$0.35 / $1.50
287 Qwen3-30B-A3B (reasoning on)Alibaba
61.6%
$0.12 / $0.50
288 Qwen3-235B-A22B (no reasoning)Alibaba
61.3%
$0.46 / $1.82
289 gpt-oss-20b (low reasoning)OpenAI
61.1%
$0.03 / $0.15
290 GPT-5.4 mini (no reasoning)OpenAI
60.6%
$0.75 / $4.50
290 Grok 4 Fast (non-reasoning, no reasoning)xAI
60.6%
–
292 Qwen3-14B (reasoning on)Alibaba
60.4%
$0.12 / $0.24
293 Nova 2 Lite (no reasoning)Amazon
60.3%
$0.30 / $2.50
294 Devstral 2Mistral AI
59.4%
$0.40 / $2
295 Qwen3-8B (reasoning on)Alibaba
58.9%
$0.12 / $0.46
296 Mistral Medium 3.1Mistral AI
58.8%
$0.40 / $2
297 Llama 4 ScoutMeta
58.7%
$0.18 / $0.59
298 GLM-4.7-FlashZ.ai
58.1%
$0.06 / $0.40
299 Qwen3-VL-8B-ThinkingAlibaba
57.9%
$0.18 / $2.10
300 Mistral Medium 3Mistral AI
57.8%
$0.40 / $2
301 Gemma 4 E4BGoogle
57.6%
–
302 Phi-4Microsoft
57.5%
$0.07 / $0.14
303 GLM-4.5V (no reasoning)Z.ai
57.3%
$0.60 / $1.80
304 Ministral 3 14BMistral AI
57.2%
$0.20 / $0.20
305 Mistral Small 4 (no reasoning)Mistral AI
57.1%
$0.15 / $0.60
306 GLM-4.6V (no reasoning)Z.ai
56.6%
$0.30 / $0.90
307 GPT-5.4 nano (no reasoning)OpenAI
55.8%
$0.20 / $1.25
308 DeepSeek-V3DeepSeek
55.7%
$0.26 / $1.03
309 Gemma 4 E4B (no reasoning)Google
54.9%
–
310 Qwen3-32B (no reasoning)Alibaba
53.5%
$0.14 / $0.40
311 Devstral Small 2Mistral AI
53.2%
–
312 Reka Flash 3Reka AI
52.9%
$0.10 / $0.20
313 Command ACohere
52.7%
$2.50 / $10
314 GPT-4o (2024-05-13)OpenAI
52.6%
$5 / $15
315 GPT-4o (2024-08-06)OpenAI
52.1%
$2.50 / $10
316 Qwen3-4B-Instruct-2507Alibaba
51.7%
–
317 Qwen3-Coder-30B-A3B-InstructAlibaba
51.6%
$0.07 / $0.28
318 Qwen3-30B-A3B (no reasoning)Alibaba
51.5%
$0.12 / $0.50
319 GPT-4.1 nanoOpenAI
51.2%
$0.10 / $0.40
320 Mistral Small 3.2 24BMistral AI
50.5%
$0.094 / $0.25
321 Nova Pro 1.0Amazon
49.9%
$0.80 / $3.20
322 Llama 3.3 70B InstructMeta
49.8%
$0.59 / $0.79
323 Qwen3-VL-4B-ThinkingAlibaba
49.4%
–
324 Devstral MediumMistral AI
49.2%
–
325 Qwen2.5-72B-InstructAlibaba
49.1%
$0.36 / $0.40
326 Gemini 2.5 Flash-Lite (no reasoning)Google
47.4%
$0.10 / $0.40
327 Mistral Large 2 (2407)Mistral AI
47.2%
$2 / $6
328 Ministral 3 8BMistral AI
47.1%
$0.15 / $0.15
329 Qwen3-14B (no reasoning)Alibaba
47.0%
$0.12 / $0.24
330 Mistral Small 3Mistral AI
46.2%
$0.05 / $0.08
331 Qwen3.5-2B (reasoning on)Alibaba
45.6%
–
332 Mistral Small 3.1 24BMistral AI
45.4%
$0.35 / $0.56
333 Qwen3-8B (no reasoning)Alibaba
45.2%
$0.12 / $0.46
333 GLM-4.7-Flash (no reasoning)Z.ai
45.2%
$0.06 / $0.40
335 Qwen3.5-2B (no reasoning)Alibaba
43.8%
–
336 Nova Lite 1.0Amazon
43.3%
$0.06 / $0.24
336 Gemma 4 E2BGoogle
43.3%
–
338 Gemma 3 27BGoogle
42.8%
$0.12 / $0.20
338 GPT-5 nano (minimal reasoning)OpenAI
42.8%
$0.05 / $0.40
340 Qwen3-VL-8B-InstructAlibaba
42.7%
$0.12 / $0.46
341 GPT-4o mini (2024-07-18)OpenAI
42.6%
$0.15 / $0.60
342 Qwen2.5-Coder-32B-InstructAlibaba
41.7%
$0.66 / $1
343 Devstral Small 1.1Mistral AI
41.4%
–
344 Kimi Linear 48B A3B InstructMoonshot AI
41.2%
–
345 Llama 3.1 70B InstructMeta
40.9%
$0.40 / $0.40
346 Gemma 4 E2B (no reasoning)Google
40.5%
–
347 Nemotron 3 Nano 30B A3B (no reasoning)NVIDIA
39.9%
$0.05 / $0.20
348 Qwen3-VL-4B-InstructAlibaba
37.1%
–
349 Nova Micro 1.0Amazon
35.8%
$0.035 / $0.14
349 Ministral 3 3BMistral AI
35.8%
$0.10 / $0.10
351 Gemma 3 12BGoogle
34.9%
$0.05 / $0.15
352 Mixtral 8x22B InstructMistral AI
33.2%
$2 / $6
353 Gemma 3 4BGoogle
29.1%
$0.05 / $0.10
354 Llama 3.1 8B InstructMeta
25.9%
$0.05 / $0.08
355 Llama 3.2 3B InstructMeta
25.5%
$0.05 / $0.33
356 Qwen3.5-0.8B (no reasoning)Alibaba
23.6%
–
357 Gemma 3 270MGoogle
22.4%
–
358 Llama 3.2 1B InstructMeta
19.6%
$0.027 / $0.20
359 Qwen3.5-0.8B (reasoning on)Alibaba
11.1%
–

Swipe the table sideways for more columns.

Ranks follow the score as shown, so equal numbers share a rank. Results as published by Artificial Analysis; we do not re-run them.

What it measures

Share of graduate-level science questions answered correctly, as run by Artificial Analysis with its own harness and prompts.

What it does not measure

Not applied work; multiple-choice science questions.

282 results from Artificial Analysis not ranked here · show why

We rank a result only when we can tie it to a specific model you can use. These are left out:

  • Not on sale through the API providers we track: 268
  • A different snapshot or variant from the model we list: 13
  • An unusual combination of settings: 1

Data sourced from Artificial Analysis. Licence: Artificial Analysis commercial data licence.