Confirm Action

Are you sure you want to proceed?

Artificial Analysis · Public leaderboard snapshot

Results through 2026-07-30

AA-Omniscience Accuracy benchmark: model scores and methodology

The share of all AA-Omniscience questions answered correctly, including questions where a model abstains in the denominator.

Current published leader
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Top score
61%
Primary metric
Accuracy · higher is better
Evaluation subject
Model configuration in Artificial Analysis's evaluation system

Artificial Analysis public leaderboard snapshot

All current AA-Omniscience Accuracy model scores

244 configurations · 176 model entries

This reviewed Artificial Analysis snapshot · 30 July 2026 contains 244 current configurations with a reported AA-Omniscience Accuracy score. Figures are the rounded values displayed by Artificial Analysis; underlying source precision is retained in SQLite.

Leading models on AA-Omniscience Accuracy

The chart shows the 20 highest current configurations in this one Artificial Analysis snapshot. One mark per model, at its strongest published configuration. Score labels reproduce Artificial Analysis's rounded display value.

  1. Claude Fable 5 Adaptive Reasoning, Max Effort, Opus 4.8 Fallback 61%
  2. GPT-5.6 Sol 59%
  3. Gemini 3.1 Pro (Preview) 55%
  4. Claude Opus 5 54%
  5. Grok 4.5 52%
  6. Gemini 3.5 Flash high 52%
  7. GPT-5.3 Codex xhigh 52%
  8. Gemini 3.6 Flash high 50%
  9. Kimi K3 46%
  10. GPT-5.6 Terra 46%
  11. Muse Spark 45%
  12. GPT-5.5 Instant June 2026 44%
  13. DeepSeek V4 Pro Reasoning, Max Effort 43%
  14. GPT-5.6 Luna 42%
  15. Muse Spark 1.1 xhigh 41%
  16. Inkling xhigh 40%
  17. Gemini 2.5 Pro 39%
  18. Kimi K2.7 Code 39%
  19. o3 38%
  20. Claude Sonnet 5 Adaptive Reasoning, Max Effort 38%
0.0 30.7 61.4

Accuracy · higher is better

Current configurations with a reported AA-Omniscience Accuracy value; missing values are omitted.

How to interpret the result

What do AA-Omniscience Accuracy results mean?

Treat each row as a result for the named model configuration inside Artificial Analysis's evaluation setup, not as a property of bare model weights.

1. Read the displayed figure

Higher accuracy is better. The public table rounds the displayed score, while Springprompt retains the source precision.

2. Check the evaluated system

The score depends on the model configuration, Artificial Analysis harness, tools, task budget, repeats, and scoring protocol.

3. Compare within one contract

Use rows from this same field and snapshot for the cleanest comparison. Do not merge vendor-reported or differently harnessed scores into this table.

The leaderboard is decision evidence, not a universal model ranking: match the benchmark contract to the work you actually need done.

Read AA-Omniscience Accuracy as a result of Artificial Analysis's evaluated model configuration and methodology—not as a context-free model property.

Every row comes from Artificial Analysis snapshot · 30 July 2026, recorded 30 Jul 2026.

#ModelConfigurationAccuracy
1 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Leader Adaptive Reasoning, Max Effort, Opus 4.8 Fallback 61%
2 GPT-5.6 Sol max 59%
3 GPT-5.6 Sol (xhigh) xhigh 58%
4 GPT-5.6 Sol (high) high 57%
5 GPT-5.6 Sol (medium) medium 57%
6 GPT-5.6 Sol (low) low 56%
7 Gemini 3.1 Pro (Preview) Published configuration 55%
8 Claude Opus 5 Adaptive Reasoning, Max Effort 54%
9 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) Adaptive Reasoning, Xhigh Effort 53%
10 Claude Opus 5 (Adaptive Reasoning, High Effort) Adaptive Reasoning, High Effort 53%
11 Grok 4.5 high 52%
12 Gemini 3.5 Flash (high) high 52%
13 GPT-5.3 Codex (xhigh) xhigh 52%
14 Gemini 3.5 Flash (medium) medium 51%
15 Claude Opus 5 (Adaptive Reasoning, Medium Effort) Adaptive Reasoning, Medium Effort 51%
16 Claude Opus 5 (Adaptive Reasoning, Low Effort) Adaptive Reasoning, Low Effort 50%
17 Gemini 3.6 Flash (high) high 50%
18 GPT-5.6 Sol (Non-reasoning) Non-reasoning 48%
19 Kimi K3 Published configuration 46%
20 GPT-5.6 Terra max 46%
21 GPT-5.6 Terra (xhigh) xhigh 45%
22 Muse Spark Published configuration 45%
23 GPT-5.6 Terra (high) high 44%
24 GPT-5.5 Instant (June 2026) June 2026 44%
25 GPT-5.6 Terra (medium) medium 44%
Show the remaining 219 configurations
#ModelConfigurationAccuracy
26 DeepSeek V4 Pro (Reasoning, Max Effort) Reasoning, Max Effort 43%
27 Gemini 3.5 Flash (minimal) minimal 43%
28 GPT-5.6 Terra (low) low 43%
29 DeepSeek V4 Pro (Reasoning, High Effort) Reasoning, High Effort 42%
30 GPT-5.6 Luna max 42%
31 GPT-5.6 Luna (xhigh) xhigh 41%
32 GPT-5.6 Luna (high) high 41%
33 Muse Spark 1.1 (xhigh) xhigh 41%
34 Inkling (xhigh) xhigh 40%
35 GPT-5.6 Luna (medium) medium 40%
36 Gemini 2.5 Pro Published configuration 39%
37 GPT-5.6 Luna (low) low 39%
38 Kimi K2.7 Code Published configuration 39%
39 o3 Published configuration 38%
40 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) Adaptive Reasoning, Max Effort 38%
41 DeepSeek V4 Flash (Reasoning, Max Effort) Reasoning, Max Effort 37%
42 Gemini 3.1 Flash-Lite Published configuration 36%
43 GPT-5.6 Terra (Non-reasoning) Non-reasoning 36%
44 Claude Sonnet 4.6 (Non-reasoning, Low Effort) Non-reasoning, Low Effort 36%
45 DeepSeek V4 Flash (Reasoning, High Effort) Reasoning, High Effort 36%
46 Nex-N2-Pro Published configuration 34%
47 Claude Sonnet 5 (Non-reasoning, High Effort) Non-reasoning, High Effort 33%
48 Agnes 2.5 Pro Alpha Published configuration 32%
49 Hy3 Published configuration 32%
50 Qwen3.5 397B A17B (Reasoning) Reasoning 31%
51 DeepSeek V4 Pro (Non-reasoning) Non-reasoning 31%
52 Gemini 3.5 Flash-Lite Published configuration 30%
53 Cogito v2.1 (Reasoning) Reasoning 30%
54 Hermes 4 - Llama-3.1 405B (Reasoning) Reasoning 30%
55 Qwen3.7 Max Published configuration 30%
56 LongCat 2.0 Published configuration 30%
57 Grok 4.3 (medium) medium 28%
58 Hy3-preview (Reasoning) Reasoning 28%
59 GPT-5.6 Luna (Non-reasoning) Non-reasoning 28%
60 MiMo-V2.5-Pro (Non-reasoning) Non-reasoning 27%
61 Hermes 4 - Llama-3.1 405B (Non-reasoning) Non-reasoning 26%
62 Qwen3.6 Plus Published configuration 26%
63 DeepSeek V4 Flash (Non-reasoning) Non-reasoning 26%
64 Grok 4.3 (low) low 26%
65 Step 3.7 Flash Published configuration 25%
66 Mistral Medium 3.5 Published configuration 25%
67 Doubao Seed Code Published configuration 25%
68 Ring-2.6-1T Published configuration 25%
69 GLM-5.2 (max) max 25%
70 Qwen3.5 122B A10B (Reasoning) Reasoning 25%
71 JT-35B-Flash Published configuration 25%
72 Qwen3.5 397B A17B (Non-reasoning) Non-reasoning 24%
73 Llama 4 Maverick Published configuration 24%
74 Grok 4.3 (Non-reasoning) Non-reasoning 24%
75 Mistral Large 3 Published configuration 24%
76 NVIDIA Nemotron 3 Super 120B A12B (Reasoning) Reasoning 24%
77 Hermes 4 - Llama-3.1 70B (Reasoning) Reasoning 23%
78 JT-4.1 Flash 236B A21B Published configuration 23%
79 Kimi K2.6 (Non-reasoning) Non-reasoning 23%
80 Trinity Large Thinking Published configuration 23%
81 MiMo-V2.5-Pro Published configuration 23%
82 Hy3-preview (Non-reasoning) Non-reasoning 22%
83 Llama 3.1 Instruct 405B Published configuration 22%
84 Qwen3.7 Plus Published configuration 22%
85 Nova 2.0 Pro Preview (low) low 22%
86 Mistral Small 4 (Reasoning) Reasoning 22%
87 Nova 2.0 Pro Preview (medium) medium 22%
88 KAT Coder Pro V2 Published configuration 22%
89 ERNIE 5.0 Thinking Preview Published configuration 22%
90 Nemotron 3 Ultra 550B A55B (Reasoning) Reasoning 22%
91 gpt-oss-120b (high) high 22%
92 Ling-2.6-1T Published configuration 21%
93 Motif 3 (Beta) Beta 21%
94 Devstral 2 Published configuration 21%
95 Magistral Medium 1.2 Published configuration 21%
96 Mercury 2 Published configuration 20%
97 GLM-5.2 (Non-reasoning) Non-reasoning 20%
98 MiMo-V2-Flash (Feb 2026) Feb 2026 20%
99 Gemma 4 31B (Reasoning) Reasoning 20%
100 Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) Reasoning 20%
101 Jamba 1.7 Large Published configuration 20%
102 INTELLECT-3 Published configuration 19%
103 Qwen3.6 27B (Reasoning) Reasoning 19%
104 Nova Premier Published configuration 19%
105 Qwen3.6 35B A3B (Reasoning) Reasoning 19%
106 Nova 2.0 Lite (high) high 19%
107 ERNIE 4.5 300B A47B Published configuration 19%
108 MiMo-V2-Omni Published configuration 19%
109 Qwen3.5 122B A10B (Non-reasoning) Non-reasoning 19%
110 North Mini Code Published configuration 19%
111 MiMo-V2-Omni-0327 Published configuration 18%
112 Nova 2.0 Omni (low) low 18%
113 K2-V2 (high) high 18%
114 Nova 2.0 Lite (medium) medium 18%
115 Hermes 4 - Llama-3.1 70B (Non-reasoning) Non-reasoning 18%
116 Gemma 4 26B A4B (Reasoning) Reasoning 18%
117 Solar Pro 3 Published configuration 18%
118 Solar Open 100B (Reasoning) Reasoning 18%
119 Llama 3.3 Instruct 70B Published configuration 18%
120 Nova 2.0 Omni (medium) medium 18%
121 Qwen3 Next 80B A3B Instruct Published configuration 18%
122 Nemotron Cascade 2 30B A3B Published configuration 18%
123 Sarvam 105B (high) high 18%
124 KAT-Coder-Pro V1 Published configuration 17%
125 Claude 4.5 Haiku (Reasoning) Reasoning 17%
126 Qwen3.5 Omni Plus Published configuration 17%
127 K2-V2 (medium) medium 17%
128 Qwen3 Next 80B A3B (Reasoning) Reasoning 17%
129 MiMo-V2.5 Published configuration 17%
130 NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) Reasoning 17%
131 Qwen3.6 35B A3B (Non-reasoning) Non-reasoning 17%
132 Qwen3.6 27B (Non-reasoning) Non-reasoning 17%
133 Apriel-v1.6-15B-Thinker Published configuration 17%
134 Llama Nemotron Super 49B v1.5 (Reasoning) Reasoning 17%
135 Gemma 4 31B (Non-reasoning) Non-reasoning 17%
136 DiffusionGemma 26B A4B Published configuration 17%
137 Mi:dm K 2.5 Pro Published configuration 17%
138 K-EXAONE (Reasoning) Reasoning 16%
139 Llama 3.1 Nemotron Instruct 70B Published configuration 16%
140 Ring-flash-2.0 Published configuration 16%
141 Mistral Small 4 (Non-reasoning) Non-reasoning 16%
142 EXAONE 4.5 33B Published configuration 16%
143 K2-V2 (low) low 16%
144 Mi:dm K 2.5 Pro Preview Published configuration 16%
145 Nova 2.0 Pro Preview (Non-reasoning) Non-reasoning 16%
146 Gemma 4 12B (Reasoning) Reasoning 16%
147 Qwen3.5 9B (Reasoning) Reasoning 16%
148 Nova 2.0 Lite (low) low 16%
149 Qwen3 Coder Next Published configuration 16%
150 Command A Published configuration 16%
151 Gemma 4 26B A4B (Non-reasoning) Non-reasoning 16%
152 K2 Think V2 Published configuration 16%
153 gpt-oss-120b (low) low 16%
154 Qwen3.5 35B A3B (Non-reasoning) Non-reasoning 16%
155 gpt-oss-20b (high) high 16%
156 Ling 2.6 Flash Published configuration 15%
157 Motif-2-12.7B-Reasoning Published configuration 15%
158 Devstral Small 2 Published configuration 15%
159 MiMo-V2-Flash (Non-reasoning) Non-reasoning 15%
160 MiniMax-M3 Published configuration 15%
161 Qwen3 Omni 30B A3B (Reasoning) Reasoning 15%
162 Nemotron 3 Nano Omni 30B A3B Reasoning Published configuration 15%
163 HyperCLOVA X SEED Think (32B) 32B 15%
164 Llama 4 Scout Published configuration 15%
165 Qwen3.5 Omni Flash Published configuration 14%
166 Qwen3 Omni 30B A3B Instruct Published configuration 14%
167 Granite 4.0 H Small Published configuration 14%
168 gpt-oss-20b (low) low 14%
169 HyperNova 60B 2605 Published configuration 14%
170 Qwen3.5 9B (Non-reasoning) Non-reasoning 14%
171 Falcon-H1R-7B Published configuration 14%
172 Granite 4.1 30B Published configuration 14%
173 JT-MINI Published configuration 14%
174 NVIDIA Nemotron Nano 12B v2 VL (Reasoning) Reasoning 14%
175 Claude 4.5 Haiku (Non-reasoning) Non-reasoning 14%
176 EXAONE 4.0 32B (Reasoning) Reasoning 14%
177 Olmo 3.1 32B Think Published configuration 14%
178 Nova 2.0 Lite (Non-reasoning) Non-reasoning 14%
179 Magistral Small 1.2 Published configuration 13%
180 Reka Flash 3 Published configuration 13%
181 Phi-4 Published configuration 13%
182 Apertus 70B Instruct Published configuration 13%
183 LongCat Flash Lite Published configuration 13%
184 Nova 2.0 Omni (Non-reasoning) Non-reasoning 13%
185 Step3 VL 10B Published configuration 13%
186 Sarvam 30B (high) high 13%
187 Ministral 3 14B Published configuration 12%
188 Llama Nemotron Super 49B v1.5 (Non-reasoning) Non-reasoning 12%
189 K-EXAONE (Non-reasoning) Non-reasoning 12%
190 Granite 4.1 8B Published configuration 12%
191 Gemma 4 12B (Non-reasoning) Non-reasoning 12%
192 Tri-21B-Think Published configuration 12%
193 Qwen3.5 4B (Reasoning) Reasoning 12%
194 Qwen3.5 4B (Non-reasoning) Non-reasoning 11%
195 Jamba 1.7 Mini Published configuration 11%
196 NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) Non-reasoning 11%
197 NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) Non-reasoning 11%
198 Olmo 3.1 32B Instruct Published configuration 11%
199 Molmo2-8B Published configuration 11%
200 NVIDIA Nemotron Nano 9B V2 (Reasoning) Reasoning 11%
201 Ministral 3 8B Published configuration 11%
202 Olmo 3 7B Think Published configuration 11%
203 EXAONE 4.0 32B (Non-reasoning) Non-reasoning 10%
204 Apertus 8B Instruct Published configuration 10%
205 Llama 3.2 Instruct 11B (Vision) Vision 10%
206 Nova Micro Published configuration 10%
207 Nanbeige4.1-3B Published configuration 10%
208 NVIDIA Nemotron Nano 9B V2 (Non-reasoning) Non-reasoning 10%
209 NVIDIA Nemotron 3 Nano 4B Published configuration 9%
210 Granite 4.1 3B Published configuration 9%
211 Command A+ Published configuration 9%
212 LFM2.5-8B-A1B Published configuration 9%
213 Ling-mini-2.0 Published configuration 9%
214 Gemma 4 E4B (Non-reasoning) Non-reasoning 8%
215 Granite 4.0 Micro Published configuration 8%
216 Phi-4 Mini Instruct Published configuration 8%
217 Gemma 4 E4B (Reasoning) Reasoning 8%
218 Gemma 4 E2B (Non-reasoning) Non-reasoning 8%
219 LFM2 2.6B Published configuration 8%
220 Qwen3.5 2B (Non-reasoning) Non-reasoning 7%
221 Olmo 3 7B Instruct Published configuration 7%
222 Ministral 3 3B Published configuration 7%
223 LFM2 8B A1B Published configuration 7%
224 LFM2.5-1.2B-Thinking Published configuration 7%
225 Jamba Reasoning 3B Published configuration 7%
226 G9v3-3B Published configuration 7%
227 LFM2 24B A2B Published configuration 6%
228 Exaone 4.0 1.2B (Reasoning) Reasoning 6%
229 MiniCPM-V 4.6 1.3B Published configuration 6%
230 LFM2.5-1.2B-Instruct Published configuration 6%
231 Gemma 4 E2B (Reasoning) Reasoning 6%
232 Granite 4.0 1B Published configuration 6%
233 Tiny Aya Global Published configuration 6%
234 LFM2.5-VL-1.6B Published configuration 5%
235 Granite 4.0 H 1B Published configuration 5%
236 Qwen3.5 0.8B (Non-reasoning) Non-reasoning 5%
237 Exaone 4.0 1.2B (Non-reasoning) Non-reasoning 5%
238 Qwen3.5 2B (Reasoning) Reasoning 3%
239 Granite 4.0 H 350M Published configuration 3%
240 Granite 4.0 350M Published configuration 3%
241 MiniCPM5-1B (Reasoning) Reasoning 2%
242 Gemma 3 270M Published configuration 1%
243 Qwen3.5 0.8B (Reasoning) Reasoning 1%
244 MiniCPM5-1B (Non-reasoning) Non-reasoning 0%

Showing the top 25 of 244 published configurations.

What Artificial Analysis held constantPublished harness, scoring, and budget boundaries Open contract
Comparison source
Artificial Analysis public LLM leaderboard captured Artificial Analysis snapshot · 30 July 2026.
Harness
Artificial Analysis's independently operated benchmark implementation for this metric.
What varies
The published model configuration and provider-side implementation; reasoning variants remain separate rows.
Tools
Tool access follows the metric-specific Artificial Analysis methodology and is not assumed to be uniform across different benchmarks.
Budget
Task counts, repeats, turn limits, and timeouts follow the cited methodology; they are not equal-compute guarantees across model providers.
Comparison limit
Comparable within this source field and snapshot; not interchangeable with scores from another harness or protocol version.

What this benchmark tests

The share of all AA-Omniscience questions answered correctly, including questions where a model abstains in the denominator.

How to read the score

The published metric is Accuracy. Springprompt reproduces Artificial Analysis's rounded public-table figure and preserves its underlying numeric value for provenance.

A missing source value is not scored as zero: that configuration is omitted from this benchmark page.

Comparability policy

Why this is a system evaluation

A row identifies the model configuration, but the measured subject also includes the evaluator's prompts, harness, tools, budgets, repeats, and grader.

That is why Springprompt does not combine these figures with vendor claims or results from another implementation simply because the benchmark name looks similar.

What can be compared here

Every row on this page comes from the same Artificial Analysis snapshot · 30 July 2026 leaderboard payload and the same omniscienceAccuracy field.

Estimated Intelligence Index rows remain visible but carry an explicit estimate label. Missing fields and deprecated models are not manufactured into pages or zero scores.

Official AA-Omniscience Accuracy resources 2 links · show

Go deeper

Turn benchmark evidence into a model decision

Browse Spring Prompt’s task-level model evidence, compare the published configurations above, or join the product waitlist to build an evaluation around your own workflow.

Sources and provenance

Spring Prompt stores a reviewed, content-addressed evidence manifest for every citation. The linked official source remains canonical.

  1. 1.Artificial Analysis public LLM leaderboard ↗Artificial Analysis · model scores and source display values · retrieved 2026-07-30 · evidence 4e8ccd3759d9
  2. 2.Artificial Analysis intelligence benchmarking methodology ↗Artificial Analysis · methodology and evaluation-contract interpretation · retrieved 2026-07-30 · evidence 45ccc8609f26

Read the official scoring methodology ↗