Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on answers that used live web search.

Results dated
24 Aug 2026
Models
34
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International
Arena Search: overall, Arena rating, higher is better
#ModelArena Search: overall · 95% range
Arena rating, higher is better
1 GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh)
1,256
1,248–1,263
2 Claude Fable 5Anthropic
1,229
1,221–1,237
2 GPT-5.5OpenAI
1,224
1,218–1,229
2 Claude Opus 4.6Anthropic
1,223
1,218–1,228
5 Claude Opus 4.7Anthropic
1,212
1,207–1,218
5 Gemini 3.1 Pro PreviewGoogle
1,208
1,202–1,213
5 grok-4.20-multi-agent-beta-0309xAI
1,205
1,199–1,210
5 Grok 4.5xAI
1,202
1,195–1,209
5 gemini-3-proGoogle
1,201
1,196–1,207
6 Claude Sonnet 4.6Anthropic
1,201
1,196–1,206
6 grok-4.20-beta1xAI
1,197
1,191–1,203
6 Claude Sonnet 5Anthropic
1,196
1,189–1,203
6 ernie-5.1Baidu
1,193
1,184–1,203
7 Claude Opus 4.8Anthropic
1,195
1,189–1,201
7 GPT-5.4OpenAI
1,195
1,189–1,200
8 grok-4-1-fastxAI
1,194
1,189–1,199
8 Grok 4.3xAI
1,193
1,188–1,199
8 o3OpenAI
1,192
1,185–1,199
8 gemini-3-flashGoogle
1,191
1,187–1,196
11 Claude Opus 4.5Anthropic
1,187
1,181–1,193
12 GPT-5OpenAI
1,183
1,175–1,190
15 GPT-5.1OpenAI
1,183
1,178–1,189
21 Claude Sonnet 4.5Anthropic
1,175
1,170–1,180
23 Claude Opus 4.1Anthropic
1,167
1,162–1,172
24 GPT-5.2OpenAI
1,162
1,156–1,167
24 grok-4-fastxAI
1,160
1,155–1,165
25 claude-opus-4Anthropic
1,151
1,145–1,156
27 ppl-sonar-pro-highPerplexity
1,143
1,137–1,149
27 Gemini 2.5 ProGoogle
1,142
1,137–1,147
28 ppl-sonar-reasoning-pro-highPerplexity
1,138
1,132–1,144
28 GPT-5.2OpenAI
1,137
1,131–1,143
32 grok-4xAI
1,121
1,115–1,128
33 api-gpt-4o-searchOpenAI
1,081
1,070–1,092
33 diffbot-small-xlDiffbot
1,062
1,053–1,071

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on answers that used live web search.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.