1,256
1,248–1,263
Benchmarks / Arena (formerly LMArena)
Reported by Arena (formerly LMArena)
Arena (formerly LMArena)
Human preference on answers that used live web search.
- Results dated
- 24 Aug 2026
- Models
- 34
- Unit
- Arena rating
| # | Model | Arena Search: overall · 95% range Arena rating, higher is better |
|---|---|---|
| 1 | GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh) | |
| 2 | Claude Fable 5Anthropic |
1,229 1,221–1,237 |
| 2 | GPT-5.5OpenAI |
1,224 1,218–1,229 |
| 2 | Claude Opus 4.6Anthropic |
1,223 1,218–1,228 |
| 5 | Claude Opus 4.7Anthropic |
1,212 1,207–1,218 |
| 5 | Gemini 3.1 Pro PreviewGoogle |
1,208 1,202–1,213 |
| 5 | grok-4.20-multi-agent-beta-0309xAI |
1,205 1,199–1,210 |
| 5 | Grok 4.5xAI |
1,202 1,195–1,209 |
| 5 | gemini-3-proGoogle |
1,201 1,196–1,207 |
| 6 | Claude Sonnet 4.6Anthropic |
1,201 1,196–1,206 |
| 6 | grok-4.20-beta1xAI |
1,197 1,191–1,203 |
| 6 | Claude Sonnet 5Anthropic |
1,196 1,189–1,203 |
| 6 | ernie-5.1Baidu |
1,193 1,184–1,203 |
| 7 | Claude Opus 4.8Anthropic |
1,195 1,189–1,201 |
| 7 | GPT-5.4OpenAI |
1,195 1,189–1,200 |
| 8 | grok-4-1-fastxAI |
1,194 1,189–1,199 |
| 8 | Grok 4.3xAI |
1,193 1,188–1,199 |
| 8 | o3OpenAI |
1,192 1,185–1,199 |
| 8 | gemini-3-flashGoogle |
1,191 1,187–1,196 |
| 11 | Claude Opus 4.5Anthropic |
1,187 1,181–1,193 |
| 12 | GPT-5OpenAI |
1,183 1,175–1,190 |
| 15 | GPT-5.1OpenAI |
1,183 1,178–1,189 |
| 21 | Claude Sonnet 4.5Anthropic |
1,175 1,170–1,180 |
| 23 | Claude Opus 4.1Anthropic |
1,167 1,162–1,172 |
| 24 | GPT-5.2OpenAI |
1,162 1,156–1,167 |
| 24 | grok-4-fastxAI |
1,160 1,155–1,165 |
| 25 | claude-opus-4Anthropic |
1,151 1,145–1,156 |
| 27 | ppl-sonar-pro-highPerplexity |
1,143 1,137–1,149 |
| 27 | Gemini 2.5 ProGoogle |
1,142 1,137–1,147 |
| 28 | ppl-sonar-reasoning-pro-highPerplexity |
1,138 1,132–1,144 |
| 28 | GPT-5.2OpenAI |
1,137 1,131–1,143 |
| 32 | grok-4xAI |
1,121 1,115–1,128 |
| 33 | api-gpt-4o-searchOpenAI |
1,081 1,070–1,092 |
| 33 | diffbot-small-xlDiffbot |
1,062 1,053–1,071 |
Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.
What it measures
Human preference on answers that used live web search.
What it does not measure
Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.
Source
Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.