1,499
1,491–1,507
Benchmarks / Arena (formerly LMArena)
Reported by Arena (formerly LMArena)
Arena (formerly LMArena)
Human preference on questions about an uploaded document.
- Results dated
- 13 Sep 2026
- Models
- 44
- Unit
- Arena rating
| # | Model | Arena Document: overall · 95% range Arena rating, higher is better |
|---|---|---|
| 1 | Claude Fable 5Anthropic | |
| 1 | Claude Opus 4.6Anthropic · Claude Opus 4.6 (high) |
1,495 1,489–1,502 |
| 1 | Claude Opus 4.7Anthropic |
1,494 1,488–1,501 |
| 1 | Claude Opus 4.6Anthropic |
1,494 1,488–1,500 |
| 1 | Claude Opus 4.7Anthropic · Claude Opus 4.7 (high) |
1,493 1,486–1,500 |
| 1 | Claude Fable 5.1Anthropic · Claude Fable 5.1 (max) |
1,493 1,478–1,508 |
| 1 | Claude Opus 5Anthropic · Claude Opus 5 (high) |
1,490 1,483–1,497 |
| 1 | GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh) |
1,489 1,480–1,498 |
| 1 | Claude Opus 4.8Anthropic · Claude Opus 4.8 (high) |
1,486 1,479–1,493 |
| 2 | GPT-5.5OpenAI |
1,483 1,476–1,489 |
| 3 | Muse Spark 1.1Meta |
1,479 1,471–1,488 |
| 5 | GPT-5.5OpenAI · GPT-5.5 (high) |
1,480 1,474–1,487 |
| 5 | GPT-6 AstraOpenAI · GPT-6 Astra (max) |
1,473 1,458–1,487 |
| 6 | Claude Sonnet 4.6Anthropic |
1,478 1,472–1,484 |
| 6 | GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh) |
1,477 1,468–1,485 |
| 6 | Claude Sonnet 5Anthropic · Claude Sonnet 5 (high) |
1,476 1,468–1,483 |
| 6 | Muse Spark 1.3Meta · Muse Spark 1.3 (max) |
1,468 1,450–1,486 |
| 6 | muse-sparkMeta |
1,467 1,449–1,486 |
| 7 | Claude Opus 4.8Anthropic |
1,475 1,468–1,482 |
| 11 | GPT-5.4OpenAI |
1,470 1,464–1,476 |
| 11 | Claude Opus 4.5Anthropic |
1,465 1,454–1,475 |
| 12 | Grok 4.5xAI |
1,464 1,456–1,473 |
| 12 | Grok 4.6xAI · Grok 4.6 (high) |
1,461 1,449–1,473 |
| 14 | GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh) |
1,462 1,454–1,470 |
| 14 | Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium) |
1,461 1,453–1,468 |
| 14 | gpt-5.5-instantOpenAI |
1,460 1,452–1,469 |
| 17 | Gemini 3.1 Pro PreviewGoogle |
1,459 1,454–1,464 |
| 17 | Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high) |
1,453 1,443–1,464 |
| 18 | Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high) |
1,453 1,444–1,463 |
| 18 | Qwen3.7 PlusAlibaba |
1,453 1,443–1,462 |
| 18 | gemini-3-proGoogle |
1,451 1,442–1,460 |
| 19 | Kimi K2.6Moonshot AI |
1,450 1,442–1,458 |
| 20 | Claude Sonnet 4.5Anthropic |
1,449 1,443–1,455 |
| 24 | Gemma 4 31BGoogle |
1,445 1,437–1,452 |
| 28 | grok-4.20-beta-0309-reasoningxAI |
1,439 1,432–1,447 |
| 28 | gemini-3-flashGoogle |
1,439 1,430–1,449 |
| 31 | Kimi K2.5Moonshot AI |
1,436 1,429–1,443 |
| 34 | MiniMax M3MiniMax |
1,433 1,425–1,441 |
| 34 | Gemini 2.5 ProGoogle |
1,431 1,424–1,437 |
| 35 | GPT-5.2OpenAI · GPT-5.2 (high) |
1,423 1,414–1,433 |
| 36 | GPT-5.2OpenAI |
1,425 1,419–1,431 |
| 38 | Claude Haiku 4.5Anthropic |
1,419 1,413–1,425 |
| 38 | GPT-5.1OpenAI |
1,416 1,407–1,425 |
| 43 | GLM 5V TurboZ.ai |
1,400 1,392–1,408 |
Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.
What it measures
Human preference on questions about an uploaded document.
What it does not measure
Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.
Source
Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.