Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on questions about an uploaded document.

Results dated
13 Sep 2026
Models
44
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International
Arena Document: overall, Arena rating, higher is better
#ModelArena Document: overall · 95% range
Arena rating, higher is better
1 Claude Fable 5Anthropic
1,499
1,491–1,507
1 Claude Opus 4.6Anthropic · Claude Opus 4.6 (high)
1,495
1,489–1,502
1 Claude Opus 4.7Anthropic
1,494
1,488–1,501
1 Claude Opus 4.6Anthropic
1,494
1,488–1,500
1 Claude Opus 4.7Anthropic · Claude Opus 4.7 (high)
1,493
1,486–1,500
1 Claude Fable 5.1Anthropic · Claude Fable 5.1 (max)
1,493
1,478–1,508
1 Claude Opus 5Anthropic · Claude Opus 5 (high)
1,490
1,483–1,497
1 GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh)
1,489
1,480–1,498
1 Claude Opus 4.8Anthropic · Claude Opus 4.8 (high)
1,486
1,479–1,493
2 GPT-5.5OpenAI
1,483
1,476–1,489
3 Muse Spark 1.1Meta
1,479
1,471–1,488
5 GPT-5.5OpenAI · GPT-5.5 (high)
1,480
1,474–1,487
5 GPT-6 AstraOpenAI · GPT-6 Astra (max)
1,473
1,458–1,487
6 Claude Sonnet 4.6Anthropic
1,478
1,472–1,484
6 GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh)
1,477
1,468–1,485
6 Claude Sonnet 5Anthropic · Claude Sonnet 5 (high)
1,476
1,468–1,483
6 Muse Spark 1.3Meta · Muse Spark 1.3 (max)
1,468
1,450–1,486
6 muse-sparkMeta
1,467
1,449–1,486
7 Claude Opus 4.8Anthropic
1,475
1,468–1,482
11 GPT-5.4OpenAI
1,470
1,464–1,476
11 Claude Opus 4.5Anthropic
1,465
1,454–1,475
12 Grok 4.5xAI
1,464
1,456–1,473
12 Grok 4.6xAI · Grok 4.6 (high)
1,461
1,449–1,473
14 GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh)
1,462
1,454–1,470
14 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium)
1,461
1,453–1,468
14 gpt-5.5-instantOpenAI
1,460
1,452–1,469
17 Gemini 3.1 Pro PreviewGoogle
1,459
1,454–1,464
17 Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high)
1,453
1,443–1,464
18 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high)
1,453
1,444–1,463
18 Qwen3.7 PlusAlibaba
1,453
1,443–1,462
18 gemini-3-proGoogle
1,451
1,442–1,460
19 Kimi K2.6Moonshot AI
1,450
1,442–1,458
20 Claude Sonnet 4.5Anthropic
1,449
1,443–1,455
24 Gemma 4 31BGoogle
1,445
1,437–1,452
28 grok-4.20-beta-0309-reasoningxAI
1,439
1,432–1,447
28 gemini-3-flashGoogle
1,439
1,430–1,449
31 Kimi K2.5Moonshot AI
1,436
1,429–1,443
34 MiniMax M3MiniMax
1,433
1,425–1,441
34 Gemini 2.5 ProGoogle
1,431
1,424–1,437
35 GPT-5.2OpenAI · GPT-5.2 (high)
1,423
1,414–1,433
36 GPT-5.2OpenAI
1,425
1,419–1,431
38 Claude Haiku 4.5Anthropic
1,419
1,413–1,425
38 GPT-5.1OpenAI
1,416
1,407–1,425
43 GLM 5V TurboZ.ai
1,400
1,392–1,408

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on questions about an uploaded document.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.