Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference combined with labels of whether each answer's checkable claims were true (factuality weighted 25% by default).

Results dated
25 Sep 2026
Models
177
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International
Arena Text factuality: overall, Arena rating, higher is better
#ModelArena Text factuality: overall · 95% range
Arena rating, higher is better
1 Claude Fable 5.1Anthropic · Claude Fable 5.1 (max)
1,501
1,495–1,507
1 Claude Opus 4.6Anthropic · Claude Opus 4.6 (high)
1,494
1,491–1,497
2 Claude Opus 5Anthropic · Claude Opus 5 (max)
1,488
1,484–1,493
2 Muse Spark 1.2Meta
1,484
1,475–1,493
3 Claude Opus 4.6Anthropic
1,488
1,486–1,491
3 GPT-5.5OpenAI · GPT-5.5 (high)
1,486
1,483–1,489
3 GPT-5.4OpenAI · GPT-5.4 (high)
1,485
1,482–1,488
3 Claude Fable 5Anthropic · Claude Fable 5 (high)
1,483
1,480–1,487
3 MiMo-V2.6-ProXiaomi
1,483
1,475–1,491
3 qwen3.7-max-previewAlibaba
1,481
1,472–1,489
4 GPT-5.5OpenAI
1,482
1,480–1,485
4 gemini-3-proGoogle
1,481
1,478–1,485
4 Muse Spark 1.3Meta · Muse Spark 1.3 (max)
1,479
1,473–1,485
6 Gemini 3.7 FlashGoogle · Gemini 3.7 Flash (high)
1,477
1,473–1,482
6 Gemini 3.8 FlashGoogle · Gemini 3.8 Flash (high)
1,477
1,473–1,482
7 Claude Opus 5Anthropic · Claude Opus 5 (high)
1,477
1,474–1,480
7 Claude Opus 4.7Anthropic · Claude Opus 4.7 (high)
1,477
1,474–1,480
9 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high)
1,476
1,472–1,479
9 GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh)
1,476
1,472–1,479
9 GPT-5.4OpenAI
1,475
1,473–1,478
9 Claude Opus 4.7Anthropic
1,475
1,472–1,479
9 qwen3.5-max-previewAlibaba
1,475
1,470–1,479
10 Kimi K3Moonshot AI · Kimi K3 (max)
1,472
1,468–1,476
10 DeepSeek V4.1 FlashDeepSeek · DeepSeek V4.1 Flash (max)
1,471
1,464–1,478
10 Qwen3.8 Max (0902)Alibaba
1,471
1,466–1,475
13 Gemini 3.1 Pro PreviewGoogle
1,472
1,469–1,474
14 Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high)
1,470
1,466–1,474
15 GLM 5.3Z.ai · GLM 5.3 (max)
1,468
1,463–1,473
15 muse-sparkMeta
1,467
1,462–1,473
18 Claude Opus 4.8Anthropic · Claude Opus 4.8 (high)
1,469
1,466–1,472
22 gemini-3-flashGoogle
1,468
1,464–1,472
22 GLM 5.3 FlashZ.ai
1,467
1,462–1,471
22 GPT-6 AstraOpenAI · GPT-6 Astra (max)
1,465
1,458–1,471
23 GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh)
1,467
1,463–1,470
24 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium)
1,466
1,462–1,469
24 MiMo-V2.5-ProXiaomi
1,465
1,462–1,468
24 Grok 4.5xAI
1,465
1,462–1,469
25 Claude Opus 4.8Anthropic
1,465
1,461–1,468
25 Muse Spark 1.1Meta
1,463
1,459–1,467
25 MiMo-V2.6-FlashXiaomi
1,459
1,451–1,468
26 GLM 5.2Z.ai · GLM 5.2 (max)
1,463
1,459–1,466
28 Gemini 2.5 ProGoogle
1,462
1,459–1,465
28 GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh)
1,461
1,458–1,465
29 Claude Sonnet 4.6Anthropic
1,461
1,458–1,464
32 Claude Opus 4.5Anthropic
1,459
1,456–1,463
35 Claude Opus 4.5Anthropic
1,459
1,456–1,462
35 GPT-5.1OpenAI · GPT-5.1 (high)
1,459
1,455–1,462
38 grok-4.20-multi-agent-beta-0309xAI
1,457
1,454–1,460
38 GLM 5.1Z.ai
1,456
1,453–1,460
38 Kimi K2.6Moonshot AI
1,456
1,452–1,460
38 ernie-5.1Baidu
1,456
1,452–1,460
38 Qwen3.6 Max PreviewAlibaba
1,452
1,445–1,460
38 amazon-nova-experimental-chat-26-02-10Amazon
1,452
1,443–1,460
41 grok-4.20-beta-0309-reasoningxAI
1,456
1,453–1,459
41 DeepSeek V4 Pro 0813DeepSeek
1,453
1,448–1,459
43 DeepSeek V4 Pro 0423DeepSeek
1,455
1,452–1,458
44 grok-4.20-beta1xAI
1,453
1,448–1,457
44 Gemma 4 31BGoogle
1,450
1,443–1,457
44 DeepSeek V3.2 ExpDeepSeek
1,446
1,435–1,457
45 Qwen3.7 PlusAlibaba
1,453
1,449–1,456
46 Claude Sonnet 5Anthropic · Claude Sonnet 5 (high)
1,452
1,448–1,455
46 InklingThinkingmachines
1,452
1,448–1,455
46 GLM 5Z.ai
1,452
1,448–1,456
47 gemini-3-flashGoogle
1,451
1,449–1,454
47 gpt-5.2-chat-latest-20260210OpenAI
1,451
1,447–1,455
48 Grok 4.6xAI · Grok 4.6 (high)
1,449
1,445–1,454
49 Hy3Tencent
1,447
1,441–1,453
53 Gemini 3.5 Flash LiteGoogle
1,448
1,444–1,451
53 Gemma 4 26B A4BGoogle
1,445
1,438–1,452
54 Claude Sonnet 4.5Anthropic
1,449
1,446–1,451
54 deepseek-v4-pro-previewDeepSeek
1,447
1,444–1,451
54 GPT-5.4 MiniOpenAI · GPT-5.4 Mini (high)
1,447
1,444–1,450
54 GLM 4.6Z.ai
1,447
1,443–1,451
54 Claude Sonnet 4.5Anthropic
1,447
1,444–1,449
54 GLM 4.7Z.ai
1,444
1,438–1,450
55 ernie-5.0-0110Baidu
1,445
1,442–1,449
58 ernie-5.0-preview-1203Baidu
1,442
1,436–1,448
58 qwen3-max-previewAlibaba
1,442
1,435–1,448
58 ernie-5.0-preview-1022Baidu
1,440
1,431–1,448
60 Kimi K2.5Moonshot AI
1,445
1,442–1,448
60 GPT-5.1OpenAI
1,445
1,441–1,448
61 Qwen3.5 397B A17BAlibaba
1,445
1,442–1,447
61 chatgpt-4o-latest-20250326OpenAI
1,444
1,441–1,447
61 gpt-5.5-instantOpenAI
1,443
1,439–1,448
61 mimo-v2-proXiaomi
1,443
1,439–1,448
63 GPT-5.2OpenAI
1,442
1,440–1,445
63 GLM 5V TurboZ.ai
1,440
1,435–1,446
65 GPT-5.2OpenAI · GPT-5.2 (high)
1,442
1,438–1,445
69 Qwen3.8 27BAlibaba
1,439
1,434–1,443
72 DeepSeek V4 Flash 0423DeepSeek
1,439
1,436–1,443
72 MiMo-V2.5Xiaomi
1,439
1,435–1,442
74 DeepSeek V3.2 ExpDeepSeek
1,436
1,430–1,442
77 Qwen3.6 PlusAlibaba
1,438
1,434–1,441
77 mimo-v2-omniXiaomi
1,436
1,431–1,441
78 DeepSeek V3.2DeepSeek
1,437
1,434–1,440
80 Gemini 2.5 FlashGoogle
1,437
1,434–1,439
81 Claude Opus 4.1Anthropic
1,435
1,432–1,439
84 MiniMax M3MiniMax
1,434
1,431–1,437
84 grok-4.1-thinkingxAI
1,434
1,431–1,437
84 deepseek-v4-flash-previewDeepSeek
1,434
1,430–1,437
84 Mistral Large 3 2512Mistral
1,434
1,431–1,436
84 Claude Opus 4.1Anthropic
1,433
1,429–1,437
84 Gemini 3.1 Flash Lite PreviewGoogle
1,433
1,430–1,436
84 DeepSeek V3.2DeepSeek
1,433
1,429–1,436
84 nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA
1,430
1,424–1,437
84 Mistral Medium 3.5Mistral
1,430
1,424–1,436
88 Kimi K2.5Moonshot AI
1,429
1,423–1,435
92 Qwen3 235B A22B Instruct 2507Alibaba
1,431
1,429–1,434
92 grok-4.1xAI
1,431
1,428–1,434
93 amazon-nova-experimental-chat-12-10Amazon
1,424
1,415–1,434
94 longcat-flash-chat-2602-expMeituan
1,429
1,425–1,433
94 Qwen3 VL 235B A22B InstructAlibaba
1,414
1,396–1,432
95 Mistral Medium 3.1Mistral
1,429
1,426–1,431
95 Qwen3.5-122B-A10BAlibaba
1,428
1,424–1,432
95 GPT-6 SolOpenAI · GPT-6 Sol (max)
1,424
1,416–1,432
100 Grok 4.3xAI
1,428
1,425–1,431
103 GPT-6 LunaOpenAI · GPT-6 Luna (max)
1,422
1,414–1,430
105 Inkling SmallThinkingmachines
1,425
1,421–1,429
105 gemini-2.5-flash-preview-09-2025Google
1,425
1,420–1,429
105 Grok 4.7xAI · Grok 4.7 (xhigh)
1,420
1,412–1,429
106 gpt-5-chatOpenAI
1,422
1,415–1,428
107 GPT-5OpenAI · GPT-5 (high)
1,421
1,414–1,428
108 kimi-k2-thinking-turboMoonshot AI
1,423
1,420–1,426
108 MiniMax M2.7MiniMax
1,422
1,419–1,425
108 mimo-v2-flashXiaomi
1,422
1,419–1,425
108 Qwen3 Next 80B A3B InstructAlibaba
1,419
1,412–1,425
109 grok-4-0709xAI
1,419
1,413–1,425
113 Qwen3.5-27BAlibaba
1,420
1,416–1,424
113 grok-4-fast-reasoningxAI
1,417
1,411–1,423
114 dola-seed-2.0-proBytedance
1,419
1,416–1,422
114 gpt-5.3-chat-latestOpenAI
1,419
1,415–1,422
114 GPT-5.4 NanoOpenAI · GPT-5.4 Nano (high)
1,418
1,415–1,421
117 Claude Haiku 4.5Anthropic
1,418
1,416–1,420
117 Step 3.5 FlashStepfun
1,417
1,414–1,420
117 Hy3 previewTencent
1,413
1,406–1,420
119 amazon-nova-experimental-chat-11-10Amazon
1,415
1,411–1,419
119 Qwen3.5-FlashAlibaba
1,414
1,411–1,417
119 Kimi K2 0905Moonshot AI
1,403
1,389–1,418
119 Qwen3 Coder 480B A35BAlibaba
1,401
1,383–1,419
120 grok-4-1-fast-reasoningxAI
1,413
1,410–1,416
120 minimax-m2.1-previewMiniMax
1,411
1,406–1,416
120 mimo-v2-flashXiaomi
1,410
1,404–1,416
127 GPT-4.1OpenAI
1,408
1,402–1,415
129 Solar Pro 4Upstage
1,409
1,403–1,414
133 Qwen3.5-35B-A3BAlibaba
1,408
1,404–1,411
133 o3OpenAI
1,405
1,398–1,411
133 amazon-nova-experimental-chat-26-01-10Amazon
1,403
1,394–1,411
136 gemini-2.5-flash-lite-preview-09-2025Google
1,407
1,404–1,411
137 muse-glimmerMeta
1,401
1,393–1,410
139 amazon-nova-experimental-chat-10-20Amazon
1,399
1,393–1,405
143 GLM 4.6VZ.ai
1,392
1,381–1,402
144 GLM 4.5 AirZ.ai
1,395
1,388–1,402
144 GPT-5 MiniOpenAI · GPT-5 Mini (high)
1,394
1,387–1,401
145 Nemotron 3 SuperNVIDIA
1,390
1,383–1,397
149 MiniMax M2.5MiniMax
1,386
1,382–1,389
149 gpt-oss-120bOpenAI
1,385
1,378–1,391
149 Gemma 3 27BGoogle
1,380
1,369–1,391
152 Nova 2 LiteAmazon
1,380
1,374–1,386
152 granite-4.2-30bIBM
1,377
1,368–1,386
156 intellect-3Primeintellect
1,373
1,365–1,381
156 MiniMax M1MiniMax
1,370
1,359–1,381
156 o4 MiniOpenAI
1,368
1,358–1,378
157 trinity-large-previewArcee Ai
1,373
1,369–1,377
157 Trinity Large ThinkingArcee Ai
1,371
1,367–1,375
157 GLM 4.7 FlashZ.ai
1,370
1,365–1,376
157 Mercury 2Inception
1,368
1,359–1,378
158 Command ACohere
1,363
1,357–1,370
161 Nemotron 3 Nano 30B A3BNVIDIA
1,362
1,357–1,367
161 MiniMax M2MiniMax
1,360
1,353–1,367
162 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA
1,360
1,354–1,366
171 Granite 4.2 8BIBM
1,343
1,333–1,352
171 olmo-3.1-32b-instructAi2
1,342
1,336–1,348
171 granite-4.2-3bIBM
1,327
1,317–1,337
173 olmo-3-32b-thinkAi2
1,319
1,312–1,327
173 granite-4.1-8bIBM
1,311
1,302–1,320
173 mercuryInception
1,305
1,292–1,317
175 olmo-3.1-32b-thinkAi2
1,300
1,294–1,307

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference combined with labels of whether each answer's checkable claims were true (factuality weighted 25% by default).

What it does not measure

Not an error rate: claims that cannot be checked on the web are skipped, and preference still carries most of the weight.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.