Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on prompts that set explicit instructions.

Last updated 2 Oct 2026

Results dated
2 Oct 2026
Results
413 configurations of 387 models
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International

Instruction following: Claude Opus 5.5

Top 15 of 387 results · Arena rating, higher is better · lines show the 95% range · ≈ cannot be told apart from the leader. Choose a model to highlight it.Clear highlight

  1. 1≈ Gemini 4 Argon (high reasoning)Google 1,528
  2. 2≈ Claude Opus 5.5 (high reasoning)Anthropic 1,517
  3. 3≈ Claude Opus 4.6 (high reasoning)Anthropic 1,514
  4. 4≈ Claude Fable 5 (high reasoning)Anthropic 1,509
  5. 5 Claude Opus 4.7 (high reasoning)Anthropic 1,502
  6. 6 Claude Fable 5.1 (max reasoning)Anthropic 1,497
  7. 7 Claude Opus 5 (high reasoning)Anthropic 1,496
  8. 8 Claude Opus 4.8 (high reasoning)Anthropic 1,491
  9. 9 GPT-5.6 Sol (extra-high reasoning)OpenAI 1,490
  10. 9 GPT-6.1 Sol (max reasoning)OpenAI 1,490
  11. 11 Kimi K3 (max reasoning)Moonshot AI 1,488
  12. 12 Gemini 3.8 Flash (high reasoning)Google 1,486
  13. 12 Muse Spark 1.3 (max reasoning)Meta 1,486
  14. 14 Gemini 3.7 Flash (high reasoning)Google 1,485
  15. 15 Claude Sonnet 5.5 (extra-high reasoning)Anthropic 1,484

Full results

Arena Text: instruction following, Arena rating, higher is better
#ModelInstruction following · 95% range
Arena rating, higher is better
Price
$ per million tokens, in / out
1≈ Gemini 4 Argon (high reasoning)Google
1,528
1,514–1,543
–
2≈ Claude Opus 5.5 (high reasoning)Anthropic
1,517
1,502–1,533
$4 / $20
3≈ Claude Opus 4.6 (high reasoning)Anthropic · best of 2 settings
1,514
1,508–1,519
$5 / $25
4≈ Claude Fable 5 (high reasoning)Anthropic
1,509
1,503–1,515
$10 / $50
5 Claude Opus 4.7 (high reasoning)Anthropic · best of 2 settings
1,502
1,497–1,508
$5 / $25
6 Claude Fable 5.1 (max reasoning)Anthropic
1,497
1,487–1,508
$10 / $50
7 Claude Opus 5 (high reasoning)Anthropic · best of 2 settings
1,496
1,490–1,502
$5 / $25
8 Claude Opus 4.8 (high reasoning)Anthropic · best of 2 settings
1,491
1,485–1,496
$5 / $25
9 GPT-5.6 Sol (extra-high reasoning)OpenAI
1,490
1,484–1,497
$4 / $20
9 GPT-6.1 Sol (max reasoning)OpenAI
1,490
1,471–1,509
$2 / $10
11 Kimi K3 (max reasoning)Moonshot AI
1,488
1,481–1,495
$3 / $15
12 Gemini 3.8 Flash (high reasoning)Google
1,486
1,479–1,493
$1.50 / $7.50
12 Muse Spark 1.3 (max reasoning)Meta
1,486
1,476–1,495
$1.25 / $4.25
14 Gemini 3.7 Flash (high reasoning)Google
1,485
1,477–1,492
$1.50 / $7.50
15 Claude Sonnet 5.5 (extra-high reasoning)Anthropic
1,484
1,466–1,502
$2 / $10
16 Claude Opus 4.5 (high reasoning, 32k budget)Anthropic · best of 2 settings
1,483
1,476–1,490
$5 / $25
17 Gemini 3.1 Pro PreviewGoogle
1,480
1,475–1,484
$2 / $12
18 DeepSeek-V4.1-Flash (max reasoning)DeepSeek
1,479
1,469–1,490
$0.30 / $1.20
19 GPT-5.5 (high reasoning)OpenAI · best of 2 settings
1,478
1,472–1,483
$5 / $30
20 Muse Spark 1.2 (extra-high reasoning)Meta
1,477
1,462–1,492
$1.25 / $4.25
21 GLM-5.3 (max reasoning)Z.ai
1,476
1,467–1,484
$1.40 / $4.40
22 Claude Sonnet 4.6Anthropic
1,474
1,469–1,480
$3 / $15
22 MiMo-V2.6-ProXiaomi
1,474
1,458–1,490
$0.43 / $0.87
22 GPT-6 Astra (max reasoning)OpenAI
1,474
1,463–1,485
$10 / $50
22 Qwen3.8-Max (0902)Alibaba
1,474
1,466–1,481
$2 / $6
26 Gemini 3 Pro PreviewGoogle
1,473
1,466–1,479
–
27 Muse Spark 1.1Meta
1,472
1,466–1,479
$1.25 / $4.25
27 Gemini 3.6 Flash (high reasoning)Google
1,472
1,466–1,479
$1.50 / $7.50
27 GLM-5.3-FlashZ.ai
1,472
1,464–1,479
$0.15 / $0.50
30 GPT-5.4 (high reasoning)OpenAI · best of 2 settings
1,471
1,466–1,477
$2.50 / $15
31 GLM-5.2 (max reasoning)Z.ai
1,470
1,464–1,475
$1.40 / $4.40
32 MiMo-V2.5-ProXiaomi
1,469
1,464–1,474
$0.43 / $0.87
33 Claude Sonnet 5 (high reasoning)Anthropic
1,467
1,461–1,472
$2 / $10
33 Qwen3.5-Max-PreviewAlibaba
1,467
1,459–1,474
–
35 Gemini 3.5 Flash (medium reasoning)Google · best of 2 settings
1,466
1,460–1,471
$1.50 / $9
36 Qwen3.7-Max-PreviewAlibaba
1,465
1,449–1,482
–
36 Muse SparkMeta
1,465
1,456–1,474
–
38 Claude Sonnet 4.5 (high reasoning, 32k budget)Anthropic · best of 2 settings
1,464
1,459–1,468
$3 / $15
39 GPT-5.6 Terra (extra-high reasoning)OpenAI
1,461
1,455–1,468
$2 / $12
39 DeepSeek-V4-Pro (0813, high reasoning)DeepSeek
1,461
1,451–1,471
$1.32 / $3.96
39 Grok 4.5xAI
1,461
1,455–1,467
$2 / $6
42 GLM-5.1Z.ai
1,460
1,455–1,465
$1.38 / $4.40
43 Claude Opus 4.1 (16k reasoning budget)Anthropic · best of 2 settings
1,458
1,452–1,464
$15 / $75
44 Gemini 3 Flash PreviewGoogle · best of 2 settings
1,457
1,450–1,465
$0.50 / $3
44 GPT-5.2 Chat (2026-02-10)OpenAI
1,457
1,450–1,463
–
46 GPT-5.5 InstantOpenAI
1,456
1,449–1,463
–
46 Kimi K2.6Moonshot AI
1,456
1,449–1,462
$0.95 / $4
48 MiMo-V2.6-FlashXiaomi
1,453
1,440–1,466
$0.14 / $0.28
48 Gemma 4 31BGoogle
1,453
1,439–1,467
$0.14 / $0.40
48 GPT-6 Sol (max reasoning)OpenAI
1,453
1,442–1,464
$2 / $10
48 ERNIE 5.1Baidu
1,453
1,446–1,459
–
52 DeepSeek-V4-Pro (0423)DeepSeek · best of 2 settings
1,452
1,447–1,458
$1.42 / $2.83
53 Grok 4.6 (high reasoning)xAI
1,451
1,443–1,458
$2 / $6
54 GPT-5.1 (high reasoning)OpenAI · best of 2 settings
1,450
1,444–1,457
$1.25 / $10
54 Grok 4.20 Beta 1xAI
1,450
1,443–1,457
–
54 Qwen3.6-Max-PreviewAlibaba
1,450
1,436–1,463
$1.03 / $6.16
57 GPT-6 Luna (max reasoning)OpenAI
1,448
1,438–1,458
$0.10 / $0.50
58 Qwen3.7-PlusAlibaba
1,447
1,441–1,453
$0.32 / $1.28
58 Grok 4.20 Beta (0309, reasoning)xAI
1,447
1,441–1,452
–
60 GLM-5Z.ai
1,446
1,440–1,453
$0.95 / $2.55
60 Hy3Tencent
1,446
1,436–1,456
$0.14 / $0.58
62 Step 5 PreviewStepFun
1,445
1,427–1,464
–
62 GPT-5.6 Luna (extra-high reasoning)OpenAI
1,445
1,439–1,451
$0.20 / $1.20
62 MiMo-V2-ProXiaomi
1,445
1,437–1,452
–
65 Claude Opus 4 (16k reasoning budget)Anthropic · best of 2 settings
1,444
1,437–1,451
–
65 Grok 4.20 Multi-Agent Beta (0309)xAI
1,444
1,439–1,449
–
67 Gemini 3.5 Flash-LiteGoogle
1,443
1,437–1,449
$0.30 / $2.50
68 Grok 4.7 (extra-high reasoning)xAI
1,440
1,427–1,453
$2 / $6
69 Kimi K2.5 (reasoning on)Moonshot AI · best of 2 settings
1,439
1,434–1,444
$0.57 / $2.85
70 Gemini 2.5 ProGoogle
1,438
1,434–1,442
$1.25 / $10
71 Gemma 4 26B A4BGoogle
1,437
1,424–1,451
$0.10 / $0.30
71 GPT-4.5 PreviewOpenAI
1,437
1,428–1,445
–
73 GPT-5.3 ChatOpenAI
1,436
1,430–1,443
–
74 Qwen3.6-PlusAlibaba
1,435
1,430–1,441
$0.33 / $1.95
74 Dola-Seed-2.0-ProByteDance
1,435
1,430–1,440
–
76 MiniMax-M3MiniMax
1,434
1,429–1,440
$0.30 / $1.20
76 GPT-5.4 mini (high reasoning)OpenAI
1,434
1,428–1,439
$0.75 / $4.50
76 Qwen3.5-397B-A17BAlibaba
1,434
1,429–1,438
$0.55 / $3.50
79 DeepSeek-V4-Flash (0423, high reasoning)DeepSeek · best of 2 settings
1,433
1,428–1,439
$0.14 / $0.28
80 Grok 4.1xAI
1,431
1,426–1,436
–
80 MiMo-V2.5Xiaomi
1,431
1,424–1,437
$0.17 / $0.34
82 Grok 4.1 ThinkingxAI
1,430
1,424–1,435
–
83 MiMo-V2-OmniXiaomi
1,428
1,419–1,436
–
84 GPT-5.2 (high reasoning)OpenAI · best of 2 settings
1,427
1,421–1,433
$1.75 / $14
84 ChatGPT-4o (2025-03-26)OpenAI
1,427
1,422–1,431
–
86 Qwen3.8-27BAlibaba
1,426
1,418–1,434
$0.50 / $3
86 InklingThinking Machines
1,426
1,420–1,432
$0.95 / $4.05
88 GLM-4.7Z.ai
1,425
1,415–1,436
$0.54 / $1.98
88 ERNIE 5.0 (0110)Baidu
1,425
1,419–1,431
–
90 Qwen3-Max-PreviewAlibaba
1,424
1,417–1,432
–
90 GLM-5V-TurboZ.ai
1,424
1,414–1,434
$1.20 / $4
92 Mistral Medium 3.5Mistral AI
1,422
1,412–1,432
$1.50 / $7.50
93 DeepSeek-V3.1-Terminus (reasoning on)DeepSeek · best of 2 settings
1,420
1,400–1,440
$0.27 / $1
93 DeepSeek-V3.2DeepSeek · best of 2 settings
1,420
1,414–1,426
$0.30 / $0.96
95 ERNIE 5.0 Preview (1203)Baidu
1,419
1,408–1,431
–
96 Kimi K2 Thinking TurboMoonshot AI
1,418
1,413–1,423
–
97 DeepSeek-V3.1 (reasoning on)DeepSeek · best of 2 settings
1,416
1,405–1,427
$0.55 / $1.65
97 DeepSeek-V3.2-Exp (reasoning on)DeepSeek · best of 2 settings
1,416
1,404–1,427
$0.27 / $0.41
97 LongCat-Flash-Chat (2602, experimental)Meituan
1,416
1,409–1,423
–
100 Claude Sonnet 4 (32k reasoning budget)Anthropic · best of 2 settings
1,415
1,409–1,422
$3 / $15
100 Claude Haiku 4.5Anthropic
1,415
1,411–1,419
$1 / $5
100 GPT-5 ChatOpenAI
1,415
1,408–1,422
–
103 Grok 4.3xAI
1,414
1,409–1,420
$1.25 / $2.50
103 Qwen3-235B-A22B-Instruct-2507Alibaba
1,414
1,410–1,418
$0.15 / $0.75
103 Nova Experimental Chat (2026-02-10)Amazon
1,414
1,396–1,432
–
106 Qwen3-MaxAlibaba
1,413
1,402–1,425
$0.78 / $3.90
106 Muse GlimmerMeta
1,413
1,397–1,429
–
108 GLM-4.6Z.ai
1,412
1,406–1,419
$0.50 / $2
108 Claude 3.7 Sonnet (32k reasoning budget)Anthropic · best of 2 settings
1,412
1,405–1,418
–
110 GPT-5 (high reasoning)OpenAI
1,410
1,403–1,417
$1.25 / $10
111 Qwen3-VL-235B-A22B-InstructAlibaba
1,409
1,398–1,421
$0.30 / $1.50
112 Gemini 3.1 Flash-Lite PreviewGoogle
1,407
1,402–1,413
$0.25 / $1.50
112 o1OpenAI
1,407
1,401–1,414
$15 / $60
112 MiniMax-M2.7MiniMax
1,407
1,402–1,412
$0.30 / $1.20
115 Qwen3.5-122B-A10BAlibaba
1,406
1,399–1,412
$0.26 / $2.08
116 Nemotron 3 Ultra 550B A55B (NVFP4)NVIDIA
1,405
1,395–1,415
–
116 GLM-4.5Z.ai
1,405
1,397–1,412
$0.60 / $2.20
118 GPT-4.1OpenAI
1,403
1,398–1,409
$2 / $8
118 Grok 3 Preview (02-24)xAI
1,403
1,397–1,410
–
118 o3OpenAI
1,403
1,397–1,408
$2 / $8
121 Grok 4.1 Fast (reasoning)xAI
1,402
1,396–1,407
–
122 Qwen3.5-27BAlibaba
1,401
1,394–1,407
$0.27 / $2.16
123 Mistral Large 3Mistral AI
1,400
1,396–1,405
$0.50 / $1.50
123 Gemini 2.5 Flash Preview (09-2025)Google
1,400
1,393–1,407
–
125 Gemini 2.5 FlashGoogle
1,399
1,396–1,403
$0.30 / $2.50
126 Nova Experimental Chat (2026-01-10)Amazon
1,398
1,380–1,416
–
126 ERNIE 5.0 Preview (1022)Baidu
1,398
1,383–1,413
–
128 DeepSeek-R1DeepSeek
1,397
1,390–1,405
$0.70 / $2.50
128 Hunyuan Vision 1.5 ThinkingTencent
1,397
1,375–1,419
–
128 Grok 4 (0709)xAI
1,397
1,390–1,403
–
131 Hy3 PreviewTencent
1,396
1,384–1,409
$0.18 / $0.60
132 Grok 4 Fast ChatxAI
1,395
1,381–1,410
–
132 Mistral Medium 3.1Mistral AI
1,395
1,391–1,399
$0.40 / $2
134 Inkling SmallThinking Machines
1,394
1,387–1,400
$0.45 / $1.20
135 DeepSeek-R1-0528DeepSeek
1,391
1,381–1,401
$0.50 / $2.18
136 Kimi K2 (0905)Moonshot AI
1,390
1,379–1,401
$0.60 / $2.50
137 Grok 4 Fast (reasoning)xAI
1,388
1,380–1,397
–
137 LongCat-Flash-ChatMeituan
1,388
1,377–1,399
–
139 GPT-5.4 nano (high reasoning)OpenAI
1,387
1,381–1,392
$0.20 / $1.25
140 Qwen3.5-35B-A3BAlibaba
1,386
1,379–1,392
$0.16 / $1.30
141 MiniMax-M2.1 PreviewMiniMax
1,385
1,376–1,394
–
141 Qwen3-235B-A22B-Thinking-2507Alibaba
1,385
1,372–1,397
$0.30 / $3
143 Step 3.5 FlashStepFun
1,384
1,379–1,389
$0.10 / $0.30
143 Qwen3-Coder-480B-A35BAlibaba
1,384
1,376–1,391
$0.35 / $1.50
145 Qwen3-VL-235B-A22B-ThinkingAlibaba
1,382
1,370–1,394
$0.40 / $4
145 MiMo-V2-Flash (no reasoning)Xiaomi · best of 2 settings
1,382
1,377–1,388
–
147 MiniMax-M2.5MiniMax
1,381
1,375–1,387
$0.30 / $1.20
147 Qwen3.5-FlashAlibaba
1,381
1,376–1,386
$0.065 / $0.26
147 o1-previewOpenAI
1,381
1,374–1,388
–
147 Qwen3-235B-A22B (no reasoning)Alibaba · best of 2 settings
1,381
1,374–1,388
$0.46 / $1.82
147 Kimi K2 (0711)Moonshot AI
1,381
1,373–1,388
$0.57 / $2.30
152 Solar Pro 4Upstage
1,379
1,371–1,387
$0.09 / $0.36
153 DeepSeek-V3-0324DeepSeek
1,378
1,372–1,384
$0.25 / $1
154 Nova Experimental Chat (12-10)Amazon
1,377
1,359–1,396
–
155 Qwen3-Next-80B-A3B-InstructAlibaba
1,376
1,369–1,384
$0.10 / $1.10
156 Claude 3.5 Sonnet (2024-10-22)Anthropic
1,374
1,370–1,379
–
157 Hunyuan T1 (2025-07-11)Tencent
1,373
1,356–1,391
–
157 GPT-5 mini (high reasoning)OpenAI
1,373
1,366–1,381
$0.25 / $2
157 GPT-4.1 miniOpenAI
1,373
1,366–1,379
$0.40 / $1.60
160 Trinity Large PreviewArcee AI
1,370
1,363–1,376
–
161 o4-miniOpenAI
1,369
1,362–1,375
$1.10 / $4.40
162 Gemini 2.5 Flash-Lite Preview (06-17, reasoning on)Google
1,368
1,361–1,375
–
163 GLM-4.6VZ.ai
1,367
1,346–1,388
$0.30 / $0.90
163 Qwen3-30B-A3B-Instruct-2507Alibaba
1,367
1,359–1,374
$0.09 / $0.30
165 o3-mini (high reasoning)OpenAI · best of 2 settings
1,366
1,359–1,374
$1.10 / $4.40
165 Mistral Medium 3Mistral AI
1,366
1,359–1,373
$0.40 / $2
167 Gemini 2.5 Flash-Lite Preview (09-2025, no reasoning)Google
1,363
1,358–1,369
–
168 Nova Experimental Chat (11-10)Amazon
1,361
1,354–1,368
–
168 GLM-4.5-AirZ.ai
1,361
1,354–1,368
$0.14 / $0.86
170 Grok 3 Mini (high reasoning)xAI
1,360
1,351–1,369
–
171 Qwen3-Next-80B-A3B-ThinkingAlibaba
1,359
1,350–1,369
$0.15 / $1.20
172 Trinity Large ThinkingArcee AI
1,357
1,350–1,364
$0.25 / $0.80
172 Qwen2.5-MaxAlibaba
1,357
1,351–1,363
–
174 Hunyuan TurboS (2025-04-16)Tencent
1,353
1,341–1,365
–
174 Grok 3 Mini BetaxAI
1,353
1,345–1,361
–
176 Llama 3.1 Nemotron Ultra 253B v1NVIDIA
1,351
1,330–1,373
–
176 Hunyuan TurboS (2025-02-26)Tencent
1,351
1,333–1,368
–
178 GLM-4.7-FlashZ.ai
1,348
1,338–1,358
$0.06 / $0.40
179 Gemini 2.0 Flash (001)Google
1,347
1,342–1,353
–
180 MiniMax-M1MiniMax
1,346
1,339–1,353
$0.40 / $2.20
181 Nova Experimental Chat (10-20)Amazon
1,345
1,335–1,356
–
181 Step 3StepFun
1,345
1,330–1,359
–
183 Nemotron 3.5 Lightning 30B A3B (NVFP4)NVIDIA
1,344
1,335–1,353
–
184 DeepSeek-V3DeepSeek
1,343
1,336–1,350
$0.26 / $1.03
184 Gemma 3 27BGoogle
1,343
1,337–1,349
$0.12 / $0.20
186 Nemotron 3 Super 120B A12BNVIDIA
1,342
1,330–1,355
$0.085 / $0.40
186 Command ACohere
1,342
1,336–1,347
$2.50 / $10
188 Gemini 1.5 Pro (002)Google
1,340
1,335–1,345
–
189 GLM-4.5VZ.ai
1,339
1,323–1,355
$0.60 / $1.80
190 Claude 3.5 Sonnet (2024-06-20)Anthropic
1,338
1,333–1,343
–
190 Granite 4.2 30BIBM
1,338
1,320–1,356
–
190 Mistral Small 3.2 24BMistral AI
1,338
1,329–1,347
$0.094 / $0.25
193 MiniMax-M2MiniMax
1,334
1,321–1,347
$0.30 / $1.20
194 INTELLECT-3Prime Intellect
1,332
1,317–1,348
–
194 Qwen-PlusAlibaba
1,332
1,320–1,344
$0.26 / $0.78
194 o1-miniOpenAI
1,332
1,326–1,337
–
197 Gemini 2.0 Flash-Lite Preview (02-05)Google
1,331
1,325–1,338
–
197 Qwen3-32BAlibaba
1,331
1,312–1,350
$0.14 / $0.40
199 Nova 2 LiteAmazon
1,327
1,317–1,337
$0.30 / $2.50
199 GPT-5 nano (high reasoning)OpenAI
1,327
1,314–1,340
$0.05 / $0.40
201 Mercury 2Inception
1,326
1,307–1,346
$0.25 / $0.75
201 GPT-4o (2024-05-13)OpenAI
1,326
1,321–1,331
$5 / $15
203 Llama 3.3 Nemotron Super 49B v1NVIDIA
1,325
1,306–1,345
–
204 gpt-oss-120bOpenAI
1,323
1,316–1,330
$0.15 / $0.60
204 QwQ-32BAlibaba
1,323
1,316–1,330
–
206 Llama 3.3 Nemotron Super 49B v1.5NVIDIA
1,321
1,301–1,341
–
206 Gemma 3 12BGoogle
1,321
1,305–1,337
$0.05 / $0.15
208 Olmo 3.1 32B InstructAi2
1,320
1,310–1,331
–
209 GPT-4o (2024-08-06)OpenAI
1,319
1,313–1,325
$2.50 / $10
210 Gemini Advanced (0514)Google
1,317
1,311–1,324
–
211 Ring-flash-2.0Ant Group
1,316
1,303–1,330
–
211 Claude 3.5 HaikuAnthropic
1,316
1,311–1,321
–
211 Hunyuan Large (2025-02-10)Tencent
1,316
1,300–1,332
–
211 Step-2 16K Exp (2024-12)StepFun
1,316
1,303–1,328
–
215 Ling-flash-2.0Ant Group
1,315
1,302–1,329
–
215 Llama 3.1 405B Instruct (FP8)Meta
1,315
1,310–1,320
–
217 Claude 3 OpusAnthropic
1,314
1,310–1,319
–
217 GLM-4-Plus (0111)Z.ai
1,314
1,302–1,327
–
217 Nova Experimental Chat (10-09)Amazon
1,314
1,293–1,336
–
217 Llama 3.1 405B Instruct (BF16)Meta
1,314
1,309–1,320
–
217 DeepSeek-V2.5-1210DeepSeek
1,314
1,303–1,326
–
217 Llama 4 MaverickMeta
1,314
1,307–1,320
$0.27 / $0.85
217 Hunyuan Turbo (0110)Tencent
1,314
1,295–1,332
–
224 Grok 2 (2024-08-13)xAI
1,312
1,307–1,317
–
224 Gemini 1.5 Pro (001)Google
1,312
1,306–1,317
–
226 Qwen3-30B-A3BAlibaba
1,310
1,302–1,317
$0.12 / $0.50
227 Yi-Lightning01.AI
1,308
1,301–1,315
–
228 Step-1o Turbo (2025-06)StepFun
1,307
1,294–1,319
–
229 Molmo 2 8BAi2
1,304
1,267–1,342
–
230 GPT-4 TurboOpenAI
1,303
1,298–1,309
$10 / $30
231 Athene-V2-ChatNexusflow
1,302
1,296–1,308
–
231 Qwen-Max (0919)Alibaba
1,302
1,294–1,310
–
233 GLM-4-PlusZ.ai
1,301
1,294–1,308
–
233 Magistral Medium 1.0Mistral AI
1,301
1,290–1,311
–
235 GPT-4.1 nanoOpenAI
1,300
1,288–1,313
$0.10 / $0.40
235 Mistral Large 2 (2407)Mistral AI
1,300
1,294–1,305
$2 / $6
237 Llama 4 ScoutMeta
1,299
1,292–1,306
$0.18 / $0.59
237 Olmo 3 32B ThinkAi2
1,299
1,283–1,315
–
239 GPT-4 Turbo Preview (1106)OpenAI
1,297
1,291–1,302
–
240 Mistral Large 2.1 (2411)Mistral AI
1,295
1,289–1,301
–
241 Qwen2.5-Plus (1127)Alibaba
1,294
1,285–1,304
–
241 Mistral Small 3.1 24BMistral AI
1,294
1,287–1,301
$0.35 / $0.56
243 GPT-4o mini (2024-07-18)OpenAI
1,293
1,288–1,298
$0.15 / $0.60
243 Llama 3.3 70B InstructMeta
1,293
1,288–1,298
$0.59 / $0.79
245 Qwen2.5-72B-InstructAlibaba
1,292
1,286–1,298
$0.36 / $0.40
245 DeepSeek-V2.5DeepSeek
1,292
1,285–1,298
–
247 Nemotron 3 Nano 30B A3BNVIDIA
1,291
1,282–1,300
$0.05 / $0.20
248 GPT-4 Turbo Preview (0125)OpenAI
1,290
1,285–1,296
–
248 Gemini 1.5 Flash (002)Google
1,290
1,284–1,296
–
250 Granite 4.1 8BIBM
1,287
1,270–1,304
–
251 Hunyuan Large VisionTencent
1,286
1,269–1,303
–
252 GPT-4 (0314)OpenAI
1,285
1,278–1,293
–
252 Granite 4.2 3BIBM
1,285
1,265–1,305
–
254 Grok 2 Mini (2024-08-13)xAI
1,284
1,278–1,289
–
255 Gemma 3n E4BGoogle
1,282
1,273–1,290
–
255 Hunyuan Standard (2025-02-10)Tencent
1,282
1,266–1,297
–
257 gpt-oss-20bOpenAI
1,281
1,269–1,294
$0.03 / $0.15
257 Granite 4.2 8BIBM
1,281
1,262–1,300
$0.06 / $0.25
259 Llama 3.1 Nemotron 70B InstructNVIDIA
1,280
1,269–1,291
–
259 Olmo 3.1 32B ThinkAi2
1,280
1,266–1,293
–
261 Athene 70B (0725)Nexusflow
1,279
1,271–1,286
–
262 GPT-4 (0613)OpenAI
1,277
1,271–1,283
–
262 Nova Pro 1.0Amazon
1,277
1,270–1,283
$0.80 / $3.20
264 Llama 3.1 70B InstructMeta
1,273
1,267–1,278
$0.40 / $0.40
265 Llama 3.1 Tülu 3 70BAi2
1,272
1,257–1,288
–
266 Gemma 2 27BGoogle
1,271
1,267–1,276
$0.65 / $0.65
267 MercuryInception
1,269
1,244–1,295
–
268 Claude 3 SonnetAnthropic
1,268
1,263–1,274
–
268 Granite H SmallIBM
1,268
1,252–1,283
–
270 Gemma 3 4BGoogle
1,267
1,251–1,284
$0.05 / $0.10
270 Jamba 1.5 LargeAI21 Labs
1,267
1,256–1,277
–
272 Gemini 1.5 Flash (001)Google
1,265
1,259–1,271
–
273 Qwen2.5-Coder-32B-InstructAlibaba
1,264
1,252–1,276
$0.66 / $1
274 Llama 3.1 Nemotron 51B InstructNVIDIA
1,263
1,248–1,277
–
275 Reka Core (2024-09-04)Reka AI
1,262
1,252–1,272
–
276 Nemotron-4 340B InstructNVIDIA
1,259
1,251–1,268
–
276 Llama 3 70B InstructMeta
1,259
1,253–1,264
–
278 GLM-4 (0520)Z.ai
1,256
1,246–1,267
–
279 Mistral Small 3Mistral AI
1,255
1,247–1,264
$0.05 / $0.08
280 Command R+ (08-2024)Cohere
1,254
1,245–1,263
$2.50 / $10
281 DeepSeek-Coder-V2DeepSeek
1,253
1,244–1,262
–
282 Gemma 2 9B SimPOPrinceton NLP
1,252
1,242–1,262
–
283 Reka Flash (2024-09-04)Reka AI
1,249
1,239–1,260
–
283 Aya Expanse 32BCohere
1,249
1,243–1,256
–
285 Phi-4Microsoft
1,245
1,239–1,252
$0.07 / $0.14
285 Claude 3 HaikuAnthropic
1,245
1,240–1,251
–
285 Gemma 2 9BGoogle
1,245
1,240–1,251
–
288 Nova Lite 1.0Amazon
1,244
1,237–1,251
$0.06 / $0.24
289 Hunyuan Standard 256KTencent
1,243
1,227–1,260
–
289 Qwen2-72B-InstructAlibaba
1,243
1,236–1,249
–
291 Command R+Cohere
1,241
1,235–1,247
–
292 Gemini 1.5 Flash-8B (001)Google
1,238
1,232–1,244
–
292 Mistral Large (2402)Mistral AI
1,238
1,231–1,245
–
294 Command R (08-2024)Cohere
1,236
1,227–1,245
$0.15 / $0.60
295 OLMo 2 32B Instruct (0325)Ai2
1,229
1,212–1,246
–
296 Gemini ProGoogle
1,220
1,204–1,237
–
297 Qwen1.5-110B-ChatAlibaba
1,218
1,210–1,226
–
298 GPT-3.5 Turbo (0125)OpenAI
1,216
1,209–1,222
–
299 Mixtral 8x22B InstructMistral AI
1,215
1,209–1,222
$2 / $6
299 Nova Micro 1.0Amazon
1,215
1,208–1,222
$0.035 / $0.14
301 Qwen1.5-72B-ChatAlibaba
1,212
1,205–1,220
–
302 Ministral 8B (2410)Mistral AI
1,211
1,198–1,224
–
302 Mistral MediumMistral AI
1,211
1,202–1,219
–
304 Gemini Pro (Dev API)Google
1,210
1,200–1,221
–
305 Llama 3.1 Tülu 3 8BAi2
1,208
1,193–1,224
–
306 Jamba 1.5 MiniAI21 Labs
1,205
1,194–1,215
–
306 Aya Expanse 8BCohere
1,205
1,195–1,214
–
308 Reka Flash 21B (2024-02-26, online)Reka AI
1,202
1,192–1,212
–
309 Command RCohere
1,200
1,193–1,207
–
310 GPT-3.5 Turbo (1106)OpenAI
1,198
1,186–1,210
–
311 Zephyr ORPO 141B A35B v0.1Hugging Face
1,194
1,178–1,209
–
312 Granite 3.1 8B InstructIBM
1,193
1,176–1,210
–
312 Reka Flash 21B (2024-02-26)Reka AI
1,193
1,184–1,201
–
312 Llama 3 8B InstructMeta
1,193
1,187–1,199
–
315 Llama 3.1 8B InstructMeta
1,191
1,185–1,197
$0.05 / $0.08
316 Yi-1.5-34B-Chat01.AI
1,188
1,180–1,196
–
316 DBRX Instruct PreviewDatabricks
1,188
1,179–1,196
–
318 Qwen1.5-32B-ChatAlibaba
1,185
1,176–1,193
–
319 Mixtral 8x7B Instruct v0.1Mistral AI
1,181
1,175–1,187
–
320 InternLM2.5 20B ChatShanghai AI Lab
1,178
1,168–1,188
–
320 Phi-3-medium-4k-instructMicrosoft
1,178
1,170–1,185
–
322 Granite 3.1 2B InstructIBM
1,173
1,157–1,190
–
323 Granite 3.0 8B InstructIBM
1,172
1,160–1,185
–
324 Tülu 2 DPO 70BAi2
1,171
1,157–1,186
–
324 Gemma 2 2BGoogle
1,171
1,165–1,177
–
326 Qwen1.5-14B-ChatAlibaba
1,168
1,158–1,178
–
327 WizardLM 70BMicrosoft
1,164
1,150–1,177
–
328 DeepSeek LLM 67B ChatDeepSeek
1,158
1,141–1,175
–
329 Gemma 1.1 7BGoogle
1,157
1,149–1,165
–
330 OpenChat 3.5 (0106)OpenChat
1,156
1,145–1,166
–
331 OpenChat 3.5OpenChat
1,155
1,140–1,169
–
332 Phi-3-small-8k-instructMicrosoft
1,154
1,146–1,163
–
332 Snowflake Arctic InstructSnowflake
1,154
1,145–1,162
–
332 OpenHermes 2.5 Mistral 7BTeknium
1,154
1,138–1,169
–
335 Yi-34B-Chat01.AI
1,152
1,143–1,162
–
336 Llama 3.2 3B InstructMeta
1,146
1,135–1,157
$0.05 / $0.33
336 Starling-LM-7B-betaNexusflow
1,146
1,136–1,156
–
336 QwQ-32B-PreviewAlibaba
1,146
1,130–1,161
–
339 Vicuna 33BLMSYS
1,140
1,131–1,149
–
340 Starling-LM-7B-alphaUC Berkeley
1,137
1,125–1,148
–
341 MPT-30B-ChatMosaicML
1,135
1,114–1,156
–
341 Llama 2 70B ChatMeta
1,135
1,127–1,143
–
341 Falcon 180B ChatTII
1,135
1,106–1,163
–
344 Granite 3.0 2B InstructIBM
1,132
1,120–1,145
–
345 Dolphin 2.2.1 Mistral 7BCognitive Computations
1,129
1,105–1,154
–
346 Llama 2 70B SteerLM ChatNVIDIA
1,125
1,106–1,143
–
346 Phi-3-mini-4k-instruct (June 2024)Microsoft
1,125
1,115–1,134
–
348 WizardLM 13BMicrosoft
1,124
1,110–1,138
–
348 Qwen1.5-7B-ChatAlibaba
1,124
1,110–1,138
–
348 Mistral 7B Instruct v0.2Mistral AI
1,124
1,114–1,133
–
351 Qwen-14B-ChatAlibaba
1,119
1,103–1,135
–
352 PaLM 2Google
1,117
1,104–1,131
–
352 Vicuna 13BLMSYS
1,117
1,108–1,127
–
354 Solar 10.7B Instruct v1.0Upstage
1,116
1,098–1,135
–
355 Phi-3-mini-4k-instructMicrosoft
1,114
1,105–1,122
–
356 Llama 2 13B ChatMeta
1,110
1,101–1,120
–
357 Nous Hermes 2 Mixtral 8x7B DPONous Research
1,108
1,091–1,124
–
358 Gemma 7BGoogle
1,105
1,092–1,118
–
358 Code Llama 34B InstructMeta
1,105
1,091–1,118
–
360 SmolLM2 1.7B InstructHugging Face
1,104
1,083–1,125
–
361 Gemma 1.1 2BGoogle
1,102
1,091–1,113
–
362 Phi-3-mini-128k-instructMicrosoft
1,100
1,090–1,111
–
363 Zephyr 7B AlphaHugging Face
1,099
1,075–1,123
–
364 Code Llama 70B InstructMeta
1,098
1,068–1,127
–
365 StripedHyena Nous 7BTogether AI
1,091
1,076–1,106
–
366 Zephyr 7B BetaHugging Face
1,089
1,076–1,102
–
367 Mistral 7B InstructMistral AI
1,087
1,074–1,101
–
368 Llama 3.2 1B InstructMeta
1,086
1,075–1,097
$0.027 / $0.20
369 Vicuna 7BLMSYS
1,077
1,063–1,091
–
370 Gemma 2BGoogle
1,071
1,055–1,087
–
371 Qwen1.5-4B-ChatAlibaba
1,070
1,057–1,083
–
371 Llama 2 7B ChatMeta
1,070
1,060–1,080
–
373 Guanaco 33BTim Dettmers
1,066
1,045–1,087
–
374 GPT4All 13B SnoozyNomic AI
1,038
1,013–1,063
–
375 ChatGLM3-6BZ.ai
1,037
1,019–1,055
–
376 OLMo 7B InstructAi2
1,029
1,013–1,045
–
377 Koala 13BUC Berkeley
1,027
1,011–1,042
–
378 Alpaca 13BStanford
1,025
1,009–1,042
–
379 MPT-7B-ChatMosaicML
1,009
991–1,028
–
380 OpenAssistant Pythia 12BOpenAssistant
988
972–1,004
–
381 ChatGLM2-6BZ.ai
983
960–1,005
–
382 ChatGLM-6BZ.ai
978
960–996
–
383 RWKV-4 Raven 14BRWKV
970
953–987
–
384 FastChat-T5 3BLMSYS
958
940–977
–
385 Dolly v2 12BDatabricks
940
919–961
–
386 LLaMA 13BMeta
918
893–944
–
387 StableLM Tuned Alpha 7BStability AI
910
890–930
–

Swipe the table sideways for more columns.

Ranks follow the score as shown, so equal numbers share a rank. ≈ marks results whose 95% range overlaps the leader's: they cannot be told apart from it. Each model is shown at its best setting; show every setting. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on prompts that set explicit instructions.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.