Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Head-to-head human preference across all text prompts.

Last updated 2 Oct 2026

Results dated
2 Oct 2026
Results
413 configurations of 387 models
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International

Overall: Muse Spark

Top 15 of 387 results · Arena rating, higher is better · lines show the 95% range. Choose a model to highlight it.Clear highlight

  1. 1 Gemini 4 Argon (high reasoning)Google 1,525
  2. 2 Claude Opus 4.6 (high reasoning)Anthropic 1,505
  3. 3 Claude Fable 5 (high reasoning)Anthropic 1,504
  4. 3 Claude Opus 5.5 (high reasoning)Anthropic 1,504
  5. 5 Claude Opus 4.7 (high reasoning)Anthropic 1,501
  6. 5 Claude Fable 5.1 (max reasoning)Anthropic 1,501
  7. 7 Gemini 3.8 Flash (high reasoning)Google 1,495
  8. 8 Muse Spark 1.3 (max reasoning)Meta 1,494
  9. 8 Muse Spark 1.2 (extra-high reasoning)Meta 1,494
  10. 10 Muse Spark 1.1Meta 1,491
  11. 11 Claude Opus 5 (high reasoning)Anthropic 1,490
  12. 12 Muse SparkMeta 1,489
  13. 13 Kimi K3 (max reasoning)Moonshot AI 1,488
  14. 13 Gemini 3.7 Flash (high reasoning)Google 1,488
  15. 15 Gemini 3.1 Pro PreviewGoogle 1,487

Full results

Arena Text: overall, Arena rating, higher is better
#ModelOverall · 95% range
Arena rating, higher is better
Price
$ per million tokens, in / out
1 Gemini 4 Argon (high reasoning)Google
1,525
1,516–1,534
–
2 Claude Opus 4.6 (high reasoning)Anthropic · best of 2 settings
1,505
1,501–1,508
$5 / $25
3 Claude Fable 5 (high reasoning)Anthropic
1,504
1,500–1,509
$10 / $50
3 Claude Opus 5.5 (high reasoning)Anthropic
1,504
1,495–1,513
$4 / $20
5 Claude Opus 4.7 (high reasoning)Anthropic · best of 2 settings
1,501
1,498–1,505
$5 / $25
5 Claude Fable 5.1 (max reasoning)Anthropic
1,501
1,495–1,508
$10 / $50
7 Gemini 3.8 Flash (high reasoning)Google
1,495
1,490–1,500
$1.50 / $7.50
8 Muse Spark 1.3 (max reasoning)Meta
1,494
1,488–1,500
$1.25 / $4.25
8 Muse Spark 1.2 (extra-high reasoning)Meta
1,494
1,484–1,503
$1.25 / $4.25
10 Muse Spark 1.1Meta
1,491
1,487–1,496
$1.25 / $4.25
11 Claude Opus 5 (high reasoning)Anthropic · best of 2 settings
1,490
1,486–1,494
$5 / $25
12 Muse SparkMeta
1,489
1,484–1,495
–
13 Kimi K3 (max reasoning)Moonshot AI
1,488
1,484–1,493
$3 / $15
13 Gemini 3.7 Flash (high reasoning)Google
1,488
1,483–1,493
$1.50 / $7.50
15 Gemini 3.1 Pro PreviewGoogle
1,487
1,484–1,490
$2 / $12
16 Gemini 3 Pro PreviewGoogle
1,485
1,482–1,489
–
17 GPT-5.6 Sol (extra-high reasoning)OpenAI
1,484
1,479–1,488
$4 / $20
18 GPT-6.1 Sol (max reasoning)OpenAI
1,483
1,473–1,494
$2 / $10
18 Gemini 3.6 Flash (high reasoning)Google
1,483
1,479–1,487
$1.50 / $7.50
20 Qwen3.8-Max (0902)Alibaba
1,482
1,476–1,487
$2 / $6
20 Claude Opus 4.8 (high reasoning)Anthropic · best of 2 settings
1,482
1,478–1,485
$5 / $25
22 GPT-5.5 (high reasoning)OpenAI · best of 2 settings
1,481
1,478–1,485
$5 / $30
23 MiMo-V2.6-ProXiaomi
1,480
1,471–1,489
$0.43 / $0.87
24 GLM-5.3 (max reasoning)Z.ai
1,478
1,473–1,484
$1.40 / $4.40
25 Gemini 3.5 Flash (high reasoning)Google · best of 2 settings
1,477
1,473–1,481
$1.50 / $9
25 GPT-6 Astra (max reasoning)OpenAI
1,477
1,470–1,484
$10 / $50
27 GLM-5.2 (max reasoning)Z.ai
1,476
1,471–1,480
$1.40 / $4.40
27 GPT-5.2 Chat (2026-02-10)OpenAI
1,476
1,472–1,480
–
29 GPT-5.4 (high reasoning)OpenAI · best of 2 settings
1,475
1,471–1,479
$2.50 / $15
29 Qwen3.7-Max-PreviewAlibaba
1,475
1,465–1,485
–
29 Grok 4.20 Beta 1xAI
1,475
1,470–1,479
–
32 DeepSeek-V4.1-Flash (max reasoning)DeepSeek
1,474
1,468–1,481
$0.30 / $1.20
32 Claude Opus 4.5 (high reasoning, 32k budget)Anthropic · best of 2 settings
1,474
1,470–1,477
$5 / $25
34 GPT-5.5 InstantOpenAI
1,473
1,468–1,478
–
34 GLM-5.3-FlashZ.ai
1,473
1,468–1,478
$0.15 / $0.50
34 Gemini 3 Flash PreviewGoogle · best of 2 settings
1,473
1,468–1,477
$0.50 / $3
37 Claude Sonnet 4.6Anthropic
1,472
1,469–1,476
$3 / $15
37 Grok 4.20 Beta (0309, reasoning)xAI
1,472
1,468–1,475
–
39 Claude Sonnet 5.5 (extra-high reasoning)Anthropic
1,471
1,461–1,481
$2 / $10
39 Grok 4.20 Multi-Agent Beta (0309)xAI
1,471
1,467–1,474
–
41 ERNIE 5.1Baidu
1,468
1,463–1,472
–
41 MiMo-V2.5-ProXiaomi
1,468
1,464–1,471
$0.43 / $0.87
43 Grok 4.5xAI
1,466
1,461–1,470
$2 / $6
44 GPT-5.6 Terra (extra-high reasoning)OpenAI
1,465
1,461–1,470
$2 / $12
44 Grok 4.1 ThinkingxAI
1,465
1,462–1,468
–
44 Qwen3.5-Max-PreviewAlibaba
1,465
1,460–1,470
–
44 GLM-5.1Z.ai
1,465
1,461–1,468
$1.38 / $4.40
48 DeepSeek-V4-Pro (0813, high reasoning)DeepSeek
1,464
1,458–1,471
$1.32 / $3.96
49 Claude Sonnet 5 (high reasoning)Anthropic
1,462
1,458–1,466
$2 / $10
50 Kimi K2.6Moonshot AI
1,461
1,457–1,465
$0.95 / $4
51 Qwen3.6-Max-PreviewAlibaba
1,460
1,452–1,469
$1.03 / $6.16
52 Grok 4.1xAI
1,459
1,456–1,462
–
53 DeepSeek-V4-Pro (0423)DeepSeek · best of 2 settings
1,458
1,454–1,462
$1.42 / $2.83
53 GLM-5Z.ai
1,458
1,453–1,462
$0.95 / $2.55
55 GPT-6 Sol (max reasoning)OpenAI
1,457
1,450–1,464
$2 / $10
55 Claude Sonnet 4.5 (high reasoning, 32k budget)Anthropic · best of 2 settings
1,457
1,454–1,459
$3 / $15
57 Dola-Seed-2.0-ProByteDance
1,456
1,453–1,460
–
57 Hy3Tencent
1,456
1,449–1,463
$0.14 / $0.58
57 Qwen3.7-PlusAlibaba
1,456
1,451–1,460
$0.32 / $1.28
57 GPT-5.1 (high reasoning)OpenAI · best of 2 settings
1,456
1,452–1,459
$1.25 / $10
61 Gemini 3.5 Flash-LiteGoogle
1,455
1,450–1,459
$0.30 / $2.50
62 Grok 4.6 (high reasoning)xAI
1,454
1,449–1,459
$2 / $6
62 Step 5 PreviewStepFun
1,454
1,443–1,465
–
64 GPT-5.6 Luna (extra-high reasoning)OpenAI
1,453
1,449–1,457
$0.20 / $1.20
64 Gemma 4 31BGoogle
1,453
1,445–1,460
$0.14 / $0.40
66 MiMo-V2.6-FlashXiaomi
1,452
1,444–1,460
$0.14 / $0.28
67 Kimi K2.5 (reasoning on)Moonshot AI · best of 2 settings
1,450
1,447–1,453
$0.57 / $2.85
67 GPT-5.3 ChatOpenAI
1,450
1,446–1,454
–
67 Claude Opus 4.1 (16k reasoning budget)Anthropic · best of 2 settings
1,450
1,446–1,453
$15 / $75
70 ERNIE 5.0 Preview (1203)Baidu
1,449
1,442–1,455
–
71 MiMo-V2-ProXiaomi
1,448
1,443–1,453
–
72 GPT-5.4 mini (high reasoning)OpenAI
1,447
1,443–1,451
$0.75 / $4.50
73 ERNIE 5.0 (0110)Baidu
1,446
1,442–1,450
–
73 Gemini 2.5 ProGoogle
1,446
1,443–1,448
$1.25 / $10
75 GPT-4.5 PreviewOpenAI
1,445
1,439–1,450
–
76 Qwen3.6-PlusAlibaba
1,443
1,439–1,448
$0.33 / $1.95
76 ChatGPT-4o (2025-03-26)OpenAI
1,443
1,440–1,446
–
76 GPT-6 Luna (max reasoning)OpenAI
1,443
1,436–1,449
$0.10 / $0.50
79 Grok 4.7 (extra-high reasoning)xAI
1,442
1,435–1,450
$2 / $6
79 Qwen3.5-397B-A17BAlibaba
1,442
1,439–1,445
$0.55 / $3.50
81 GLM-4.7Z.ai
1,441
1,435–1,448
$0.54 / $1.98
81 Grok 4.3xAI
1,441
1,438–1,445
$1.25 / $2.50
81 InklingThinking Machines
1,441
1,437–1,446
$0.95 / $4.05
84 MiniMax-M3MiniMax
1,440
1,436–1,444
$0.30 / $1.20
85 DeepSeek-V4-Flash (0423, high reasoning)DeepSeek · best of 2 settings
1,438
1,434–1,443
$0.14 / $0.28
85 Qwen3.8-27BAlibaba
1,438
1,432–1,443
$0.50 / $3
87 Gemma 4 26B A4BGoogle
1,437
1,430–1,445
$0.10 / $0.30
87 GPT-5.2 (high reasoning)OpenAI · best of 2 settings
1,437
1,434–1,441
$1.75 / $14
87 LongCat-Flash-Chat (2602, experimental)Meituan
1,437
1,432–1,441
–
90 GPT-5 (high reasoning)OpenAI
1,435
1,430–1,439
$1.25 / $10
91 Qwen3-Max-PreviewAlibaba
1,434
1,430–1,439
–
91 MiMo-V2.5Xiaomi
1,434
1,429–1,438
$0.17 / $0.34
93 GLM-5V-TurboZ.ai
1,433
1,427–1,440
$1.20 / $4
93 Gemini 3.1 Flash-Lite PreviewGoogle
1,433
1,429–1,436
$0.25 / $1.50
95 o3OpenAI
1,432
1,428–1,435
$2 / $8
96 MiMo-V2-OmniXiaomi
1,431
1,425–1,437
–
97 Grok 4.1 Fast (reasoning)xAI
1,430
1,427–1,434
–
97 Kimi K2 Thinking TurboMoonshot AI
1,430
1,427–1,433
–
99 Mistral Medium 3.5Mistral AI
1,427
1,421–1,433
$1.50 / $7.50
99 GPT-5 ChatOpenAI
1,427
1,422–1,431
–
99 Nova Experimental Chat (2026-02-10)Amazon
1,427
1,417–1,436
–
102 Nemotron 3 Ultra 550B A55B (NVFP4)NVIDIA
1,426
1,419–1,433
–
102 Claude Opus 4 (16k reasoning budget)Anthropic · best of 2 settings
1,426
1,422–1,430
–
104 Muse GlimmerMeta
1,425
1,415–1,435
–
104 DeepSeek-V3.2-Exp (reasoning on)DeepSeek · best of 2 settings
1,425
1,418–1,432
$0.27 / $0.41
104 DeepSeek-V3.2DeepSeek · best of 2 settings
1,425
1,421–1,428
$0.30 / $0.96
107 GLM-4.6Z.ai
1,424
1,420–1,428
$0.50 / $2
108 Qwen3-MaxAlibaba
1,423
1,416–1,429
$0.78 / $3.90
109 Qwen3-235B-A22B-Instruct-2507Alibaba
1,422
1,420–1,425
$0.15 / $0.75
109 DeepSeek-R1-0528DeepSeek
1,422
1,416–1,427
$0.50 / $2.18
111 Grok 4 Fast ChatxAI
1,419
1,411–1,427
–
111 ERNIE 5.0 Preview (1022)Baidu
1,419
1,410–1,428
–
111 Kimi K2 (0905)Moonshot AI
1,419
1,412–1,425
$0.60 / $2.50
114 Kimi K2 (0711)Moonshot AI
1,418
1,413–1,423
$0.57 / $2.30
115 DeepSeek-V3.1-Terminus (reasoning on)DeepSeek · best of 2 settings
1,417
1,407–1,427
$0.27 / $1
115 DeepSeek-V3.1DeepSeek · best of 2 settings
1,417
1,411–1,423
$0.55 / $1.65
117 Qwen3.5-122B-A10BAlibaba
1,416
1,412–1,420
$0.26 / $2.08
118 MiniMax-M2.7MiniMax
1,415
1,412–1,418
$0.30 / $1.20
118 GPT-4.1OpenAI
1,415
1,411–1,418
$2 / $8
120 Mistral Large 3Mistral AI
1,414
1,411–1,417
$0.50 / $1.50
120 Claude Haiku 4.5Anthropic
1,414
1,411–1,416
$1 / $5
122 Qwen3-VL-235B-A22B-InstructAlibaba
1,413
1,407–1,420
$0.30 / $1.50
122 Nova Experimental Chat (2026-01-10)Amazon
1,413
1,403–1,423
–
124 Grok 3 Preview (02-24)xAI
1,411
1,407–1,416
–
124 GLM-4.5Z.ai
1,411
1,406–1,416
$0.60 / $2.20
124 Grok 4 (0709)xAI
1,411
1,407–1,415
–
127 Gemini 2.5 FlashGoogle
1,409
1,407–1,412
$0.30 / $2.50
127 Hy3 PreviewTencent
1,409
1,401–1,416
$0.18 / $0.60
127 Qwen3.5-27BAlibaba
1,409
1,404–1,413
$0.27 / $2.16
130 Mistral Medium 3.1Mistral AI
1,408
1,405–1,411
$0.40 / $2
131 Inkling SmallThinking Machines
1,405
1,400–1,410
$0.45 / $1.20
131 Grok 4 Fast (reasoning)xAI
1,405
1,400–1,410
–
133 Gemini 2.5 Flash Preview (09-2025)Google
1,403
1,399–1,407
–
133 Qwen3-235B-A22B (no reasoning)Alibaba · best of 2 settings
1,403
1,398–1,407
$0.46 / $1.82
135 o1OpenAI
1,402
1,398–1,407
$15 / $60
135 Claude Sonnet 4 (32k reasoning budget)Anthropic · best of 2 settings
1,402
1,397–1,406
$3 / $15
137 GPT-5.4 nano (high reasoning)OpenAI
1,401
1,398–1,405
$0.20 / $1.25
137 LongCat-Flash-ChatMeituan
1,401
1,395–1,408
–
139 Qwen3-235B-A22B-Thinking-2507Alibaba
1,400
1,393–1,407
$0.30 / $3
140 Qwen3-Next-80B-A3B-InstructAlibaba
1,399
1,394–1,404
$0.10 / $1.10
141 DeepSeek-R1DeepSeek
1,398
1,393–1,403
$0.70 / $2.50
142 Qwen3.5-FlashAlibaba
1,396
1,392–1,400
$0.065 / $0.26
142 DeepSeek-V3-0324DeepSeek
1,396
1,392–1,400
$0.25 / $1
144 Qwen3-VL-235B-A22B-ThinkingAlibaba
1,395
1,388–1,402
$0.40 / $4
144 Hunyuan Vision 1.5 ThinkingTencent
1,395
1,382–1,407
–
146 Nova Experimental Chat (12-10)Amazon
1,394
1,384–1,403
–
146 Qwen3.5-35B-A3BAlibaba
1,394
1,390–1,398
$0.16 / $1.30
148 Step 3.5 FlashStepFun
1,393
1,390–1,397
$0.10 / $0.30
149 MiMo-V2-Flash (no reasoning)Xiaomi · best of 2 settings
1,392
1,388–1,395
–
150 MiniMax-M2.5MiniMax
1,391
1,387–1,395
$0.30 / $1.20
150 o4-miniOpenAI
1,391
1,387–1,395
$1.10 / $4.40
152 GPT-5 mini (high reasoning)OpenAI
1,390
1,385–1,394
$0.25 / $2
153 o1-previewOpenAI
1,389
1,384–1,394
–
154 Claude 3.7 Sonnet (32k reasoning budget)Anthropic · best of 2 settings
1,388
1,384–1,393
–
154 Mistral Medium 3Mistral AI
1,388
1,383–1,392
$0.40 / $2
156 Qwen3-Coder-480B-A35BAlibaba
1,387
1,382–1,392
$0.35 / $1.50
156 Hunyuan T1 (2025-07-11)Tencent
1,387
1,378–1,396
–
158 Solar Pro 4Upstage
1,386
1,380–1,392
$0.09 / $0.36
159 MiniMax-M2.1 PreviewMiniMax
1,385
1,379–1,390
–
160 GPT-4.1 miniOpenAI
1,383
1,378–1,387
$0.40 / $1.60
160 Hunyuan TurboS (2025-04-16)Tencent
1,383
1,376–1,389
–
160 Qwen3-30B-A3B-Instruct-2507Alibaba
1,383
1,378–1,388
$0.09 / $0.30
163 Gemini 2.5 Flash-Lite Preview (09-2025, no reasoning)Google
1,379
1,376–1,383
–
163 GLM-4.6VZ.ai
1,379
1,367–1,390
$0.30 / $0.90
163 Trinity Large PreviewArcee AI
1,379
1,374–1,383
–
166 Gemini 2.5 Flash-Lite Preview (06-17, reasoning on)Google
1,375
1,370–1,379
–
167 Claude 3.5 Sonnet (2024-10-22)Anthropic
1,374
1,371–1,377
–
167 Qwen2.5-MaxAlibaba
1,374
1,370–1,378
–
169 GLM-4.5-AirZ.ai
1,373
1,369–1,378
$0.14 / $0.86
170 Qwen3-Next-80B-A3B-ThinkingAlibaba
1,369
1,363–1,375
$0.15 / $1.20
171 Trinity Large ThinkingArcee AI
1,367
1,363–1,372
$0.25 / $0.80
172 Gemma 3 27BGoogle
1,365
1,362–1,369
$0.12 / $0.20
172 GLM-4.7-FlashZ.ai
1,365
1,359–1,371
$0.06 / $0.40
174 Nova Experimental Chat (11-10)Amazon
1,364
1,360–1,369
–
174 MiniMax-M1MiniMax
1,364
1,360–1,368
$0.40 / $2.20
174 o3-mini (high reasoning)OpenAI · best of 2 settings
1,364
1,358–1,369
$1.10 / $4.40
177 Grok 3 Mini (high reasoning)xAI
1,363
1,358–1,369
–
178 Nemotron 3 Super 120B A12BNVIDIA
1,360
1,353–1,368
$0.085 / $0.40
178 Gemini 2.0 Flash (001)Google
1,360
1,356–1,364
–
180 DeepSeek-V3DeepSeek
1,358
1,354–1,363
$0.26 / $1.03
180 Grok 3 Mini BetaxAI
1,358
1,353–1,363
–
182 Mistral Small 3.2 24BMistral AI
1,356
1,351–1,362
$0.094 / $0.25
182 INTELLECT-3Prime Intellect
1,356
1,348–1,364
–
184 Command ACohere
1,354
1,350–1,357
$2.50 / $10
184 Gemini 2.0 Flash-Lite Preview (02-05)Google
1,354
1,349–1,358
–
186 GLM-4.5VZ.ai
1,352
1,344–1,361
$0.60 / $1.80
186 gpt-oss-120bOpenAI
1,352
1,347–1,356
$0.15 / $0.60
188 Gemini 1.5 Pro (002)Google
1,351
1,348–1,355
–
189 Nemotron 3.5 Lightning 30B A3B (NVFP4)NVIDIA
1,350
1,343–1,356
–
190 Step 3StepFun
1,349
1,342–1,357
–
190 Hunyuan TurboS (2025-02-26)Tencent
1,349
1,337–1,361
–
192 Nova Experimental Chat (10-20)Amazon
1,348
1,342–1,354
–
192 Llama 3.1 Nemotron Ultra 253B v1NVIDIA
1,348
1,336–1,359
–
194 Nova Experimental Chat (10-09)Amazon
1,347
1,336–1,358
–
194 Qwen3-32BAlibaba
1,347
1,337–1,356
$0.14 / $0.40
196 GPT-4o (2024-05-13)OpenAI
1,346
1,343–1,350
$5 / $15
196 Qwen-PlusAlibaba
1,346
1,338–1,354
$0.26 / $0.78
198 Ling-flash-2.0Ant Group
1,344
1,336–1,351
–
199 MiniMax-M2MiniMax
1,343
1,336–1,351
$0.30 / $1.20
199 Mercury 2Inception
1,343
1,333–1,354
$0.25 / $0.75
199 Claude 3.5 Sonnet (2024-06-20)Anthropic
1,343
1,340–1,347
–
199 Llama 3.3 Nemotron Super 49B v1.5NVIDIA
1,343
1,333–1,353
–
199 GLM-4-Plus (0111)Z.ai
1,343
1,334–1,351
–
204 Gemma 3 12BGoogle
1,342
1,332–1,351
$0.05 / $0.15
205 Hunyuan Turbo (0110)Tencent
1,341
1,329–1,352
–
206 Granite 4.2 30BIBM
1,340
1,329–1,350
–
207 GPT-5 nano (high reasoning)OpenAI
1,338
1,331–1,344
$0.05 / $0.40
208 o1-miniOpenAI
1,337
1,333–1,340
–
209 Gemini Advanced (0514)Google
1,336
1,331–1,341
–
209 QwQ-32BAlibaba
1,336
1,331–1,340
–
209 Grok 2 (2024-08-13)xAI
1,336
1,332–1,339
–
209 GPT-4o (2024-08-06)OpenAI
1,336
1,331–1,340
$2.50 / $10
213 Llama 3.1 405B Instruct (BF16)Meta
1,335
1,332–1,339
–
213 Nova 2 LiteAmazon
1,335
1,329–1,341
$0.30 / $2.50
215 Step-2 16K Exp (2024-12)StepFun
1,334
1,325–1,342
–
215 Llama 3.1 405B Instruct (FP8)Meta
1,334
1,330–1,337
–
217 Olmo 3.1 32B InstructAi2
1,329
1,323–1,335
–
218 Yi-Lightning01.AI
1,328
1,323–1,333
–
218 Llama 3.3 Nemotron Super 49B v1NVIDIA
1,328
1,316–1,340
–
220 Llama 4 MaverickMeta
1,327
1,323–1,331
$0.27 / $0.85
221 Qwen3-30B-A3BAlibaba
1,326
1,322–1,331
$0.12 / $0.50
221 Hunyuan Large (2025-02-10)Tencent
1,326
1,317–1,336
–
223 Claude 3.5 HaikuAnthropic
1,325
1,321–1,328
–
224 GPT-4 TurboOpenAI
1,324
1,321–1,328
$10 / $30
224 Gemini 1.5 Pro (001)Google
1,324
1,320–1,328
–
226 DeepSeek-V2.5-1210DeepSeek
1,323
1,315–1,332
–
226 Ring-flash-2.0Ant Group
1,323
1,315–1,330
–
228 GPT-4.1 nanoOpenAI
1,322
1,315–1,330
$0.10 / $0.40
228 Claude 3 OpusAnthropic
1,322
1,319–1,325
–
228 Molmo 2 8BAi2
1,322
1,301–1,343
–
228 Llama 4 ScoutMeta
1,322
1,317–1,326
$0.18 / $0.59
232 Step-1o Turbo (2025-06)StepFun
1,320
1,313–1,327
–
233 GLM-4-PlusZ.ai
1,319
1,314–1,324
–
234 Qwen-Max (0919)Alibaba
1,318
1,312–1,324
–
234 Llama 3.3 70B InstructMeta
1,318
1,314–1,321
$0.59 / $0.79
234 GPT-4o mini (2024-07-18)OpenAI
1,318
1,314–1,321
$0.15 / $0.60
234 gpt-oss-20bOpenAI
1,318
1,311–1,324
$0.03 / $0.15
238 Gemma 3n E4BGoogle
1,317
1,312–1,323
–
239 Qwen2.5-Plus (1127)Alibaba
1,315
1,308–1,321
–
240 Mistral Large 2 (2407)Mistral AI
1,314
1,310–1,318
$2 / $6
240 Athene-V2-ChatNexusflow
1,314
1,310–1,319
–
240 Nemotron 3 Nano 30B A3BNVIDIA
1,314
1,308–1,319
$0.05 / $0.20
243 GPT-4 Turbo Preview (0125)OpenAI
1,313
1,309–1,317
–
243 GPT-4 Turbo Preview (1106)OpenAI
1,313
1,309–1,317
–
245 Hunyuan Standard (2025-02-10)Tencent
1,311
1,302–1,321
–
246 Gemini 1.5 Flash (002)Google
1,309
1,305–1,313
–
247 Grok 2 Mini (2024-08-13)xAI
1,308
1,305–1,312
–
248 DeepSeek-V2.5DeepSeek
1,307
1,302–1,312
–
248 Athene 70B (0725)Nexusflow
1,307
1,301–1,312
–
250 Olmo 3 32B ThinkAi2
1,306
1,298–1,315
–
250 Mistral Large 2.1 (2411)Mistral AI
1,306
1,301–1,310
–
252 MercuryInception
1,305
1,291–1,319
–
252 Magistral Medium 1.0Mistral AI
1,305
1,298–1,311
–
254 Granite 4.1 8BIBM
1,304
1,294–1,314
–
255 Gemma 3 4BGoogle
1,303
1,294–1,313
$0.05 / $0.10
255 Mistral Small 3.1 24BMistral AI
1,303
1,299–1,308
$0.35 / $0.56
255 Qwen2.5-72B-InstructAlibaba
1,303
1,299–1,307
$0.36 / $0.40
258 Llama 3.1 Nemotron 70B InstructNVIDIA
1,299
1,291–1,306
–
259 Hunyuan Large VisionTencent
1,294
1,285–1,303
–
260 Llama 3.1 70B InstructMeta
1,293
1,290–1,297
$0.40 / $0.40
261 Nova Pro 1.0Amazon
1,290
1,286–1,295
$0.80 / $3.20
261 Granite 4.2 3BIBM
1,290
1,278–1,301
–
263 Gemma 2 27BGoogle
1,289
1,286–1,293
$0.65 / $0.65
263 Jamba 1.5 LargeAI21 Labs
1,289
1,282–1,297
–
265 Granite 4.2 8BIBM
1,288
1,277–1,299
$0.06 / $0.25
265 Reka Core (2024-09-04)Reka AI
1,288
1,281–1,295
–
265 GPT-4 (0314)OpenAI
1,288
1,283–1,293
–
268 Granite H SmallIBM
1,287
1,279–1,295
–
268 Llama 3.1 Nemotron 51B InstructNVIDIA
1,287
1,277–1,297
–
270 Gemini 1.5 Flash (001)Google
1,286
1,282–1,291
–
270 Olmo 3.1 32B ThinkAi2
1,286
1,279–1,294
–
270 Llama 3.1 Tülu 3 70BAi2
1,286
1,276–1,297
–
273 Claude 3 SonnetAnthropic
1,281
1,277–1,285
–
274 Gemma 2 9B SimPOPrinceton NLP
1,280
1,273–1,287
–
275 Nemotron-4 340B InstructNVIDIA
1,277
1,272–1,282
–
275 Llama 3 70B InstructMeta
1,277
1,273–1,280
–
277 Command R+ (08-2024)Cohere
1,276
1,270–1,283
$2.50 / $10
277 GPT-4 (0613)OpenAI
1,276
1,272–1,280
–
279 Mistral Small 3Mistral AI
1,274
1,268–1,280
$0.05 / $0.08
280 GLM-4 (0520)Z.ai
1,273
1,266–1,280
–
281 Reka Flash (2024-09-04)Reka AI
1,272
1,265–1,279
–
282 Qwen2.5-Coder-32B-InstructAlibaba
1,271
1,262–1,279
$0.66 / $1
283 Aya Expanse 32BCohere
1,267
1,262–1,272
–
283 Gemma 2 9BGoogle
1,267
1,263–1,271
–
285 DeepSeek-Coder-V2DeepSeek
1,265
1,259–1,272
–
286 Qwen2-72B-InstructAlibaba
1,262
1,257–1,267
–
286 Command R+Cohere
1,262
1,257–1,266
–
286 Claude 3 HaikuAnthropic
1,262
1,258–1,265
–
289 Nova Lite 1.0Amazon
1,260
1,255–1,266
$0.06 / $0.24
290 Gemini 1.5 Flash-8B (001)Google
1,259
1,254–1,263
–
291 Phi-4Microsoft
1,256
1,252–1,261
$0.07 / $0.14
292 OLMo 2 32B Instruct (0325)Ai2
1,252
1,241–1,262
–
293 Command R (08-2024)Cohere
1,250
1,244–1,257
$0.15 / $0.60
294 Mistral Large (2402)Mistral AI
1,242
1,238–1,247
–
295 Nova Micro 1.0Amazon
1,241
1,236–1,246
$0.035 / $0.14
296 Jamba 1.5 MiniAI21 Labs
1,240
1,233–1,247
–
297 Ministral 8B (2410)Mistral AI
1,238
1,228–1,247
–
298 Gemini Pro (Dev API)Google
1,237
1,229–1,244
–
299 Qwen1.5-110B-ChatAlibaba
1,234
1,229–1,240
–
300 Reka Flash 21B (2024-02-26, online)Reka AI
1,233
1,226–1,241
–
300 Qwen1.5-72B-ChatAlibaba
1,233
1,228–1,239
–
300 Hunyuan Standard 256KTencent
1,233
1,221–1,245
–
303 Mixtral 8x22B InstructMistral AI
1,230
1,225–1,234
$2 / $6
304 Command RCohere
1,227
1,222–1,232
–
304 Reka Flash 21B (2024-02-26)Reka AI
1,227
1,221–1,233
–
306 GPT-3.5 Turbo (0125)OpenAI
1,226
1,221–1,230
–
307 Llama 3 8B InstructMeta
1,224
1,220–1,227
–
307 Gemini ProGoogle
1,224
1,212–1,235
–
309 Aya Expanse 8BCohere
1,223
1,216–1,230
–
309 Mistral MediumMistral AI
1,223
1,217–1,228
–
311 Llama 3.1 Tülu 3 8BAi2
1,220
1,210–1,231
–
312 Zephyr ORPO 141B A35B v0.1Hugging Face
1,213
1,202–1,224
–
312 Yi-1.5-34B-Chat01.AI
1,213
1,208–1,218
–
314 Llama 3.1 8B InstructMeta
1,211
1,207–1,215
$0.05 / $0.08
315 Granite 3.1 8B InstructIBM
1,208
1,197–1,220
–
316 GPT-3.5 Turbo (1106)OpenAI
1,204
1,195–1,213
–
316 Qwen1.5-32B-ChatAlibaba
1,204
1,198–1,210
–
318 Gemma 2 2BGoogle
1,200
1,196–1,204
–
319 Phi-3-medium-4k-instructMicrosoft
1,198
1,193–1,203
–
320 Mixtral 8x7B Instruct v0.1Mistral AI
1,197
1,193–1,201
–
321 DBRX Instruct PreviewDatabricks
1,195
1,189–1,202
–
322 Qwen1.5-14B-ChatAlibaba
1,191
1,184–1,198
–
322 InternLM2.5 20B ChatShanghai AI Lab
1,191
1,184–1,198
–
324 DeepSeek LLM 67B ChatDeepSeek
1,185
1,173–1,196
–
324 WizardLM 70BMicrosoft
1,185
1,175–1,194
–
326 Yi-34B-Chat01.AI
1,184
1,177–1,191
–
327 Granite 3.0 8B InstructIBM
1,183
1,174–1,192
–
327 OpenChat 3.5OpenChat
1,183
1,173–1,193
–
327 OpenChat 3.5 (0106)OpenChat
1,183
1,175–1,191
–
327 Gemma 1.1 7BGoogle
1,183
1,176–1,189
–
331 Snowflake Arctic InstructSnowflake
1,180
1,174–1,186
–
332 Granite 3.1 2B InstructIBM
1,179
1,168–1,190
–
333 Tülu 2 DPO 70BAi2
1,178
1,168–1,187
–
334 OpenHermes 2.5 Mistral 7BTeknium
1,176
1,166–1,186
–
335 Vicuna 33BLMSYS
1,173
1,167–1,179
–
336 Phi-3-small-8k-instructMicrosoft
1,171
1,165–1,177
–
336 Starling-LM-7B-betaNexusflow
1,171
1,164–1,178
–
336 Llama 2 70B ChatMeta
1,171
1,165–1,176
–
339 Starling-LM-7B-alphaUC Berkeley
1,167
1,159–1,175
–
339 Llama 3.2 3B InstructMeta
1,167
1,159–1,174
$0.05 / $0.33
341 Nous Hermes 2 Mixtral 8x7B DPONous Research
1,164
1,152–1,176
–
342 Granite 3.0 2B InstructIBM
1,157
1,148–1,165
–
343 Llama 2 70B SteerLM ChatNVIDIA
1,155
1,142–1,167
–
344 QwQ-32B-PreviewAlibaba
1,154
1,143–1,166
–
345 Solar 10.7B Instruct v1.0Upstage
1,152
1,139–1,166
–
345 Dolphin 2.2.1 Mistral 7BCognitive Computations
1,152
1,137–1,167
–
347 MPT-30B-ChatMosaicML
1,151
1,138–1,163
–
348 WizardLM 13BMicrosoft
1,149
1,140–1,159
–
348 Mistral 7B Instruct v0.2Mistral AI
1,149
1,143–1,156
–
350 Falcon 180B ChatTII
1,148
1,131–1,165
–
351 Qwen1.5-7B-ChatAlibaba
1,144
1,134–1,154
–
352 Phi-3-mini-4k-instruct (June 2024)Microsoft
1,143
1,137–1,150
–
353 Vicuna 13BLMSYS
1,142
1,135–1,148
–
354 Llama 2 13B ChatMeta
1,141
1,135–1,148
–
355 Qwen-14B-ChatAlibaba
1,139
1,128–1,150
–
355 PaLM 2Google
1,139
1,130–1,148
–
357 Gemma 7BGoogle
1,138
1,128–1,147
–
358 Code Llama 34B InstructMeta
1,137
1,128–1,146
–
359 Zephyr 7B BetaHugging Face
1,131
1,122–1,140
–
360 Phi-3-mini-128k-instructMicrosoft
1,130
1,122–1,137
–
361 Phi-3-mini-4k-instructMicrosoft
1,128
1,122–1,134
–
362 Guanaco 33BTim Dettmers
1,127
1,115–1,139
–
362 Zephyr 7B AlphaHugging Face
1,127
1,111–1,142
–
364 StripedHyena Nous 7BTogether AI
1,122
1,111–1,133
–
365 Code Llama 70B InstructMeta
1,119
1,101–1,137
–
366 Gemma 1.1 2BGoogle
1,117
1,109–1,124
–
367 Vicuna 7BLMSYS
1,115
1,106–1,124
–
367 SmolLM2 1.7B InstructHugging Face
1,115
1,100–1,129
–
369 Llama 3.2 1B InstructMeta
1,111
1,103–1,119
$0.027 / $0.20
370 Mistral 7B InstructMistral AI
1,110
1,101–1,120
–
371 Llama 2 7B ChatMeta
1,108
1,101–1,115
–
372 Gemma 2BGoogle
1,094
1,082–1,105
–
373 Qwen1.5-4B-ChatAlibaba
1,091
1,082–1,100
–
374 OLMo 7B InstructAi2
1,074
1,062–1,085
–
375 Koala 13BUC Berkeley
1,071
1,061–1,081
–
376 Alpaca 13BStanford
1,070
1,059–1,082
–
377 GPT4All 13B SnoozyNomic AI
1,068
1,052–1,083
–
378 MPT-7B-ChatMosaicML
1,063
1,051–1,075
–
379 ChatGLM3-6BZ.ai
1,057
1,045–1,068
–
380 RWKV-4 Raven 14BRWKV
1,042
1,031–1,054
–
381 ChatGLM2-6BZ.ai
1,025
1,011–1,038
–
382 OpenAssistant Pythia 12BOpenAssistant
1,023
1,013–1,034
–
383 ChatGLM-6BZ.ai
996
983–1,008
–
384 FastChat-T5 3BLMSYS
992
980–1,005
–
385 Dolly v2 12BDatabricks
982
969–996
–
386 LLaMA 13BMeta
975
959–991
–
387 StableLM Tuned Alpha 7BStability AI
953
941–966
–

Swipe the table sideways for more columns.

Ranks follow the score as shown, so equal numbers share a rank. Where two models' ranges overlap, the gap between them may not be real. Each model is shown at its best setting; show every setting. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Head-to-head human preference across all text prompts.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.