Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on prompts Arena classes as expert-level.

Results dated
25 Sep 2026
Models
359
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International
Arena Text: expert prompts, Arena rating, higher is better
#ModelArena Text: expert prompts · 95% range
Arena rating, higher is better
1 Claude Opus 5.5Anthropic · Claude Opus 5.5 (high)
1,556
1,522–1,591
1 Claude Fable 5Anthropic · Claude Fable 5 (high)
1,550
1,540–1,560
1 Claude Opus 4.6Anthropic · Claude Opus 4.6 (high)
1,547
1,539–1,555
1 Claude Opus 5Anthropic · Claude Opus 5 (high)
1,543
1,534–1,551
1 MiMo-V2.6-ProXiaomi
1,535
1,508–1,563
1 Claude Opus 4.7Anthropic
1,535
1,527–1,543
1 Claude Opus 4.7Anthropic · Claude Opus 4.7 (high)
1,534
1,526–1,542
1 GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh)
1,534
1,524–1,544
1 Claude Opus 4.6Anthropic
1,533
1,526–1,541
1 Kimi K3Moonshot AI · Kimi K3 (max)
1,533
1,521–1,545
1 Gemini 3.8 FlashGoogle · Gemini 3.8 Flash (high)
1,529
1,517–1,541
1 Muse Spark 1.3Meta · Muse Spark 1.3 (max)
1,527
1,510–1,544
2 Claude Opus 5Anthropic · Claude Opus 5 (max)
1,527
1,516–1,539
3 DeepSeek V4.1 FlashDeepSeek · DeepSeek V4.1 Flash (max)
1,518
1,497–1,538
3 Claude Fable 5.1Anthropic · Claude Fable 5.1 (max)
1,516
1,495–1,536
3 MiMo-V2.6-FlashXiaomi
1,510
1,483–1,538
3 qwen3.7-max-previewAlibaba
1,506
1,475–1,537
4 Claude Opus 4.8Anthropic · Claude Opus 4.8 (high)
1,525
1,517–1,533
4 GLM 5.3Z.ai · GLM 5.3 (max)
1,516
1,501–1,531
4 GPT-6 AstraOpenAI · GPT-6 Astra (max)
1,510
1,488–1,532
4 GPT-6 SolOpenAI · GPT-6 Sol (max)
1,507
1,482–1,531
4 GPT-6 LunaOpenAI · GPT-6 Luna (max)
1,505
1,480–1,529
4 Muse Spark 1.2Meta
1,502
1,472–1,531
7 Gemini 3.7 FlashGoogle · Gemini 3.7 Flash (high)
1,512
1,499–1,524
7 amazon-nova-experimental-chat-26-02-10Amazon
1,494
1,462–1,525
8 Claude Opus 4.8Anthropic
1,515
1,507–1,523
8 GPT-5.4OpenAI · GPT-5.4 (high)
1,515
1,506–1,523
8 GLM 5.3 FlashZ.ai
1,510
1,497–1,524
8 Qwen3.8 Max (0902)Alibaba
1,510
1,498–1,522
8 Gemma 4 31BGoogle
1,499
1,474–1,523
8 Qwen3.6 Max PreviewAlibaba
1,499
1,474–1,523
9 Claude Sonnet 5Anthropic · Claude Sonnet 5 (high)
1,512
1,503–1,521
10 GPT-5.5OpenAI · GPT-5.5 (high)
1,513
1,505–1,520
10 GPT-5.5OpenAI
1,511
1,503–1,519
12 Gemini 3.1 Pro PreviewGoogle
1,509
1,503–1,516
13 Claude Sonnet 4.6Anthropic
1,506
1,498–1,514
13 MiMo-V2.5-ProXiaomi
1,506
1,498–1,514
13 Muse Spark 1.1Meta
1,504
1,495–1,514
13 GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh)
1,504
1,494–1,514
13 Claude Opus 4.5Anthropic
1,503
1,491–1,515
13 Kimi K2.6Moonshot AI
1,503
1,493–1,513
13 Claude Opus 4.5Anthropic
1,503
1,494–1,511
13 qwen3.5-max-previewAlibaba
1,499
1,486–1,512
14 GLM 5.2Z.ai · GLM 5.2 (max)
1,500
1,491–1,509
14 Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high)
1,500
1,490–1,510
14 gemini-3-proGoogle
1,498
1,487–1,510
14 gemini-3-flashGoogle
1,496
1,484–1,509
14 Hy3Tencent
1,490
1,472–1,508
15 muse-sparkMeta
1,491
1,475–1,508
17 Claude Sonnet 4.5Anthropic
1,498
1,490–1,506
17 mimo-v2-proXiaomi
1,493
1,480–1,506
17 amazon-nova-experimental-chat-26-01-10Amazon
1,472
1,438–1,506
18 ernie-5.1Baidu
1,494
1,484–1,504
19 GLM 5.1Z.ai
1,495
1,487–1,503
20 DeepSeek V4 Pro 0813DeepSeek
1,485
1,466–1,503
21 gpt-5.2-chat-latest-20260210OpenAI
1,491
1,480–1,502
21 Grok 4.6xAI · Grok 4.6 (high)
1,490
1,477–1,502
22 GPT-5.4OpenAI
1,492
1,484–1,500
22 GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh)
1,491
1,481–1,501
22 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high)
1,491
1,482–1,500
22 Gemma 4 26B A4BGoogle
1,475
1,450–1,501
26 Grok 4.5xAI
1,488
1,479–1,498
28 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium)
1,487
1,478–1,496
31 Qwen3 235B A22B Thinking 2507Alibaba
1,466
1,437–1,494
32 Qwen3.7 PlusAlibaba
1,485
1,476–1,494
32 Claude Opus 4.1Anthropic
1,482
1,470–1,494
32 GPT-5.1OpenAI · GPT-5.1 (high)
1,482
1,470–1,494
33 GLM 5Z.ai
1,481
1,469–1,493
33 Qwen3.8 27BAlibaba
1,477
1,463–1,491
35 Claude Sonnet 4.5Anthropic
1,483
1,475–1,491
35 Kimi K2.5Moonshot AI
1,483
1,475–1,490
37 GPT-5.4 MiniOpenAI · GPT-5.4 Mini (high)
1,480
1,472–1,488
37 grok-4.20-multi-agent-beta-0309xAI
1,480
1,472–1,488
37 DeepSeek V4 Pro 0423DeepSeek
1,480
1,471–1,488
37 grok-4.20-beta1xAI
1,476
1,463–1,488
41 grok-4.20-beta-0309-reasoningxAI
1,478
1,470–1,486
41 dola-seed-2.0-proBytedance
1,478
1,470–1,485
41 Qwen3.6 PlusAlibaba
1,476
1,467–1,485
41 deepseek-v4-pro-previewDeepSeek
1,475
1,467–1,484
41 GPT-5.2OpenAI · GPT-5.2 (high)
1,475
1,465–1,485
41 gpt-5.5-instantOpenAI
1,473
1,461–1,486
42 InklingThinkingmachines
1,474
1,464–1,484
44 nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA
1,467
1,450–1,484
45 Qwen3.5 397B A17BAlibaba
1,476
1,469–1,483
47 gpt-5.3-chat-latestOpenAI
1,471
1,459–1,482
47 Grok 4.7xAI · Grok 4.7 (xhigh)
1,454
1,426–1,482
49 qwen3-max-previewAlibaba
1,464
1,448–1,480
51 MiniMax M3MiniMax
1,471
1,462–1,479
51 MiMo-V2.5Xiaomi
1,470
1,461–1,480
51 longcat-flash-chat-2602-expMeituan
1,468
1,456–1,479
51 GLM 5V TurboZ.ai
1,462
1,445–1,479
53 DeepSeek V3.2 ExpDeepSeek
1,449
1,420–1,478
54 Gemini 3.5 Flash LiteGoogle
1,467
1,457–1,477
56 Claude Opus 4.1Anthropic
1,466
1,457–1,475
57 deepseek-v4-flash-previewDeepSeek
1,466
1,457–1,475
59 grok-4.1-thinkingxAI
1,466
1,457–1,475
59 mimo-v2-omniXiaomi
1,461
1,448–1,474
59 GPT-5OpenAI · GPT-5 (high)
1,460
1,444–1,475
60 Kimi K2.5Moonshot AI
1,451
1,428–1,474
61 ernie-5.0-preview-1203Baidu
1,451
1,429–1,472
66 gemini-3-flashGoogle
1,463
1,456–1,470
67 muse-glimmerMeta
1,442
1,414–1,470
70 kimi-k2-thinking-turboMoonshot AI
1,460
1,452–1,469
70 GLM 4.7Z.ai
1,449
1,429–1,469
72 Hy3 previewTencent
1,446
1,424–1,468
72 Qwen3 VL 235B A22B ThinkingAlibaba
1,439
1,409–1,468
73 GPT-5.2OpenAI
1,459
1,452–1,467
75 DeepSeek V4 Flash 0423DeepSeek
1,457
1,448–1,466
75 GPT-5.1OpenAI
1,455
1,444–1,466
75 ernie-5.0-preview-1022Baidu
1,432
1,399–1,466
76 Gemini 2.5 ProGoogle
1,458
1,451–1,465
76 Qwen3 VL 235B A22B InstructAlibaba
1,440
1,416–1,465
77 DeepSeek V3.2DeepSeek
1,453
1,442–1,464
79 claude-opus-4Anthropic
1,448
1,434–1,462
81 GLM 4.5Z.ai
1,444
1,427–1,461
82 grok-4.1xAI
1,452
1,444–1,461
83 Grok 4.3xAI
1,452
1,444–1,460
83 MiniMax M2.7MiniMax
1,452
1,445–1,460
83 o3OpenAI
1,449
1,437–1,460
84 Claude Haiku 4.5Anthropic
1,452
1,446–1,458
84 DeepSeek V3.2DeepSeek
1,448
1,438–1,458
84 ernie-5.0-0110Baidu
1,447
1,436–1,458
84 gpt-5-chatOpenAI
1,443
1,428–1,458
86 DeepSeek V3.1DeepSeek
1,432
1,407–1,457
89 Inkling SmallThinkingmachines
1,445
1,433–1,456
90 Qwen3 235B A22B Instruct 2507Alibaba
1,448
1,440–1,455
90 Qwen3.5-122B-A10BAlibaba
1,442
1,430–1,453
90 Qwen3.5-27BAlibaba
1,441
1,429–1,453
90 gpt-4.5-preview-2025-02-27OpenAI
1,429
1,405–1,453
90 longcat-flash-chatMeituan
1,428
1,402–1,454
91 GLM 4.6Z.ai
1,439
1,426–1,452
92 Gemini 3.1 Flash Lite PreviewGoogle
1,443
1,435–1,451
93 Mistral Medium 3.5Mistral
1,434
1,416–1,451
93 grok-4-fast-chatxAI
1,416
1,382–1,451
98 grok-4-1-fast-reasoningxAI
1,438
1,429–1,447
98 GPT-5.4 NanoOpenAI · GPT-5.4 Nano (high)
1,438
1,429–1,446
98 claude-opus-4Anthropic
1,434
1,421–1,446
98 Claude Sonnet 4Anthropic
1,433
1,418–1,447
98 Solar Pro 4Upstage
1,433
1,418–1,448
98 DeepSeek V3.1DeepSeek
1,426
1,404–1,448
98 DeepSeek V3.2 ExpDeepSeek
1,425
1,402–1,447
99 gemini-2.5-flash-preview-09-2025Google
1,432
1,418–1,446
99 hunyuan-t1-20250711Tencent
1,407
1,369–1,445
100 grok-4-0709xAI
1,431
1,418–1,445
102 Qwen3 MaxAlibaba
1,418
1,392–1,444
106 grok-4-fast-reasoningxAI
1,421
1,402–1,441
106 Kimi K2 0905Moonshot AI
1,417
1,393–1,441
106 GLM 4.5VZ.ai
1,399
1,358–1,441
107 chatgpt-4o-latest-20250326OpenAI
1,429
1,420–1,438
107 minimax-m2.1-previewMiniMax
1,421
1,404–1,438
107 R1 0528DeepSeek
1,418
1,399–1,438
109 Step 3.5 FlashStepfun
1,429
1,420–1,438
111 GLM 4.6VZ.ai
1,394
1,352–1,437
112 Mistral Large 3 2512Mistral
1,428
1,420–1,435
112 mimo-v2-flashXiaomi
1,414
1,394–1,435
112 Qwen3 32BAlibaba
1,398
1,361–1,435
113 MiniMax M2.5MiniMax
1,425
1,414–1,435
115 Gemini 2.5 FlashGoogle
1,424
1,417–1,431
115 Qwen3.5-35B-A3BAlibaba
1,420
1,408–1,431
115 Kimi K2 0711Moonshot AI
1,417
1,401–1,432
115 amazon-nova-experimental-chat-12-10Amazon
1,397
1,362–1,431
122 Qwen3.5-FlashAlibaba
1,420
1,411–1,428
123 granite-4.2-30bIBM
1,396
1,365–1,427
124 mimo-v2-flashXiaomi
1,417
1,407–1,426
126 claude-3-7-sonnet-20250219Anthropic
1,412
1,398–1,426
126 grok-3-minixAI
1,407
1,388–1,426
127 R1DeepSeek
1,402
1,382–1,422
130 o4 MiniOpenAI
1,408
1,395–1,420
132 amazon-nova-experimental-chat-11-10Amazon
1,405
1,391–1,419
132 grok-3-preview-02-24xAI
1,403
1,388–1,419
132 o1OpenAI
1,402
1,385–1,419
132 o3 Mini HighOpenAI
1,399
1,378–1,419
133 GPT-5 MiniOpenAI · GPT-5 Mini (high)
1,400
1,383–1,418
134 Mistral Medium 3.1Mistral
1,410
1,403–1,418
136 GPT-4.1OpenAI
1,405
1,394–1,417
136 Qwen3 Next 80B A3B InstructAlibaba
1,399
1,382–1,417
137 Qwen3 Next 80B A3B ThinkingAlibaba
1,394
1,371–1,417
139 trinity-large-previewArcee Ai
1,403
1,392–1,415
139 Claude Sonnet 4Anthropic
1,402
1,388–1,415
139 Nemotron 3 SuperNVIDIA
1,393
1,371–1,415
141 Trinity Large ThinkingArcee Ai
1,401
1,389–1,413
141 Qwen3 30B A3B Instruct 2507Alibaba
1,395
1,378–1,412
141 nvidia-llama-3.3-nemotron-super-49b-v1.5NVIDIA
1,371
1,330–1,413
142 DeepSeek V3 0324DeepSeek
1,398
1,386–1,411
143 Qwen3 235B A22BAlibaba
1,395
1,382–1,409
146 GLM 4.7 FlashZ.ai
1,386
1,367–1,406
147 GLM 4.5 AirZ.ai
1,390
1,374–1,405
147 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA
1,389
1,373–1,405
149 claude-3-7-sonnet-20250219Anthropic
1,390
1,377–1,404
149 Granite 4.2 8BIBM
1,369
1,335–1,403
153 Qwen3 235B A22BAlibaba
1,386
1,370–1,402
154 Qwen-PlusAlibaba
1,370
1,341–1,400
154 ring-flash-2.0Ant Group
1,367
1,335–1,399
155 step-3Stepfun
1,364
1,328–1,399
156 grok-3-mini-betaxAI
1,380
1,363–1,398
157 gemini-2.5-flash-lite-preview-09-2025Google
1,386
1,375–1,397
157 GPT-4.1 MiniOpenAI
1,384
1,370–1,397
157 o1-previewOpenAI
1,383
1,368–1,397
157 Qwen3 Coder 480B A35BAlibaba
1,379
1,363–1,396
161 Mistral Medium 3Mistral
1,379
1,365–1,393
163 ling-flash-2.0Ant Group
1,361
1,330–1,391
168 amazon-nova-experimental-chat-10-20Amazon
1,365
1,344–1,387
168 intellect-3Primeintellect
1,355
1,323–1,387
168 GPT-5 NanoOpenAI · GPT-5 Nano (high)
1,354
1,321–1,386
169 gemini-2.5-flash-lite-preview-06-17Google
1,371
1,356–1,386
170 Mercury 2Inception
1,348
1,312–1,384
171 MiniMax M2MiniMax
1,350
1,317–1,383
172 qwen2.5-maxAlibaba
1,368
1,354–1,382
175 claude-3-5-sonnet-20241022Anthropic
1,372
1,362–1,381
175 MiniMax M1MiniMax
1,366
1,351–1,380
177 o3 MiniOpenAI
1,366
1,355–1,377
177 qwq-32bAlibaba
1,361
1,344–1,378
179 Nova 2 LiteAmazon
1,354
1,333–1,374
180 gpt-oss-120bOpenAI
1,357
1,341–1,373
180 hunyuan-turbos-20250416Tencent
1,349
1,325–1,373
184 granite-4.1-8bIBM
1,338
1,307–1,370
185 gemini-2.0-flash-001Google
1,356
1,343–1,369
190 o1-miniOpenAI
1,352
1,340–1,363
190 DeepSeek V3DeepSeek
1,348
1,331–1,365
190 granite-4.2-3bIBM
1,328
1,292–1,364
194 olmo-3.1-32b-thinkAi2
1,336
1,310–1,361
195 Qwen3 30B A3BAlibaba
1,343
1,326–1,359
195 hunyuan-large-2025-02-10Tencent
1,323
1,287–1,359
196 step-2-16k-exp-202412Stepfun
1,326
1,295–1,357
197 Command ACohere
1,344
1,332–1,355
197 claude-3-5-sonnet-20240620Anthropic
1,344
1,332–1,355
198 Mistral Small 3.2 24BMistral
1,335
1,315–1,354
201 gemini-1.5-pro-002Google
1,339
1,328–1,350
201 Gemma 3 27BGoogle
1,337
1,325–1,350
201 gemini-2.0-flash-lite-preview-02-05Google
1,332
1,315–1,348
201 Nemotron 3 Nano 30B A3BNVIDIA
1,331
1,312–1,350
201 yi-lightning01 Ai
1,331
1,316–1,346
201 olmo-3.1-32b-instructAi2
1,325
1,303–1,348
201 ibm-granite-h-smallIBM
1,312
1,276–1,348
202 GPT-4.1 NanoOpenAI
1,313
1,283–1,344
204 qwen2.5-plus-1127Alibaba
1,322
1,300–1,343
204 gpt-oss-20bOpenAI
1,314
1,287–1,342
205 glm-4-plus-0111Z.ai
1,312
1,282–1,341
207 Llama 4 MaverickMeta
1,326
1,312–1,339
207 llama-3.1-405b-instruct-fp8Meta
1,325
1,313–1,336
207 olmo-3-32b-thinkAi2
1,303
1,268–1,339
210 deepseek-v2.5-1210DeepSeek
1,306
1,280–1,333
212 gemini-1.5-pro-001Google
1,320
1,308–1,332
213 hunyuan-large-visionTencent
1,297
1,264–1,331
215 hunyuan-standard-2025-02-10Tencent
1,290
1,251–1,329
217 claude-3-opus-20240229Anthropic
1,318
1,309–1,328
217 claude-3-5-haiku-20241022Anthropic
1,316
1,305–1,327
217 grok-2-2024-08-13xAI
1,316
1,305–1,327
218 llama-3.1-405b-instruct-bf16Meta
1,312
1,299–1,325
218 athene-v2-chatNexusflow
1,311
1,296–1,326
220 GPT-4o (2024-08-06)OpenAI
1,312
1,299–1,324
220 Llama 4 ScoutMeta
1,309
1,293–1,324
220 step-1o-turbo-202506Stepfun
1,297
1,270–1,324
220 llama-3.1-nemotron-70b-instructNVIDIA
1,296
1,269–1,323
221 GPT-4o (2024-05-13)OpenAI
1,311
1,301–1,322
222 glm-4-plusZ.ai
1,303
1,288–1,318
222 Mistral Small 3.1 24BMistral
1,302
1,287–1,318
222 athene-70b-0725Nexusflow
1,301
1,282–1,320
222 qwen-max-0919Alibaba
1,300
1,282–1,318
222 magistral-medium-2506Mistral
1,292
1,265–1,319
224 reka-core-20240904Rekaai
1,291
1,267–1,316
225 Gemma 3 12BGoogle
1,274
1,233–1,315
226 Mistral Large 2407Mistral
1,302
1,289–1,314
226 jamba-1.5-largeAI21 Labs
1,285
1,256–1,314
227 gemini-advanced-0514Google
1,299
1,284–1,313
230 deepseek-v2.5DeepSeek
1,296
1,281–1,311
231 Llama 3.3 70B InstructMeta
1,298
1,286–1,309
231 Qwen2.5 Coder 32B InstructAlibaba
1,277
1,244–1,309
232 GPT-4 TurboOpenAI
1,297
1,286–1,308
233 grok-2-mini-2024-08-13xAI
1,295
1,283–1,307
233 Qwen2.5 72B InstructAlibaba
1,295
1,283–1,307
237 gpt-4-1106-previewOpenAI
1,290
1,278–1,302
238 Gemma 3 4BGoogle
1,260
1,219–1,301
239 reka-flash-20240904Rekaai
1,277
1,254–1,300
241 gemini-1.5-flash-002Google
1,285
1,272–1,298
241 gemma-3n-e4b-itGoogle
1,279
1,261–1,298
242 GPT-4o-mini (2024-07-18)OpenAI
1,285
1,274–1,296
244 gpt-4-0125-previewOpenAI
1,280
1,268–1,292
245 Nova Pro 1.0Amazon
1,273
1,257–1,289
247 deepseek-coder-v2DeepSeek
1,267
1,245–1,288
248 Llama 3.1 70B InstructMeta
1,275
1,264–1,287
251 llama-3.1-nemotron-51b-instructNVIDIA
1,253
1,220–1,286
252 claude-3-sonnet-20240229Anthropic
1,273
1,261–1,285
252 mistral-large-2411Mistral
1,271
1,256–1,286
252 Phi 4Microsoft
1,268
1,251–1,286
260 gemini-1.5-flash-001Google
1,268
1,256–1,281
260 c4ai-aya-expanse-32bCohere
1,267
1,253–1,281
261 gpt-4-0314OpenAI
1,264
1,249–1,280
261 Nova Lite 1.0Amazon
1,262
1,245–1,279
261 nemotron-4-340b-instructNVIDIA
1,261
1,242–1,279
261 Mistral Small 3Mistral
1,259
1,238–1,280
262 glm-4-0520Z.ai
1,252
1,227–1,278
263 qwen2-72b-instructAlibaba
1,261
1,246–1,275
263 Command R+ (08-2024)Cohere
1,250
1,225–1,274
265 Gemma 2 27BGoogle
1,260
1,250–1,271
265 granite-3.1-8b-instructIBM
1,236
1,200–1,271
268 ministral-8b-2410Mistral
1,238
1,208–1,268
270 gpt-4-0613OpenAI
1,253
1,241–1,266
271 gemma-2-9b-it-simpoPrinceton Nlp
1,235
1,206–1,265
272 claude-3-haiku-20240307Anthropic
1,253
1,242–1,264
273 Nova Micro 1.0Amazon
1,244
1,227–1,261
277 llama-3-70b-instructMeta
1,245
1,234–1,256
277 c4ai-aya-expanse-8bCohere
1,232
1,209–1,256
278 gemini-1.5-flash-8b-001Google
1,243
1,230–1,256
279 command-r-plusCohere
1,242
1,229–1,254
280 Command R (08-2024)Cohere
1,231
1,209–1,253
280 granite-3.1-2b-instructIBM
1,218
1,183–1,254
283 qwen1.5-72b-chatAlibaba
1,236
1,220–1,251
284 gemma-2-9b-itGoogle
1,238
1,226–1,250
285 reka-flash-21b-20240226-onlineRekaai
1,226
1,205–1,247
286 qwen1.5-110b-chatAlibaba
1,229
1,212–1,246
288 jamba-1.5-miniAI21 Labs
1,213
1,182–1,244
289 mistral-large-2402Mistral
1,229
1,216–1,243
289 mistral-mediumMistral
1,226
1,209–1,243
289 gpt-3.5-turbo-1106OpenAI
1,215
1,187–1,243
290 internlm2_5-20b-chatShanghai Ai Lab
1,220
1,198–1,242
291 qwen1.5-32b-chatAlibaba
1,223
1,205–1,242
292 yi-1.5-34b-chat01 Ai
1,221
1,202–1,239
293 granite-3.0-8b-instructIBM
1,205
1,174–1,236
294 reka-flash-21b-20240226Rekaai
1,216
1,199–1,234
295 Mixtral 8x22B InstructMistral
1,218
1,204–1,232
297 command-rCohere
1,215
1,201–1,228
301 llama-3-8b-instructMeta
1,211
1,199–1,223
301 phi-3-medium-4k-instructMicrosoft
1,205
1,188–1,223
305 qwen1.5-14b-chatAlibaba
1,194
1,174–1,214
306 Llama 3.1 8B InstructMeta
1,198
1,185–1,210
306 gpt-3.5-turbo-0125OpenAI
1,198
1,185–1,210
306 mixtral-8x7b-instruct-v0.1Mistral
1,197
1,184–1,210
306 zephyr-orpo-141b-A35b-v0.1Huggingface
1,172
1,133–1,212
310 dbrx-instruct-previewDatabricks
1,191
1,174–1,207
310 granite-3.0-2b-instructIBM
1,177
1,149–1,206
312 openchat-3.5Openchat
1,164
1,123–1,205
314 gemini-pro-dev-apiGoogle
1,180
1,156–1,204
314 Llama 3.2 3B InstructMeta
1,179
1,154–1,204
320 gemma-1.1-7b-itGoogle
1,175
1,157–1,193
320 starling-lm-7b-betaNexusflow
1,174
1,154–1,194
320 qwq-32b-previewAlibaba
1,153
1,118–1,189
322 phi-3-small-8k-instructMicrosoft
1,167
1,148–1,186
322 openchat-3.5-0106Openchat
1,164
1,141–1,187
323 gemma-2-2b-itGoogle
1,172
1,160–1,185
324 qwen1.5-7b-chatAlibaba
1,148
1,112–1,185
327 snowflake-arctic-instructSnowflake
1,165
1,148–1,182
327 yi-34b-chat01 Ai
1,156
1,131–1,181
327 phi-3-mini-4k-instruct-june-2024Microsoft
1,149
1,123–1,175
330 vicuna-33bLmsys
1,146
1,120–1,173
330 phi-3-mini-4k-instructMicrosoft
1,140
1,121–1,160
330 mistral-7b-instruct-v0.2Mistral
1,140
1,120–1,161
330 starling-lm-7b-alphaBerkeley
1,138
1,107–1,168
330 llama-2-7b-chatMeta
1,134
1,106–1,162
333 llama-2-70b-chatMeta
1,137
1,120–1,155
333 llama-2-13b-chatMeta
1,130
1,104–1,155
335 gemma-7b-itGoogle
1,122
1,090–1,153
335 zephyr-7b-betaHuggingface
1,113
1,075–1,151
336 vicuna-13bLmsys
1,117
1,086–1,148
338 gemma-1.1-2b-itGoogle
1,118
1,092–1,143
339 qwen1.5-4b-chatAlibaba
1,108
1,077–1,139
341 mistral-7b-instructMistral
1,085
1,046–1,124
347 phi-3-mini-128k-instructMicrosoft
1,098
1,078–1,119
349 Llama 3.2 1B InstructMeta
1,082
1,054–1,110

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on prompts Arena classes as expert-level.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.