Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on creative writing prompts.

Results dated
25 Sep 2026
Models
407
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International
Arena Text: creative writing, Arena rating, higher is better
#ModelArena Text: creative writing · 95% range
Arena rating, higher is better
1 Claude Opus 5.5Anthropic · Claude Opus 5.5 (high)
1,521
1,492–1,550
1 Claude Fable 5Anthropic · Claude Fable 5 (high)
1,501
1,493–1,509
1 Claude Opus 4.6Anthropic · Claude Opus 4.6 (high)
1,501
1,494–1,507
1 Gemini 3.7 FlashGoogle · Gemini 3.7 Flash (high)
1,492
1,482–1,503
1 Claude Opus 4.7Anthropic · Claude Opus 4.7 (high)
1,488
1,481–1,496
1 Claude Fable 5.1Anthropic · Claude Fable 5.1 (max)
1,484
1,470–1,498
3 gemini-3-proGoogle
1,484
1,476–1,492
4 Claude Opus 4.7Anthropic
1,484
1,477–1,491
4 Gemini 3.8 FlashGoogle · Gemini 3.8 Flash (high)
1,482
1,472–1,491
4 Gemini 3.1 Pro PreviewGoogle
1,480
1,475–1,486
4 Claude Opus 4.6Anthropic
1,478
1,472–1,484
6 Claude Opus 5Anthropic · Claude Opus 5 (high)
1,472
1,465–1,479
6 Claude Opus 5Anthropic · Claude Opus 5 (max)
1,470
1,461–1,479
6 GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh)
1,470
1,462–1,478
6 Claude Opus 4.5Anthropic
1,469
1,461–1,477
6 Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high)
1,469
1,461–1,477
6 Qwen3.8 Max (0902)Alibaba
1,467
1,457–1,478
6 muse-sparkMeta
1,465
1,451–1,479
9 Claude Opus 4.8Anthropic · Claude Opus 4.8 (high)
1,467
1,461–1,474
9 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium)
1,466
1,458–1,473
9 grok-4.20-beta1xAI
1,464
1,454–1,474
9 Muse Spark 1.2Meta
1,448
1,425–1,472
11 GPT-6 SolOpenAI · GPT-6 Sol (max)
1,451
1,431–1,472
12 Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high)
1,463
1,455–1,470
12 Claude Opus 4.8Anthropic
1,462
1,455–1,469
12 Claude Opus 4.5Anthropic
1,461
1,455–1,468
12 Kimi K3Moonshot AI · Kimi K3 (max)
1,458
1,449–1,467
12 gemini-3-flashGoogle
1,457
1,447–1,466
12 GLM 5.3Z.ai · GLM 5.3 (max)
1,456
1,445–1,467
12 gpt-5.5-instantOpenAI
1,456
1,447–1,466
12 GPT-6 AstraOpenAI · GPT-6 Astra (max)
1,453
1,437–1,470
12 MiMo-V2.6-ProXiaomi
1,446
1,424–1,467
12 qwen3.7-max-previewAlibaba
1,441
1,413–1,468
13 GLM 5.2Z.ai · GLM 5.2 (max)
1,455
1,447–1,462
13 Muse Spark 1.3Meta · Muse Spark 1.3 (max)
1,450
1,436–1,464
18 Claude Sonnet 4.5Anthropic
1,454
1,448–1,460
18 GPT-5.5OpenAI · GPT-5.5 (high)
1,452
1,445–1,458
18 Grok 4.5xAI
1,452
1,444–1,460
18 DeepSeek V4 Pro 0813DeepSeek
1,446
1,432–1,460
18 Qwen3.6 Max PreviewAlibaba
1,436
1,414–1,459
20 Claude Sonnet 4.5Anthropic
1,450
1,444–1,456
20 GPT-5.5OpenAI
1,449
1,442–1,456
20 Claude Sonnet 4.6Anthropic
1,449
1,442–1,456
20 Muse Spark 1.1Meta
1,449
1,441–1,457
20 GLM 5Z.ai
1,447
1,438–1,456
20 qwen3.5-max-previewAlibaba
1,445
1,434–1,456
20 DeepSeek V4.1 FlashDeepSeek · DeepSeek V4.1 Flash (max)
1,440
1,423–1,457
23 GLM 5.1Z.ai
1,448
1,441–1,454
24 gemini-3-flashGoogle
1,447
1,441–1,453
24 grok-4.20-multi-agent-beta-0309xAI
1,447
1,440–1,453
24 DeepSeek V4 Pro 0423DeepSeek
1,446
1,439–1,453
24 grok-4.20-beta-0309-reasoningxAI
1,446
1,439–1,453
24 Claude Opus 4.1Anthropic
1,445
1,438–1,453
24 Grok 4.6xAI · Grok 4.6 (high)
1,445
1,435–1,454
25 GPT-5.4OpenAI · GPT-5.4 (high)
1,443
1,436–1,450
26 Gemini 2.5 ProGoogle
1,443
1,438–1,448
26 Claude Opus 4.1Anthropic
1,442
1,436–1,448
26 deepseek-v4-pro-previewDeepSeek
1,440
1,433–1,448
26 gpt-4.5-preview-2025-02-27OpenAI
1,436
1,424–1,448
27 Grok 4.7xAI · Grok 4.7 (xhigh)
1,427
1,406–1,448
34 Gemini 3.5 Flash LiteGoogle
1,435
1,427–1,444
34 GLM 5.3 FlashZ.ai
1,433
1,423–1,444
35 Claude Sonnet 5Anthropic · Claude Sonnet 5 (high)
1,435
1,427–1,442
36 GPT-5.4OpenAI
1,434
1,428–1,441
36 gpt-5.2-chat-latest-20260210OpenAI
1,433
1,425–1,442
36 claude-opus-4Anthropic
1,432
1,423–1,441
37 MiMo-V2.5-ProXiaomi
1,435
1,428–1,441
37 Kimi K2.6Moonshot AI
1,433
1,425–1,441
40 Qwen3.7 PlusAlibaba
1,432
1,424–1,439
43 Gemma 4 31BGoogle
1,419
1,401–1,438
44 grok-4.1xAI
1,431
1,424–1,438
47 GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh)
1,428
1,420–1,436
47 GPT-5.1OpenAI · GPT-5.1 (high)
1,428
1,420–1,436
49 ernie-5.1Baidu
1,427
1,418–1,435
50 ernie-5.0-preview-1203Baidu
1,419
1,404–1,434
51 mimo-v2-proXiaomi
1,423
1,413–1,433
51 Hy3Tencent
1,419
1,405–1,433
52 grok-4.1-thinkingxAI
1,426
1,420–1,433
52 DeepSeek V3.1 TerminusDeepSeek
1,405
1,378–1,432
54 Kimi K2.5Moonshot AI
1,423
1,417–1,430
54 Grok 4.3xAI
1,423
1,416–1,429
54 ernie-5.0-0110Baidu
1,421
1,413–1,430
54 ernie-5.0-preview-1022Baidu
1,407
1,385–1,429
56 chatgpt-4o-latest-20250326OpenAI
1,422
1,416–1,427
58 claude-opus-4Anthropic
1,417
1,408–1,425
66 DeepSeek V3.2 ExpDeepSeek
1,409
1,394–1,423
68 grok-4-1-fast-reasoningxAI
1,414
1,407–1,421
68 Gemini 3.1 Flash Lite PreviewGoogle
1,413
1,407–1,420
68 GPT-6 LunaOpenAI · GPT-6 Luna (max)
1,403
1,382–1,423
69 GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh)
1,412
1,404–1,420
72 deepseek-v4-flash-previewDeepSeek
1,411
1,403–1,418
72 GLM 4.7Z.ai
1,404
1,391–1,418
72 GLM 5V TurboZ.ai
1,403
1,389–1,417
72 Gemma 4 26B A4BGoogle
1,399
1,381–1,418
73 gpt-5.3-chat-latestOpenAI
1,408
1,399–1,417
73 DeepSeek V3.1DeepSeek
1,402
1,387–1,416
73 MiMo-V2.6-FlashXiaomi
1,394
1,372–1,416
73 DeepSeek V3.1 TerminusDeepSeek
1,388
1,360–1,417
75 DeepSeek V4 Flash 0423DeepSeek
1,408
1,400–1,415
75 GPT-5.1OpenAI
1,408
1,400–1,415
75 Qwen3.6 PlusAlibaba
1,407
1,399–1,415
76 MiniMax M3MiniMax
1,406
1,399–1,413
78 hunyuan-vision-1.5-thinkingTencent
1,377
1,341–1,413
79 Qwen3.5 397B A17BAlibaba
1,405
1,400–1,411
79 dola-seed-2.0-proBytedance
1,403
1,396–1,409
79 GPT-4.1OpenAI
1,402
1,395–1,410
79 GPT-5.4 MiniOpenAI · GPT-5.4 Mini (high)
1,402
1,394–1,409
79 DeepSeek V3.2DeepSeek
1,400
1,393–1,408
79 GLM 4.6Z.ai
1,400
1,392–1,409
79 Mistral Medium 3.5Mistral
1,398
1,384–1,412
79 Qwen3 MaxAlibaba
1,393
1,375–1,410
79 DeepSeek V3.2 ExpDeepSeek
1,391
1,374–1,408
80 grok-3-preview-02-24xAI
1,398
1,389–1,407
83 mimo-v2-omniXiaomi
1,395
1,385–1,406
83 Kimi K2.5Moonshot AI
1,390
1,373–1,406
84 Claude Sonnet 4Anthropic
1,395
1,386–1,405
85 grok-4-fast-chatxAI
1,384
1,364–1,404
86 grok-4-0709xAI
1,395
1,386–1,403
87 MiMo-V2.5Xiaomi
1,394
1,386–1,402
87 claude-3-7-sonnet-20250219Anthropic
1,393
1,385–1,402
87 qwen3-max-previewAlibaba
1,393
1,383–1,403
87 R1 0528DeepSeek
1,389
1,377–1,402
87 DeepSeek V3.1DeepSeek
1,388
1,374–1,401
93 Gemini 2.5 FlashGoogle
1,394
1,389–1,399
94 GPT-5.2OpenAI
1,391
1,385–1,397
94 DeepSeek V3.2DeepSeek
1,391
1,383–1,399
94 kimi-k2-thinking-turboMoonshot AI
1,391
1,384–1,397
94 DeepSeek V3 0324DeepSeek
1,390
1,382–1,398
94 gpt-5-chatOpenAI
1,389
1,380–1,399
94 longcat-flash-chat-2602-expMeituan
1,389
1,380–1,399
94 Claude Sonnet 4Anthropic
1,388
1,379–1,397
94 Kimi K2 0905Moonshot AI
1,382
1,366–1,397
94 hunyuan-t1-20250711Tencent
1,374
1,350–1,397
95 grok-4-fast-reasoningxAI
1,383
1,371–1,395
97 GPT-5.2OpenAI · GPT-5.2 (high)
1,387
1,379–1,394
99 Claude Haiku 4.5Anthropic
1,387
1,382–1,392
99 InklingThinkingmachines
1,384
1,376–1,392
101 o3OpenAI
1,383
1,376–1,390
101 o1OpenAI
1,381
1,372–1,390
101 gemini-2.5-flash-preview-09-2025Google
1,380
1,371–1,390
101 nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA
1,376
1,362–1,390
104 Qwen3 235B A22B Thinking 2507Alibaba
1,370
1,352–1,388
104 muse-glimmerMeta
1,365
1,342–1,387
108 claude-3-7-sonnet-20250219Anthropic
1,377
1,369–1,386
113 R1DeepSeek
1,374
1,363–1,384
114 Mistral Medium 3.1Mistral
1,378
1,372–1,384
114 Qwen3 235B A22B Instruct 2507Alibaba
1,378
1,372–1,383
115 GLM 4.5Z.ai
1,372
1,361–1,383
118 GPT-5OpenAI · GPT-5 (high)
1,373
1,363–1,382
119 gemini-2.5-flash-lite-preview-06-17Google
1,372
1,362–1,381
119 Kimi K2 0711Moonshot AI
1,371
1,361–1,381
124 Mistral Large 3 2512Mistral
1,373
1,367–1,378
124 GLM 4.6VZ.ai
1,350
1,322–1,379
125 claude-3-5-sonnet-20241022Anthropic
1,371
1,365–1,377
126 o1-previewOpenAI
1,366
1,356–1,376
126 hunyuan-turbos-20250416Tencent
1,361
1,346–1,377
126 amazon-nova-experimental-chat-26-01-10Amazon
1,351
1,327–1,376
128 Qwen3.8 27BAlibaba
1,364
1,353–1,375
129 Qwen3.5-122B-A10BAlibaba
1,366
1,357–1,375
129 Qwen3 235B A22BAlibaba
1,366
1,357–1,375
129 Qwen3 VL 235B A22B InstructAlibaba
1,357
1,340–1,374
130 Mistral Medium 3Mistral
1,364
1,354–1,374
132 Qwen3 Coder 480B A35BAlibaba
1,362
1,352–1,373
132 Hy3 previewTencent
1,354
1,335–1,373
138 MiniMax M2.7MiniMax
1,363
1,357–1,370
138 amazon-nova-experimental-chat-26-02-10Amazon
1,345
1,319–1,371
139 gemini-2.5-flash-lite-preview-09-2025Google
1,360
1,352–1,368
139 Qwen3.5-27BAlibaba
1,358
1,348–1,367
141 gemini-1.5-pro-002Google
1,358
1,351–1,366
142 MiniMax M2.5MiniMax
1,357
1,349–1,365
142 amazon-nova-experimental-chat-12-10Amazon
1,341
1,317–1,365
147 qwen2.5-maxAlibaba
1,353
1,345–1,362
147 trinity-large-previewArcee Ai
1,352
1,343–1,362
150 mimo-v2-flashXiaomi
1,352
1,345–1,360
150 GPT-4.1 MiniOpenAI
1,349
1,340–1,358
150 DeepSeek V3DeepSeek
1,349
1,338–1,359
150 Qwen3 VL 235B A22B ThinkingAlibaba
1,339
1,321–1,357
150 llama-3.1-nemotron-ultra-253b-v1NVIDIA
1,331
1,305–1,358
153 Gemma 3 27BGoogle
1,348
1,341–1,356
153 minimax-m2.1-previewMiniMax
1,345
1,333–1,356
153 step-2-16k-exp-202412Stepfun
1,336
1,315–1,356
154 gemini-advanced-0514Google
1,345
1,335–1,355
154 Gemma 3 12BGoogle
1,332
1,309–1,356
155 gemini-2.0-flash-lite-preview-02-05Google
1,344
1,335–1,354
157 gemini-2.0-flash-001Google
1,344
1,337–1,352
159 Step 3.5 FlashStepfun
1,345
1,338–1,352
159 Qwen3.5-35B-A3BAlibaba
1,342
1,333–1,352
160 mimo-v2-flashXiaomi
1,336
1,322–1,350
163 grok-3-mini-betaxAI
1,337
1,325–1,348
163 longcat-flash-chatMeituan
1,330
1,313–1,346
164 Qwen3.5-FlashAlibaba
1,338
1,331–1,345
164 GPT-4o (2024-05-13)OpenAI
1,338
1,330–1,345
164 o4 MiniOpenAI
1,337
1,329–1,345
165 grok-3-minixAI
1,331
1,317–1,345
167 Command ACohere
1,336
1,328–1,343
167 GPT-5.4 NanoOpenAI · GPT-5.4 Nano (high)
1,335
1,328–1,343
168 Trinity Large ThinkingArcee Ai
1,332
1,323–1,342
170 Qwen3 Next 80B A3B ThinkingAlibaba
1,326
1,312–1,341
174 GLM 4.5 AirZ.ai
1,327
1,317–1,337
175 GPT-4o (2024-08-06)OpenAI
1,327
1,319–1,336
175 Mistral Small 3.2 24BMistral
1,323
1,310–1,336
176 glm-4-plus-0111Z.ai
1,316
1,297–1,335
178 GPT-5 MiniOpenAI · GPT-5 Mini (high)
1,324
1,313–1,334
178 Qwen-PlusAlibaba
1,316
1,298–1,335
178 nvidia-llama-3.3-nemotron-super-49b-v1.5NVIDIA
1,304
1,275–1,334
180 GPT-4 TurboOpenAI
1,323
1,315–1,331
180 gemini-1.5-pro-001Google
1,323
1,315–1,331
180 Qwen3 235B A22BAlibaba
1,323
1,313–1,333
180 step-3Stepfun
1,310
1,289–1,332
180 GLM 4.5VZ.ai
1,309
1,286–1,332
181 intellect-3Primeintellect
1,310
1,289–1,331
182 Qwen3 30B A3B Instruct 2507Alibaba
1,319
1,308–1,330
183 hunyuan-turbos-20250226Tencent
1,303
1,277–1,329
184 MiniMax M1MiniMax
1,319
1,310–1,328
185 deepseek-v2.5-1210DeepSeek
1,310
1,292–1,327
185 hunyuan-large-2025-02-10Tencent
1,303
1,279–1,327
185 hunyuan-turbo-0110Tencent
1,302
1,277–1,327
186 GPT-4.1 NanoOpenAI
1,307
1,288–1,325
186 Qwen3 32BAlibaba
1,304
1,281–1,326
187 grok-2-2024-08-13xAI
1,317
1,310–1,325
187 Inkling SmallThinkingmachines
1,313
1,304–1,323
187 Qwen3 Next 80B A3B InstructAlibaba
1,313
1,302–1,324
187 llama-3.3-nemotron-49b-super-v1NVIDIA
1,297
1,270–1,324
188 o3 Mini HighOpenAI
1,312
1,301–1,322
190 Nemotron 3 SuperNVIDIA
1,303
1,286–1,321
191 Solar Pro 4Upstage
1,308
1,296–1,321
191 GLM 4.7 FlashZ.ai
1,306
1,293–1,320
191 amazon-nova-experimental-chat-10-09Amazon
1,288
1,256–1,320
193 Mercury 2Inception
1,292
1,266–1,318
196 Llama 4 MaverickMeta
1,307
1,298–1,316
201 step-1o-turbo-202506Stepfun
1,294
1,275–1,313
202 claude-3-5-haiku-20241022Anthropic
1,306
1,300–1,312
202 llama-3.1-405b-instruct-fp8Meta
1,305
1,297–1,312
202 claude-3-5-sonnet-20240620Anthropic
1,305
1,297–1,312
205 gemma-3n-e4b-itGoogle
1,299
1,287–1,310
207 llama-3.1-405b-instruct-bf16Meta
1,301
1,294–1,309
207 o3 MiniOpenAI
1,301
1,294–1,308
207 amazon-nova-experimental-chat-11-10Amazon
1,299
1,289–1,309
208 gemini-1.5-flash-002Google
1,298
1,289–1,307
208 yi-lightning01 Ai
1,297
1,286–1,307
208 olmo-3.1-32b-instructAi2
1,293
1,278–1,307
208 MiniMax M2MiniMax
1,285
1,264–1,305
208 hunyuan-large-visionTencent
1,281
1,257–1,305
210 qwq-32bAlibaba
1,293
1,283–1,303
211 GPT-4o-mini (2024-07-18)OpenAI
1,294
1,287–1,301
212 Gemma 2 27BGoogle
1,293
1,286–1,300
212 glm-4-plusZ.ai
1,289
1,279–1,300
212 hunyuan-standard-2025-02-10Tencent
1,277
1,253–1,300
213 Llama 4 ScoutMeta
1,289
1,278–1,299
213 gemma-2-9b-it-simpoPrinceton Nlp
1,284
1,269–1,298
215 magistral-medium-2506Mistral
1,280
1,264–1,297
215 granite-4.2-30bIBM
1,272
1,247–1,298
216 qwen-max-0919Alibaba
1,285
1,273–1,297
218 Mistral Large 2407Mistral
1,287
1,279–1,296
218 Gemma 3 4BGoogle
1,274
1,252–1,297
219 claude-3-opus-20240229Anthropic
1,288
1,281–1,295
219 llama-3.1-nemotron-70b-instructNVIDIA
1,276
1,257–1,295
220 gpt-4-1106-previewOpenAI
1,286
1,278–1,294
221 Qwen3 30B A3BAlibaba
1,283
1,273–1,294
221 amazon-nova-experimental-chat-10-20Amazon
1,278
1,263–1,293
223 Llama 3.3 70B InstructMeta
1,285
1,278–1,292
223 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA
1,277
1,263–1,290
225 o1-miniOpenAI
1,281
1,273–1,289
226 gpt-4-0125-previewOpenAI
1,280
1,272–1,289
228 qwen2.5-plus-1127Alibaba
1,273
1,259–1,288
228 llama-3.1-nemotron-51b-instructNVIDIA
1,262
1,236–1,287
229 gpt-oss-120bOpenAI
1,277
1,267–1,287
229 ling-flash-2.0Ant Group
1,267
1,246–1,287
233 reka-core-20240904Rekaai
1,267
1,249–1,286
234 mistral-large-2411Mistral
1,276
1,267–1,285
234 Nova 2 LiteAmazon
1,269
1,254–1,284
234 olmo-3-32b-thinkAi2
1,265
1,244–1,285
234 granite-4.1-8bIBM
1,260
1,235–1,285
235 athene-70b-0725Nexusflow
1,271
1,259–1,282
237 grok-2-mini-2024-08-13xAI
1,272
1,264–1,280
237 Mistral Small 3.1 24BMistral
1,270
1,261–1,280
238 ring-flash-2.0Ant Group
1,259
1,239–1,279
243 Command R+ (08-2024)Cohere
1,263
1,248–1,278
244 jamba-1.5-largeAI21 Labs
1,261
1,245–1,278
246 deepseek-v2.5DeepSeek
1,265
1,254–1,276
247 gpt-4-0613OpenAI
1,267
1,258–1,275
252 gemini-1.5-flash-001Google
1,264
1,255–1,272
252 llama-3.1-tulu-3-70bAi2
1,246
1,221–1,271
256 gemma-2-9b-itGoogle
1,259
1,251–1,266
256 GPT-5 NanoOpenAI · GPT-5 Nano (high)
1,247
1,227–1,267
257 Llama 3.1 70B InstructMeta
1,257
1,249–1,265
257 gpt-4-0314OpenAI
1,255
1,245–1,265
257 ibm-granite-h-smallIBM
1,242
1,218–1,266
258 olmo-3.1-32b-thinkAi2
1,247
1,230–1,264
262 llama-3-70b-instructMeta
1,254
1,247–1,262
262 Qwen2.5 72B InstructAlibaba
1,254
1,246–1,263
262 athene-v2-chatNexusflow
1,253
1,243–1,263
263 reka-flash-20240904Rekaai
1,243
1,225–1,260
266 gpt-oss-20bOpenAI
1,240
1,221–1,258
268 glm-4-0520Z.ai
1,241
1,226–1,256
268 mercuryInception
1,217
1,177–1,256
270 claude-3-sonnet-20240229Anthropic
1,246
1,238–1,254
271 Nemotron 3 Nano 30B A3BNVIDIA
1,241
1,229–1,254
275 nemotron-4-340b-instructNVIDIA
1,238
1,226–1,250
277 olmo-2-0325-32b-instructAi2
1,223
1,199–1,248
280 gemini-1.5-flash-8b-001Google
1,237
1,228–1,246
280 Nova Pro 1.0Amazon
1,237
1,227–1,246
283 granite-4.2-3bIBM
1,217
1,189–1,245
284 command-r-plusCohere
1,236
1,228–1,245
285 ministral-8b-2410Mistral
1,222
1,200–1,244
286 Mistral Small 3Mistral
1,227
1,214–1,239
288 c4ai-aya-expanse-32bCohere
1,228
1,217–1,238
290 qwen2-72b-instructAlibaba
1,223
1,213–1,232
290 Nova Lite 1.0Amazon
1,221
1,210–1,231
290 Granite 4.2 8BIBM
1,204
1,176–1,231
294 jamba-1.5-miniAI21 Labs
1,211
1,196–1,227
297 Qwen2.5 Coder 32B InstructAlibaba
1,207
1,187–1,226
299 claude-3-haiku-20240307Anthropic
1,216
1,208–1,223
299 Command R (08-2024)Cohere
1,209
1,193–1,225
299 hunyuan-standard-256kTencent
1,194
1,165–1,223
301 mistral-large-2402Mistral
1,211
1,202–1,221
301 Phi 4Microsoft
1,210
1,200–1,220
301 deepseek-coder-v2DeepSeek
1,205
1,192–1,219
301 llama-3.1-tulu-3-8bAi2
1,196
1,171–1,221
302 gemini-pro-dev-apiGoogle
1,204
1,190–1,218
303 wizardlm-70bMicrosoft
1,198
1,181–1,215
306 Nova Micro 1.0Amazon
1,197
1,187–1,208
307 llama-3-8b-instructMeta
1,197
1,188–1,205
307 command-rCohere
1,195
1,185–1,205
307 qwen1.5-110b-chatAlibaba
1,193
1,182–1,205
307 mistral-mediumMistral
1,193
1,182–1,204
307 c4ai-aya-expanse-8bCohere
1,189
1,173–1,204
307 gemini-proGoogle
1,185
1,164–1,206
307 openchat-3.5Openchat
1,185
1,167–1,203
309 gpt-3.5-turbo-0125OpenAI
1,191
1,182–1,200
309 Mixtral 8x22B InstructMistral
1,191
1,181–1,200
311 qwen1.5-72b-chatAlibaba
1,188
1,178–1,199
311 reka-flash-21b-20240226-onlineRekaai
1,181
1,167–1,196
311 granite-3.1-8b-instructIBM
1,171
1,144–1,197
313 zephyr-orpo-141b-A35b-v0.1Huggingface
1,169
1,146–1,192
314 gemma-2-2b-itGoogle
1,183
1,175–1,191
314 falcon-180b-chatTII
1,154
1,117–1,191
318 reka-flash-21b-20240226Rekaai
1,175
1,163–1,187
319 Llama 3.1 8B InstructMeta
1,177
1,169–1,186
320 vicuna-33bLmsys
1,172
1,160–1,184
325 openhermes-2.5-mistral-7bTeknium
1,158
1,136–1,180
328 dbrx-instruct-previewDatabricks
1,164
1,152–1,176
328 granite-3.1-2b-instructIBM
1,147
1,118–1,176
330 gpt-3.5-turbo-1106OpenAI
1,157
1,141–1,172
331 yi-1.5-34b-chat01 Ai
1,159
1,148–1,170
332 mixtral-8x7b-instruct-v0.1Mistral
1,159
1,151–1,168
332 yi-34b-chat01 Ai
1,154
1,140–1,168
332 dolphin-2.2.1-mistral-7bCognitivecomputations
1,135
1,101–1,168
334 tulu-2-dpo-70bAi2
1,146
1,127–1,165
335 Llama 3.2 3B InstructMeta
1,145
1,125–1,164
336 guanaco-33bTimdettmers
1,135
1,108–1,163
337 phi-3-medium-4k-instructMicrosoft
1,150
1,139–1,161
337 gemma-1.1-7b-itGoogle
1,150
1,138–1,161
337 openchat-3.5-0106Openchat
1,147
1,132–1,162
337 solar-10.7b-instruct-v1.0Upstage
1,138
1,115–1,162
337 mpt-30b-chatMosaicml
1,133
1,104–1,161
338 snowflake-arctic-instructSnowflake
1,143
1,131–1,155
338 wizardlm-13bMicrosoft
1,141
1,123–1,159
338 granite-3.0-8b-instructIBM
1,137
1,115–1,158
338 deepseek-llm-67b-chatDeepSeek
1,135
1,114–1,157
338 nous-hermes-2-mixtral-8x7b-dpoNousresearch
1,135
1,111–1,158
339 qwen1.5-14b-chatAlibaba
1,137
1,123–1,151
339 starling-lm-7b-alphaBerkeley
1,136
1,120–1,151
339 zephyr-7b-betaHuggingface
1,136
1,120–1,152
341 phi-3-small-8k-instructMicrosoft
1,134
1,120–1,147
341 internlm2_5-20b-chatShanghai Ai Lab
1,130
1,114–1,146
342 llama2-70b-steerlm-chatNVIDIA
1,119
1,094–1,145
343 qwen1.5-32b-chatAlibaba
1,131
1,119–1,144
345 vicuna-13bLmsys
1,127
1,114–1,140
348 qwq-32b-previewAlibaba
1,104
1,075–1,133
350 zephyr-7b-alphaHuggingface
1,100
1,071–1,130
352 qwen-14b-chatAlibaba
1,103
1,082–1,124
354 llama-2-70b-chatMeta
1,112
1,101–1,122
354 starling-lm-7b-betaNexusflow
1,107
1,092–1,122
354 granite-3.0-2b-instructIBM
1,100
1,078–1,121
357 gemma-7b-itGoogle
1,101
1,084–1,119
360 mistral-7b-instruct-v0.2Mistral
1,104
1,091–1,116
360 alpaca-13bStanford
1,094
1,072–1,116
364 smollm2-1.7b-instructHuggingface
1,079
1,045–1,114
366 phi-3-mini-4k-instruct-june-2024Microsoft
1,096
1,081–1,111
366 gemma-1.1-2b-itGoogle
1,094
1,077–1,111
366 mistral-7b-instructMistral
1,092
1,075–1,108
366 stripedhyena-nous-7bTogether
1,089
1,069–1,110
367 llama-2-13b-chatMeta
1,092
1,079–1,104
367 vicuna-7bLmsys
1,090
1,072–1,108
367 palm-2Google
1,089
1,071–1,107
367 qwen1.5-7b-chatAlibaba
1,081
1,058–1,104
368 codellama-34b-instructMeta
1,087
1,070–1,104
368 Llama 3.2 1B InstructMeta
1,083
1,062–1,103
368 gemma-2b-itGoogle
1,079
1,056–1,102
368 gpt4all-13b-snoozyNomic
1,064
1,027–1,102
370 phi-3-mini-128k-instructMicrosoft
1,086
1,071–1,100
373 phi-3-mini-4k-instructMicrosoft
1,073
1,060–1,086
373 llama-2-7b-chatMeta
1,072
1,059–1,086
378 mpt-7b-chatMosaicml
1,053
1,029–1,078
387 qwen1.5-4b-chatAlibaba
1,050
1,031–1,069
388 koala-13bBerkeley
1,046
1,025–1,067
388 chatglm3-6bZ.ai
1,040
1,017–1,064
394 oasst-pythia-12bOpenassistant
1,013
992–1,033
395 chatglm2-6bZ.ai
1,004
978–1,030
397 RWKV-4-Raven-14BRwkv
1,004
982–1,027
398 olmo-7b-instructAi2
1,002
981–1,022
399 fastchat-t5-3bLmsys
992
968–1,017
399 dolly-v2-12bDatabricks
971
943–998
403 chatglm-6bZ.ai
951
927–976
403 llama-13bMeta
936
902–970
404 stablelm-tuned-alpha-7bStabilityai
932
904–961

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on creative writing prompts.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.