1,556
1,522–1,591
Benchmarks / Arena (formerly LMArena)
Reported by Arena (formerly LMArena)
Arena (formerly LMArena)
Human preference on prompts Arena classes as expert-level.
- Results dated
- 25 Sep 2026
- Models
- 359
- Unit
- Arena rating
| # | Model | Arena Text: expert prompts · 95% range Arena rating, higher is better |
|---|---|---|
| 1 | Claude Opus 5.5Anthropic · Claude Opus 5.5 (high) | |
| 1 | Claude Fable 5Anthropic · Claude Fable 5 (high) |
1,550 1,540–1,560 |
| 1 | Claude Opus 4.6Anthropic · Claude Opus 4.6 (high) |
1,547 1,539–1,555 |
| 1 | Claude Opus 5Anthropic · Claude Opus 5 (high) |
1,543 1,534–1,551 |
| 1 | MiMo-V2.6-ProXiaomi |
1,535 1,508–1,563 |
| 1 | Claude Opus 4.7Anthropic |
1,535 1,527–1,543 |
| 1 | Claude Opus 4.7Anthropic · Claude Opus 4.7 (high) |
1,534 1,526–1,542 |
| 1 | GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh) |
1,534 1,524–1,544 |
| 1 | Claude Opus 4.6Anthropic |
1,533 1,526–1,541 |
| 1 | Kimi K3Moonshot AI · Kimi K3 (max) |
1,533 1,521–1,545 |
| 1 | Gemini 3.8 FlashGoogle · Gemini 3.8 Flash (high) |
1,529 1,517–1,541 |
| 1 | Muse Spark 1.3Meta · Muse Spark 1.3 (max) |
1,527 1,510–1,544 |
| 2 | Claude Opus 5Anthropic · Claude Opus 5 (max) |
1,527 1,516–1,539 |
| 3 | DeepSeek V4.1 FlashDeepSeek · DeepSeek V4.1 Flash (max) |
1,518 1,497–1,538 |
| 3 | Claude Fable 5.1Anthropic · Claude Fable 5.1 (max) |
1,516 1,495–1,536 |
| 3 | MiMo-V2.6-FlashXiaomi |
1,510 1,483–1,538 |
| 3 | qwen3.7-max-previewAlibaba |
1,506 1,475–1,537 |
| 4 | Claude Opus 4.8Anthropic · Claude Opus 4.8 (high) |
1,525 1,517–1,533 |
| 4 | GLM 5.3Z.ai · GLM 5.3 (max) |
1,516 1,501–1,531 |
| 4 | GPT-6 AstraOpenAI · GPT-6 Astra (max) |
1,510 1,488–1,532 |
| 4 | GPT-6 SolOpenAI · GPT-6 Sol (max) |
1,507 1,482–1,531 |
| 4 | GPT-6 LunaOpenAI · GPT-6 Luna (max) |
1,505 1,480–1,529 |
| 4 | Muse Spark 1.2Meta |
1,502 1,472–1,531 |
| 7 | Gemini 3.7 FlashGoogle · Gemini 3.7 Flash (high) |
1,512 1,499–1,524 |
| 7 | amazon-nova-experimental-chat-26-02-10Amazon |
1,494 1,462–1,525 |
| 8 | Claude Opus 4.8Anthropic |
1,515 1,507–1,523 |
| 8 | GPT-5.4OpenAI · GPT-5.4 (high) |
1,515 1,506–1,523 |
| 8 | GLM 5.3 FlashZ.ai |
1,510 1,497–1,524 |
| 8 | Qwen3.8 Max (0902)Alibaba |
1,510 1,498–1,522 |
| 8 | Gemma 4 31BGoogle |
1,499 1,474–1,523 |
| 8 | Qwen3.6 Max PreviewAlibaba |
1,499 1,474–1,523 |
| 9 | Claude Sonnet 5Anthropic · Claude Sonnet 5 (high) |
1,512 1,503–1,521 |
| 10 | GPT-5.5OpenAI · GPT-5.5 (high) |
1,513 1,505–1,520 |
| 10 | GPT-5.5OpenAI |
1,511 1,503–1,519 |
| 12 | Gemini 3.1 Pro PreviewGoogle |
1,509 1,503–1,516 |
| 13 | Claude Sonnet 4.6Anthropic |
1,506 1,498–1,514 |
| 13 | MiMo-V2.5-ProXiaomi |
1,506 1,498–1,514 |
| 13 | Muse Spark 1.1Meta |
1,504 1,495–1,514 |
| 13 | GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh) |
1,504 1,494–1,514 |
| 13 | Claude Opus 4.5Anthropic |
1,503 1,491–1,515 |
| 13 | Kimi K2.6Moonshot AI |
1,503 1,493–1,513 |
| 13 | Claude Opus 4.5Anthropic |
1,503 1,494–1,511 |
| 13 | qwen3.5-max-previewAlibaba |
1,499 1,486–1,512 |
| 14 | GLM 5.2Z.ai · GLM 5.2 (max) |
1,500 1,491–1,509 |
| 14 | Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high) |
1,500 1,490–1,510 |
| 14 | gemini-3-proGoogle |
1,498 1,487–1,510 |
| 14 | gemini-3-flashGoogle |
1,496 1,484–1,509 |
| 14 | Hy3Tencent |
1,490 1,472–1,508 |
| 15 | muse-sparkMeta |
1,491 1,475–1,508 |
| 17 | Claude Sonnet 4.5Anthropic |
1,498 1,490–1,506 |
| 17 | mimo-v2-proXiaomi |
1,493 1,480–1,506 |
| 17 | amazon-nova-experimental-chat-26-01-10Amazon |
1,472 1,438–1,506 |
| 18 | ernie-5.1Baidu |
1,494 1,484–1,504 |
| 19 | GLM 5.1Z.ai |
1,495 1,487–1,503 |
| 20 | DeepSeek V4 Pro 0813DeepSeek |
1,485 1,466–1,503 |
| 21 | gpt-5.2-chat-latest-20260210OpenAI |
1,491 1,480–1,502 |
| 21 | Grok 4.6xAI · Grok 4.6 (high) |
1,490 1,477–1,502 |
| 22 | GPT-5.4OpenAI |
1,492 1,484–1,500 |
| 22 | GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh) |
1,491 1,481–1,501 |
| 22 | Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high) |
1,491 1,482–1,500 |
| 22 | Gemma 4 26B A4BGoogle |
1,475 1,450–1,501 |
| 26 | Grok 4.5xAI |
1,488 1,479–1,498 |
| 28 | Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium) |
1,487 1,478–1,496 |
| 31 | Qwen3 235B A22B Thinking 2507Alibaba |
1,466 1,437–1,494 |
| 32 | Qwen3.7 PlusAlibaba |
1,485 1,476–1,494 |
| 32 | Claude Opus 4.1Anthropic |
1,482 1,470–1,494 |
| 32 | GPT-5.1OpenAI · GPT-5.1 (high) |
1,482 1,470–1,494 |
| 33 | GLM 5Z.ai |
1,481 1,469–1,493 |
| 33 | Qwen3.8 27BAlibaba |
1,477 1,463–1,491 |
| 35 | Claude Sonnet 4.5Anthropic |
1,483 1,475–1,491 |
| 35 | Kimi K2.5Moonshot AI |
1,483 1,475–1,490 |
| 37 | GPT-5.4 MiniOpenAI · GPT-5.4 Mini (high) |
1,480 1,472–1,488 |
| 37 | grok-4.20-multi-agent-beta-0309xAI |
1,480 1,472–1,488 |
| 37 | DeepSeek V4 Pro 0423DeepSeek |
1,480 1,471–1,488 |
| 37 | grok-4.20-beta1xAI |
1,476 1,463–1,488 |
| 41 | grok-4.20-beta-0309-reasoningxAI |
1,478 1,470–1,486 |
| 41 | dola-seed-2.0-proBytedance |
1,478 1,470–1,485 |
| 41 | Qwen3.6 PlusAlibaba |
1,476 1,467–1,485 |
| 41 | deepseek-v4-pro-previewDeepSeek |
1,475 1,467–1,484 |
| 41 | GPT-5.2OpenAI · GPT-5.2 (high) |
1,475 1,465–1,485 |
| 41 | gpt-5.5-instantOpenAI |
1,473 1,461–1,486 |
| 42 | InklingThinkingmachines |
1,474 1,464–1,484 |
| 44 | nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA |
1,467 1,450–1,484 |
| 45 | Qwen3.5 397B A17BAlibaba |
1,476 1,469–1,483 |
| 47 | gpt-5.3-chat-latestOpenAI |
1,471 1,459–1,482 |
| 47 | Grok 4.7xAI · Grok 4.7 (xhigh) |
1,454 1,426–1,482 |
| 49 | qwen3-max-previewAlibaba |
1,464 1,448–1,480 |
| 51 | MiniMax M3MiniMax |
1,471 1,462–1,479 |
| 51 | MiMo-V2.5Xiaomi |
1,470 1,461–1,480 |
| 51 | longcat-flash-chat-2602-expMeituan |
1,468 1,456–1,479 |
| 51 | GLM 5V TurboZ.ai |
1,462 1,445–1,479 |
| 53 | DeepSeek V3.2 ExpDeepSeek |
1,449 1,420–1,478 |
| 54 | Gemini 3.5 Flash LiteGoogle |
1,467 1,457–1,477 |
| 56 | Claude Opus 4.1Anthropic |
1,466 1,457–1,475 |
| 57 | deepseek-v4-flash-previewDeepSeek |
1,466 1,457–1,475 |
| 59 | grok-4.1-thinkingxAI |
1,466 1,457–1,475 |
| 59 | mimo-v2-omniXiaomi |
1,461 1,448–1,474 |
| 59 | GPT-5OpenAI · GPT-5 (high) |
1,460 1,444–1,475 |
| 60 | Kimi K2.5Moonshot AI |
1,451 1,428–1,474 |
| 61 | ernie-5.0-preview-1203Baidu |
1,451 1,429–1,472 |
| 66 | gemini-3-flashGoogle |
1,463 1,456–1,470 |
| 67 | muse-glimmerMeta |
1,442 1,414–1,470 |
| 70 | kimi-k2-thinking-turboMoonshot AI |
1,460 1,452–1,469 |
| 70 | GLM 4.7Z.ai |
1,449 1,429–1,469 |
| 72 | Hy3 previewTencent |
1,446 1,424–1,468 |
| 72 | Qwen3 VL 235B A22B ThinkingAlibaba |
1,439 1,409–1,468 |
| 73 | GPT-5.2OpenAI |
1,459 1,452–1,467 |
| 75 | DeepSeek V4 Flash 0423DeepSeek |
1,457 1,448–1,466 |
| 75 | GPT-5.1OpenAI |
1,455 1,444–1,466 |
| 75 | ernie-5.0-preview-1022Baidu |
1,432 1,399–1,466 |
| 76 | Gemini 2.5 ProGoogle |
1,458 1,451–1,465 |
| 76 | Qwen3 VL 235B A22B InstructAlibaba |
1,440 1,416–1,465 |
| 77 | DeepSeek V3.2DeepSeek |
1,453 1,442–1,464 |
| 79 | claude-opus-4Anthropic |
1,448 1,434–1,462 |
| 81 | GLM 4.5Z.ai |
1,444 1,427–1,461 |
| 82 | grok-4.1xAI |
1,452 1,444–1,461 |
| 83 | Grok 4.3xAI |
1,452 1,444–1,460 |
| 83 | MiniMax M2.7MiniMax |
1,452 1,445–1,460 |
| 83 | o3OpenAI |
1,449 1,437–1,460 |
| 84 | Claude Haiku 4.5Anthropic |
1,452 1,446–1,458 |
| 84 | DeepSeek V3.2DeepSeek |
1,448 1,438–1,458 |
| 84 | ernie-5.0-0110Baidu |
1,447 1,436–1,458 |
| 84 | gpt-5-chatOpenAI |
1,443 1,428–1,458 |
| 86 | DeepSeek V3.1DeepSeek |
1,432 1,407–1,457 |
| 89 | Inkling SmallThinkingmachines |
1,445 1,433–1,456 |
| 90 | Qwen3 235B A22B Instruct 2507Alibaba |
1,448 1,440–1,455 |
| 90 | Qwen3.5-122B-A10BAlibaba |
1,442 1,430–1,453 |
| 90 | Qwen3.5-27BAlibaba |
1,441 1,429–1,453 |
| 90 | gpt-4.5-preview-2025-02-27OpenAI |
1,429 1,405–1,453 |
| 90 | longcat-flash-chatMeituan |
1,428 1,402–1,454 |
| 91 | GLM 4.6Z.ai |
1,439 1,426–1,452 |
| 92 | Gemini 3.1 Flash Lite PreviewGoogle |
1,443 1,435–1,451 |
| 93 | Mistral Medium 3.5Mistral |
1,434 1,416–1,451 |
| 93 | grok-4-fast-chatxAI |
1,416 1,382–1,451 |
| 98 | grok-4-1-fast-reasoningxAI |
1,438 1,429–1,447 |
| 98 | GPT-5.4 NanoOpenAI · GPT-5.4 Nano (high) |
1,438 1,429–1,446 |
| 98 | claude-opus-4Anthropic |
1,434 1,421–1,446 |
| 98 | Claude Sonnet 4Anthropic |
1,433 1,418–1,447 |
| 98 | Solar Pro 4Upstage |
1,433 1,418–1,448 |
| 98 | DeepSeek V3.1DeepSeek |
1,426 1,404–1,448 |
| 98 | DeepSeek V3.2 ExpDeepSeek |
1,425 1,402–1,447 |
| 99 | gemini-2.5-flash-preview-09-2025Google |
1,432 1,418–1,446 |
| 99 | hunyuan-t1-20250711Tencent |
1,407 1,369–1,445 |
| 100 | grok-4-0709xAI |
1,431 1,418–1,445 |
| 102 | Qwen3 MaxAlibaba |
1,418 1,392–1,444 |
| 106 | grok-4-fast-reasoningxAI |
1,421 1,402–1,441 |
| 106 | Kimi K2 0905Moonshot AI |
1,417 1,393–1,441 |
| 106 | GLM 4.5VZ.ai |
1,399 1,358–1,441 |
| 107 | chatgpt-4o-latest-20250326OpenAI |
1,429 1,420–1,438 |
| 107 | minimax-m2.1-previewMiniMax |
1,421 1,404–1,438 |
| 107 | R1 0528DeepSeek |
1,418 1,399–1,438 |
| 109 | Step 3.5 FlashStepfun |
1,429 1,420–1,438 |
| 111 | GLM 4.6VZ.ai |
1,394 1,352–1,437 |
| 112 | Mistral Large 3 2512Mistral |
1,428 1,420–1,435 |
| 112 | mimo-v2-flashXiaomi |
1,414 1,394–1,435 |
| 112 | Qwen3 32BAlibaba |
1,398 1,361–1,435 |
| 113 | MiniMax M2.5MiniMax |
1,425 1,414–1,435 |
| 115 | Gemini 2.5 FlashGoogle |
1,424 1,417–1,431 |
| 115 | Qwen3.5-35B-A3BAlibaba |
1,420 1,408–1,431 |
| 115 | Kimi K2 0711Moonshot AI |
1,417 1,401–1,432 |
| 115 | amazon-nova-experimental-chat-12-10Amazon |
1,397 1,362–1,431 |
| 122 | Qwen3.5-FlashAlibaba |
1,420 1,411–1,428 |
| 123 | granite-4.2-30bIBM |
1,396 1,365–1,427 |
| 124 | mimo-v2-flashXiaomi |
1,417 1,407–1,426 |
| 126 | claude-3-7-sonnet-20250219Anthropic |
1,412 1,398–1,426 |
| 126 | grok-3-minixAI |
1,407 1,388–1,426 |
| 127 | R1DeepSeek |
1,402 1,382–1,422 |
| 130 | o4 MiniOpenAI |
1,408 1,395–1,420 |
| 132 | amazon-nova-experimental-chat-11-10Amazon |
1,405 1,391–1,419 |
| 132 | grok-3-preview-02-24xAI |
1,403 1,388–1,419 |
| 132 | o1OpenAI |
1,402 1,385–1,419 |
| 132 | o3 Mini HighOpenAI |
1,399 1,378–1,419 |
| 133 | GPT-5 MiniOpenAI · GPT-5 Mini (high) |
1,400 1,383–1,418 |
| 134 | Mistral Medium 3.1Mistral |
1,410 1,403–1,418 |
| 136 | GPT-4.1OpenAI |
1,405 1,394–1,417 |
| 136 | Qwen3 Next 80B A3B InstructAlibaba |
1,399 1,382–1,417 |
| 137 | Qwen3 Next 80B A3B ThinkingAlibaba |
1,394 1,371–1,417 |
| 139 | trinity-large-previewArcee Ai |
1,403 1,392–1,415 |
| 139 | Claude Sonnet 4Anthropic |
1,402 1,388–1,415 |
| 139 | Nemotron 3 SuperNVIDIA |
1,393 1,371–1,415 |
| 141 | Trinity Large ThinkingArcee Ai |
1,401 1,389–1,413 |
| 141 | Qwen3 30B A3B Instruct 2507Alibaba |
1,395 1,378–1,412 |
| 141 | nvidia-llama-3.3-nemotron-super-49b-v1.5NVIDIA |
1,371 1,330–1,413 |
| 142 | DeepSeek V3 0324DeepSeek |
1,398 1,386–1,411 |
| 143 | Qwen3 235B A22BAlibaba |
1,395 1,382–1,409 |
| 146 | GLM 4.7 FlashZ.ai |
1,386 1,367–1,406 |
| 147 | GLM 4.5 AirZ.ai |
1,390 1,374–1,405 |
| 147 | nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA |
1,389 1,373–1,405 |
| 149 | claude-3-7-sonnet-20250219Anthropic |
1,390 1,377–1,404 |
| 149 | Granite 4.2 8BIBM |
1,369 1,335–1,403 |
| 153 | Qwen3 235B A22BAlibaba |
1,386 1,370–1,402 |
| 154 | Qwen-PlusAlibaba |
1,370 1,341–1,400 |
| 154 | ring-flash-2.0Ant Group |
1,367 1,335–1,399 |
| 155 | step-3Stepfun |
1,364 1,328–1,399 |
| 156 | grok-3-mini-betaxAI |
1,380 1,363–1,398 |
| 157 | gemini-2.5-flash-lite-preview-09-2025Google |
1,386 1,375–1,397 |
| 157 | GPT-4.1 MiniOpenAI |
1,384 1,370–1,397 |
| 157 | o1-previewOpenAI |
1,383 1,368–1,397 |
| 157 | Qwen3 Coder 480B A35BAlibaba |
1,379 1,363–1,396 |
| 161 | Mistral Medium 3Mistral |
1,379 1,365–1,393 |
| 163 | ling-flash-2.0Ant Group |
1,361 1,330–1,391 |
| 168 | amazon-nova-experimental-chat-10-20Amazon |
1,365 1,344–1,387 |
| 168 | intellect-3Primeintellect |
1,355 1,323–1,387 |
| 168 | GPT-5 NanoOpenAI · GPT-5 Nano (high) |
1,354 1,321–1,386 |
| 169 | gemini-2.5-flash-lite-preview-06-17Google |
1,371 1,356–1,386 |
| 170 | Mercury 2Inception |
1,348 1,312–1,384 |
| 171 | MiniMax M2MiniMax |
1,350 1,317–1,383 |
| 172 | qwen2.5-maxAlibaba |
1,368 1,354–1,382 |
| 175 | claude-3-5-sonnet-20241022Anthropic |
1,372 1,362–1,381 |
| 175 | MiniMax M1MiniMax |
1,366 1,351–1,380 |
| 177 | o3 MiniOpenAI |
1,366 1,355–1,377 |
| 177 | qwq-32bAlibaba |
1,361 1,344–1,378 |
| 179 | Nova 2 LiteAmazon |
1,354 1,333–1,374 |
| 180 | gpt-oss-120bOpenAI |
1,357 1,341–1,373 |
| 180 | hunyuan-turbos-20250416Tencent |
1,349 1,325–1,373 |
| 184 | granite-4.1-8bIBM |
1,338 1,307–1,370 |
| 185 | gemini-2.0-flash-001Google |
1,356 1,343–1,369 |
| 190 | o1-miniOpenAI |
1,352 1,340–1,363 |
| 190 | DeepSeek V3DeepSeek |
1,348 1,331–1,365 |
| 190 | granite-4.2-3bIBM |
1,328 1,292–1,364 |
| 194 | olmo-3.1-32b-thinkAi2 |
1,336 1,310–1,361 |
| 195 | Qwen3 30B A3BAlibaba |
1,343 1,326–1,359 |
| 195 | hunyuan-large-2025-02-10Tencent |
1,323 1,287–1,359 |
| 196 | step-2-16k-exp-202412Stepfun |
1,326 1,295–1,357 |
| 197 | Command ACohere |
1,344 1,332–1,355 |
| 197 | claude-3-5-sonnet-20240620Anthropic |
1,344 1,332–1,355 |
| 198 | Mistral Small 3.2 24BMistral |
1,335 1,315–1,354 |
| 201 | gemini-1.5-pro-002Google |
1,339 1,328–1,350 |
| 201 | Gemma 3 27BGoogle |
1,337 1,325–1,350 |
| 201 | gemini-2.0-flash-lite-preview-02-05Google |
1,332 1,315–1,348 |
| 201 | Nemotron 3 Nano 30B A3BNVIDIA |
1,331 1,312–1,350 |
| 201 | yi-lightning01 Ai |
1,331 1,316–1,346 |
| 201 | olmo-3.1-32b-instructAi2 |
1,325 1,303–1,348 |
| 201 | ibm-granite-h-smallIBM |
1,312 1,276–1,348 |
| 202 | GPT-4.1 NanoOpenAI |
1,313 1,283–1,344 |
| 204 | qwen2.5-plus-1127Alibaba |
1,322 1,300–1,343 |
| 204 | gpt-oss-20bOpenAI |
1,314 1,287–1,342 |
| 205 | glm-4-plus-0111Z.ai |
1,312 1,282–1,341 |
| 207 | Llama 4 MaverickMeta |
1,326 1,312–1,339 |
| 207 | llama-3.1-405b-instruct-fp8Meta |
1,325 1,313–1,336 |
| 207 | olmo-3-32b-thinkAi2 |
1,303 1,268–1,339 |
| 210 | deepseek-v2.5-1210DeepSeek |
1,306 1,280–1,333 |
| 212 | gemini-1.5-pro-001Google |
1,320 1,308–1,332 |
| 213 | hunyuan-large-visionTencent |
1,297 1,264–1,331 |
| 215 | hunyuan-standard-2025-02-10Tencent |
1,290 1,251–1,329 |
| 217 | claude-3-opus-20240229Anthropic |
1,318 1,309–1,328 |
| 217 | claude-3-5-haiku-20241022Anthropic |
1,316 1,305–1,327 |
| 217 | grok-2-2024-08-13xAI |
1,316 1,305–1,327 |
| 218 | llama-3.1-405b-instruct-bf16Meta |
1,312 1,299–1,325 |
| 218 | athene-v2-chatNexusflow |
1,311 1,296–1,326 |
| 220 | GPT-4o (2024-08-06)OpenAI |
1,312 1,299–1,324 |
| 220 | Llama 4 ScoutMeta |
1,309 1,293–1,324 |
| 220 | step-1o-turbo-202506Stepfun |
1,297 1,270–1,324 |
| 220 | llama-3.1-nemotron-70b-instructNVIDIA |
1,296 1,269–1,323 |
| 221 | GPT-4o (2024-05-13)OpenAI |
1,311 1,301–1,322 |
| 222 | glm-4-plusZ.ai |
1,303 1,288–1,318 |
| 222 | Mistral Small 3.1 24BMistral |
1,302 1,287–1,318 |
| 222 | athene-70b-0725Nexusflow |
1,301 1,282–1,320 |
| 222 | qwen-max-0919Alibaba |
1,300 1,282–1,318 |
| 222 | magistral-medium-2506Mistral |
1,292 1,265–1,319 |
| 224 | reka-core-20240904Rekaai |
1,291 1,267–1,316 |
| 225 | Gemma 3 12BGoogle |
1,274 1,233–1,315 |
| 226 | Mistral Large 2407Mistral |
1,302 1,289–1,314 |
| 226 | jamba-1.5-largeAI21 Labs |
1,285 1,256–1,314 |
| 227 | gemini-advanced-0514Google |
1,299 1,284–1,313 |
| 230 | deepseek-v2.5DeepSeek |
1,296 1,281–1,311 |
| 231 | Llama 3.3 70B InstructMeta |
1,298 1,286–1,309 |
| 231 | Qwen2.5 Coder 32B InstructAlibaba |
1,277 1,244–1,309 |
| 232 | GPT-4 TurboOpenAI |
1,297 1,286–1,308 |
| 233 | grok-2-mini-2024-08-13xAI |
1,295 1,283–1,307 |
| 233 | Qwen2.5 72B InstructAlibaba |
1,295 1,283–1,307 |
| 237 | gpt-4-1106-previewOpenAI |
1,290 1,278–1,302 |
| 238 | Gemma 3 4BGoogle |
1,260 1,219–1,301 |
| 239 | reka-flash-20240904Rekaai |
1,277 1,254–1,300 |
| 241 | gemini-1.5-flash-002Google |
1,285 1,272–1,298 |
| 241 | gemma-3n-e4b-itGoogle |
1,279 1,261–1,298 |
| 242 | GPT-4o-mini (2024-07-18)OpenAI |
1,285 1,274–1,296 |
| 244 | gpt-4-0125-previewOpenAI |
1,280 1,268–1,292 |
| 245 | Nova Pro 1.0Amazon |
1,273 1,257–1,289 |
| 247 | deepseek-coder-v2DeepSeek |
1,267 1,245–1,288 |
| 248 | Llama 3.1 70B InstructMeta |
1,275 1,264–1,287 |
| 251 | llama-3.1-nemotron-51b-instructNVIDIA |
1,253 1,220–1,286 |
| 252 | claude-3-sonnet-20240229Anthropic |
1,273 1,261–1,285 |
| 252 | mistral-large-2411Mistral |
1,271 1,256–1,286 |
| 252 | Phi 4Microsoft |
1,268 1,251–1,286 |
| 260 | gemini-1.5-flash-001Google |
1,268 1,256–1,281 |
| 260 | c4ai-aya-expanse-32bCohere |
1,267 1,253–1,281 |
| 261 | gpt-4-0314OpenAI |
1,264 1,249–1,280 |
| 261 | Nova Lite 1.0Amazon |
1,262 1,245–1,279 |
| 261 | nemotron-4-340b-instructNVIDIA |
1,261 1,242–1,279 |
| 261 | Mistral Small 3Mistral |
1,259 1,238–1,280 |
| 262 | glm-4-0520Z.ai |
1,252 1,227–1,278 |
| 263 | qwen2-72b-instructAlibaba |
1,261 1,246–1,275 |
| 263 | Command R+ (08-2024)Cohere |
1,250 1,225–1,274 |
| 265 | Gemma 2 27BGoogle |
1,260 1,250–1,271 |
| 265 | granite-3.1-8b-instructIBM |
1,236 1,200–1,271 |
| 268 | ministral-8b-2410Mistral |
1,238 1,208–1,268 |
| 270 | gpt-4-0613OpenAI |
1,253 1,241–1,266 |
| 271 | gemma-2-9b-it-simpoPrinceton Nlp |
1,235 1,206–1,265 |
| 272 | claude-3-haiku-20240307Anthropic |
1,253 1,242–1,264 |
| 273 | Nova Micro 1.0Amazon |
1,244 1,227–1,261 |
| 277 | llama-3-70b-instructMeta |
1,245 1,234–1,256 |
| 277 | c4ai-aya-expanse-8bCohere |
1,232 1,209–1,256 |
| 278 | gemini-1.5-flash-8b-001Google |
1,243 1,230–1,256 |
| 279 | command-r-plusCohere |
1,242 1,229–1,254 |
| 280 | Command R (08-2024)Cohere |
1,231 1,209–1,253 |
| 280 | granite-3.1-2b-instructIBM |
1,218 1,183–1,254 |
| 283 | qwen1.5-72b-chatAlibaba |
1,236 1,220–1,251 |
| 284 | gemma-2-9b-itGoogle |
1,238 1,226–1,250 |
| 285 | reka-flash-21b-20240226-onlineRekaai |
1,226 1,205–1,247 |
| 286 | qwen1.5-110b-chatAlibaba |
1,229 1,212–1,246 |
| 288 | jamba-1.5-miniAI21 Labs |
1,213 1,182–1,244 |
| 289 | mistral-large-2402Mistral |
1,229 1,216–1,243 |
| 289 | mistral-mediumMistral |
1,226 1,209–1,243 |
| 289 | gpt-3.5-turbo-1106OpenAI |
1,215 1,187–1,243 |
| 290 | internlm2_5-20b-chatShanghai Ai Lab |
1,220 1,198–1,242 |
| 291 | qwen1.5-32b-chatAlibaba |
1,223 1,205–1,242 |
| 292 | yi-1.5-34b-chat01 Ai |
1,221 1,202–1,239 |
| 293 | granite-3.0-8b-instructIBM |
1,205 1,174–1,236 |
| 294 | reka-flash-21b-20240226Rekaai |
1,216 1,199–1,234 |
| 295 | Mixtral 8x22B InstructMistral |
1,218 1,204–1,232 |
| 297 | command-rCohere |
1,215 1,201–1,228 |
| 301 | llama-3-8b-instructMeta |
1,211 1,199–1,223 |
| 301 | phi-3-medium-4k-instructMicrosoft |
1,205 1,188–1,223 |
| 305 | qwen1.5-14b-chatAlibaba |
1,194 1,174–1,214 |
| 306 | Llama 3.1 8B InstructMeta |
1,198 1,185–1,210 |
| 306 | gpt-3.5-turbo-0125OpenAI |
1,198 1,185–1,210 |
| 306 | mixtral-8x7b-instruct-v0.1Mistral |
1,197 1,184–1,210 |
| 306 | zephyr-orpo-141b-A35b-v0.1Huggingface |
1,172 1,133–1,212 |
| 310 | dbrx-instruct-previewDatabricks |
1,191 1,174–1,207 |
| 310 | granite-3.0-2b-instructIBM |
1,177 1,149–1,206 |
| 312 | openchat-3.5Openchat |
1,164 1,123–1,205 |
| 314 | gemini-pro-dev-apiGoogle |
1,180 1,156–1,204 |
| 314 | Llama 3.2 3B InstructMeta |
1,179 1,154–1,204 |
| 320 | gemma-1.1-7b-itGoogle |
1,175 1,157–1,193 |
| 320 | starling-lm-7b-betaNexusflow |
1,174 1,154–1,194 |
| 320 | qwq-32b-previewAlibaba |
1,153 1,118–1,189 |
| 322 | phi-3-small-8k-instructMicrosoft |
1,167 1,148–1,186 |
| 322 | openchat-3.5-0106Openchat |
1,164 1,141–1,187 |
| 323 | gemma-2-2b-itGoogle |
1,172 1,160–1,185 |
| 324 | qwen1.5-7b-chatAlibaba |
1,148 1,112–1,185 |
| 327 | snowflake-arctic-instructSnowflake |
1,165 1,148–1,182 |
| 327 | yi-34b-chat01 Ai |
1,156 1,131–1,181 |
| 327 | phi-3-mini-4k-instruct-june-2024Microsoft |
1,149 1,123–1,175 |
| 330 | vicuna-33bLmsys |
1,146 1,120–1,173 |
| 330 | phi-3-mini-4k-instructMicrosoft |
1,140 1,121–1,160 |
| 330 | mistral-7b-instruct-v0.2Mistral |
1,140 1,120–1,161 |
| 330 | starling-lm-7b-alphaBerkeley |
1,138 1,107–1,168 |
| 330 | llama-2-7b-chatMeta |
1,134 1,106–1,162 |
| 333 | llama-2-70b-chatMeta |
1,137 1,120–1,155 |
| 333 | llama-2-13b-chatMeta |
1,130 1,104–1,155 |
| 335 | gemma-7b-itGoogle |
1,122 1,090–1,153 |
| 335 | zephyr-7b-betaHuggingface |
1,113 1,075–1,151 |
| 336 | vicuna-13bLmsys |
1,117 1,086–1,148 |
| 338 | gemma-1.1-2b-itGoogle |
1,118 1,092–1,143 |
| 339 | qwen1.5-4b-chatAlibaba |
1,108 1,077–1,139 |
| 341 | mistral-7b-instructMistral |
1,085 1,046–1,124 |
| 347 | phi-3-mini-128k-instructMicrosoft |
1,098 1,078–1,119 |
| 349 | Llama 3.2 1B InstructMeta |
1,082 1,054–1,110 |
Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.
What it measures
Human preference on prompts Arena classes as expert-level.
What it does not measure
Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.
Source
Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.