1,501
1,495–1,507
Benchmarks / Arena (formerly LMArena)
Reported by Arena (formerly LMArena)
Arena (formerly LMArena)
Human preference combined with labels of whether each answer's checkable claims were true (factuality weighted 25% by default).
- Results dated
- 25 Sep 2026
- Models
- 177
- Unit
- Arena rating
| # | Model | Arena Text factuality: overall · 95% range Arena rating, higher is better |
|---|---|---|
| 1 | Claude Fable 5.1Anthropic · Claude Fable 5.1 (max) | |
| 1 | Claude Opus 4.6Anthropic · Claude Opus 4.6 (high) |
1,494 1,491–1,497 |
| 2 | Claude Opus 5Anthropic · Claude Opus 5 (max) |
1,488 1,484–1,493 |
| 2 | Muse Spark 1.2Meta |
1,484 1,475–1,493 |
| 3 | Claude Opus 4.6Anthropic |
1,488 1,486–1,491 |
| 3 | GPT-5.5OpenAI · GPT-5.5 (high) |
1,486 1,483–1,489 |
| 3 | GPT-5.4OpenAI · GPT-5.4 (high) |
1,485 1,482–1,488 |
| 3 | Claude Fable 5Anthropic · Claude Fable 5 (high) |
1,483 1,480–1,487 |
| 3 | MiMo-V2.6-ProXiaomi |
1,483 1,475–1,491 |
| 3 | qwen3.7-max-previewAlibaba |
1,481 1,472–1,489 |
| 4 | GPT-5.5OpenAI |
1,482 1,480–1,485 |
| 4 | gemini-3-proGoogle |
1,481 1,478–1,485 |
| 4 | Muse Spark 1.3Meta · Muse Spark 1.3 (max) |
1,479 1,473–1,485 |
| 6 | Gemini 3.7 FlashGoogle · Gemini 3.7 Flash (high) |
1,477 1,473–1,482 |
| 6 | Gemini 3.8 FlashGoogle · Gemini 3.8 Flash (high) |
1,477 1,473–1,482 |
| 7 | Claude Opus 5Anthropic · Claude Opus 5 (high) |
1,477 1,474–1,480 |
| 7 | Claude Opus 4.7Anthropic · Claude Opus 4.7 (high) |
1,477 1,474–1,480 |
| 9 | Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (high) |
1,476 1,472–1,479 |
| 9 | GPT-5.6 SolOpenAI · GPT-5.6 Sol (xhigh) |
1,476 1,472–1,479 |
| 9 | GPT-5.4OpenAI |
1,475 1,473–1,478 |
| 9 | Claude Opus 4.7Anthropic |
1,475 1,472–1,479 |
| 9 | qwen3.5-max-previewAlibaba |
1,475 1,470–1,479 |
| 10 | Kimi K3Moonshot AI · Kimi K3 (max) |
1,472 1,468–1,476 |
| 10 | DeepSeek V4.1 FlashDeepSeek · DeepSeek V4.1 Flash (max) |
1,471 1,464–1,478 |
| 10 | Qwen3.8 Max (0902)Alibaba |
1,471 1,466–1,475 |
| 13 | Gemini 3.1 Pro PreviewGoogle |
1,472 1,469–1,474 |
| 14 | Gemini 3.6 FlashGoogle · Gemini 3.6 Flash (high) |
1,470 1,466–1,474 |
| 15 | GLM 5.3Z.ai · GLM 5.3 (max) |
1,468 1,463–1,473 |
| 15 | muse-sparkMeta |
1,467 1,462–1,473 |
| 18 | Claude Opus 4.8Anthropic · Claude Opus 4.8 (high) |
1,469 1,466–1,472 |
| 22 | gemini-3-flashGoogle |
1,468 1,464–1,472 |
| 22 | GLM 5.3 FlashZ.ai |
1,467 1,462–1,471 |
| 22 | GPT-6 AstraOpenAI · GPT-6 Astra (max) |
1,465 1,458–1,471 |
| 23 | GPT-5.6 TerraOpenAI · GPT-5.6 Terra (xhigh) |
1,467 1,463–1,470 |
| 24 | Gemini 3.5 FlashGoogle · Gemini 3.5 Flash (medium) |
1,466 1,462–1,469 |
| 24 | MiMo-V2.5-ProXiaomi |
1,465 1,462–1,468 |
| 24 | Grok 4.5xAI |
1,465 1,462–1,469 |
| 25 | Claude Opus 4.8Anthropic |
1,465 1,461–1,468 |
| 25 | Muse Spark 1.1Meta |
1,463 1,459–1,467 |
| 25 | MiMo-V2.6-FlashXiaomi |
1,459 1,451–1,468 |
| 26 | GLM 5.2Z.ai · GLM 5.2 (max) |
1,463 1,459–1,466 |
| 28 | Gemini 2.5 ProGoogle |
1,462 1,459–1,465 |
| 28 | GPT-5.6 LunaOpenAI · GPT-5.6 Luna (xhigh) |
1,461 1,458–1,465 |
| 29 | Claude Sonnet 4.6Anthropic |
1,461 1,458–1,464 |
| 32 | Claude Opus 4.5Anthropic |
1,459 1,456–1,463 |
| 35 | Claude Opus 4.5Anthropic |
1,459 1,456–1,462 |
| 35 | GPT-5.1OpenAI · GPT-5.1 (high) |
1,459 1,455–1,462 |
| 38 | grok-4.20-multi-agent-beta-0309xAI |
1,457 1,454–1,460 |
| 38 | GLM 5.1Z.ai |
1,456 1,453–1,460 |
| 38 | Kimi K2.6Moonshot AI |
1,456 1,452–1,460 |
| 38 | ernie-5.1Baidu |
1,456 1,452–1,460 |
| 38 | Qwen3.6 Max PreviewAlibaba |
1,452 1,445–1,460 |
| 38 | amazon-nova-experimental-chat-26-02-10Amazon |
1,452 1,443–1,460 |
| 41 | grok-4.20-beta-0309-reasoningxAI |
1,456 1,453–1,459 |
| 41 | DeepSeek V4 Pro 0813DeepSeek |
1,453 1,448–1,459 |
| 43 | DeepSeek V4 Pro 0423DeepSeek |
1,455 1,452–1,458 |
| 44 | grok-4.20-beta1xAI |
1,453 1,448–1,457 |
| 44 | Gemma 4 31BGoogle |
1,450 1,443–1,457 |
| 44 | DeepSeek V3.2 ExpDeepSeek |
1,446 1,435–1,457 |
| 45 | Qwen3.7 PlusAlibaba |
1,453 1,449–1,456 |
| 46 | Claude Sonnet 5Anthropic · Claude Sonnet 5 (high) |
1,452 1,448–1,455 |
| 46 | InklingThinkingmachines |
1,452 1,448–1,455 |
| 46 | GLM 5Z.ai |
1,452 1,448–1,456 |
| 47 | gemini-3-flashGoogle |
1,451 1,449–1,454 |
| 47 | gpt-5.2-chat-latest-20260210OpenAI |
1,451 1,447–1,455 |
| 48 | Grok 4.6xAI · Grok 4.6 (high) |
1,449 1,445–1,454 |
| 49 | Hy3Tencent |
1,447 1,441–1,453 |
| 53 | Gemini 3.5 Flash LiteGoogle |
1,448 1,444–1,451 |
| 53 | Gemma 4 26B A4BGoogle |
1,445 1,438–1,452 |
| 54 | Claude Sonnet 4.5Anthropic |
1,449 1,446–1,451 |
| 54 | deepseek-v4-pro-previewDeepSeek |
1,447 1,444–1,451 |
| 54 | GPT-5.4 MiniOpenAI · GPT-5.4 Mini (high) |
1,447 1,444–1,450 |
| 54 | GLM 4.6Z.ai |
1,447 1,443–1,451 |
| 54 | Claude Sonnet 4.5Anthropic |
1,447 1,444–1,449 |
| 54 | GLM 4.7Z.ai |
1,444 1,438–1,450 |
| 55 | ernie-5.0-0110Baidu |
1,445 1,442–1,449 |
| 58 | ernie-5.0-preview-1203Baidu |
1,442 1,436–1,448 |
| 58 | qwen3-max-previewAlibaba |
1,442 1,435–1,448 |
| 58 | ernie-5.0-preview-1022Baidu |
1,440 1,431–1,448 |
| 60 | Kimi K2.5Moonshot AI |
1,445 1,442–1,448 |
| 60 | GPT-5.1OpenAI |
1,445 1,441–1,448 |
| 61 | Qwen3.5 397B A17BAlibaba |
1,445 1,442–1,447 |
| 61 | chatgpt-4o-latest-20250326OpenAI |
1,444 1,441–1,447 |
| 61 | gpt-5.5-instantOpenAI |
1,443 1,439–1,448 |
| 61 | mimo-v2-proXiaomi |
1,443 1,439–1,448 |
| 63 | GPT-5.2OpenAI |
1,442 1,440–1,445 |
| 63 | GLM 5V TurboZ.ai |
1,440 1,435–1,446 |
| 65 | GPT-5.2OpenAI · GPT-5.2 (high) |
1,442 1,438–1,445 |
| 69 | Qwen3.8 27BAlibaba |
1,439 1,434–1,443 |
| 72 | DeepSeek V4 Flash 0423DeepSeek |
1,439 1,436–1,443 |
| 72 | MiMo-V2.5Xiaomi |
1,439 1,435–1,442 |
| 74 | DeepSeek V3.2 ExpDeepSeek |
1,436 1,430–1,442 |
| 77 | Qwen3.6 PlusAlibaba |
1,438 1,434–1,441 |
| 77 | mimo-v2-omniXiaomi |
1,436 1,431–1,441 |
| 78 | DeepSeek V3.2DeepSeek |
1,437 1,434–1,440 |
| 80 | Gemini 2.5 FlashGoogle |
1,437 1,434–1,439 |
| 81 | Claude Opus 4.1Anthropic |
1,435 1,432–1,439 |
| 84 | MiniMax M3MiniMax |
1,434 1,431–1,437 |
| 84 | grok-4.1-thinkingxAI |
1,434 1,431–1,437 |
| 84 | deepseek-v4-flash-previewDeepSeek |
1,434 1,430–1,437 |
| 84 | Mistral Large 3 2512Mistral |
1,434 1,431–1,436 |
| 84 | Claude Opus 4.1Anthropic |
1,433 1,429–1,437 |
| 84 | Gemini 3.1 Flash Lite PreviewGoogle |
1,433 1,430–1,436 |
| 84 | DeepSeek V3.2DeepSeek |
1,433 1,429–1,436 |
| 84 | nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA |
1,430 1,424–1,437 |
| 84 | Mistral Medium 3.5Mistral |
1,430 1,424–1,436 |
| 88 | Kimi K2.5Moonshot AI |
1,429 1,423–1,435 |
| 92 | Qwen3 235B A22B Instruct 2507Alibaba |
1,431 1,429–1,434 |
| 92 | grok-4.1xAI |
1,431 1,428–1,434 |
| 93 | amazon-nova-experimental-chat-12-10Amazon |
1,424 1,415–1,434 |
| 94 | longcat-flash-chat-2602-expMeituan |
1,429 1,425–1,433 |
| 94 | Qwen3 VL 235B A22B InstructAlibaba |
1,414 1,396–1,432 |
| 95 | Mistral Medium 3.1Mistral |
1,429 1,426–1,431 |
| 95 | Qwen3.5-122B-A10BAlibaba |
1,428 1,424–1,432 |
| 95 | GPT-6 SolOpenAI · GPT-6 Sol (max) |
1,424 1,416–1,432 |
| 100 | Grok 4.3xAI |
1,428 1,425–1,431 |
| 103 | GPT-6 LunaOpenAI · GPT-6 Luna (max) |
1,422 1,414–1,430 |
| 105 | Inkling SmallThinkingmachines |
1,425 1,421–1,429 |
| 105 | gemini-2.5-flash-preview-09-2025Google |
1,425 1,420–1,429 |
| 105 | Grok 4.7xAI · Grok 4.7 (xhigh) |
1,420 1,412–1,429 |
| 106 | gpt-5-chatOpenAI |
1,422 1,415–1,428 |
| 107 | GPT-5OpenAI · GPT-5 (high) |
1,421 1,414–1,428 |
| 108 | kimi-k2-thinking-turboMoonshot AI |
1,423 1,420–1,426 |
| 108 | MiniMax M2.7MiniMax |
1,422 1,419–1,425 |
| 108 | mimo-v2-flashXiaomi |
1,422 1,419–1,425 |
| 108 | Qwen3 Next 80B A3B InstructAlibaba |
1,419 1,412–1,425 |
| 109 | grok-4-0709xAI |
1,419 1,413–1,425 |
| 113 | Qwen3.5-27BAlibaba |
1,420 1,416–1,424 |
| 113 | grok-4-fast-reasoningxAI |
1,417 1,411–1,423 |
| 114 | dola-seed-2.0-proBytedance |
1,419 1,416–1,422 |
| 114 | gpt-5.3-chat-latestOpenAI |
1,419 1,415–1,422 |
| 114 | GPT-5.4 NanoOpenAI · GPT-5.4 Nano (high) |
1,418 1,415–1,421 |
| 117 | Claude Haiku 4.5Anthropic |
1,418 1,416–1,420 |
| 117 | Step 3.5 FlashStepfun |
1,417 1,414–1,420 |
| 117 | Hy3 previewTencent |
1,413 1,406–1,420 |
| 119 | amazon-nova-experimental-chat-11-10Amazon |
1,415 1,411–1,419 |
| 119 | Qwen3.5-FlashAlibaba |
1,414 1,411–1,417 |
| 119 | Kimi K2 0905Moonshot AI |
1,403 1,389–1,418 |
| 119 | Qwen3 Coder 480B A35BAlibaba |
1,401 1,383–1,419 |
| 120 | grok-4-1-fast-reasoningxAI |
1,413 1,410–1,416 |
| 120 | minimax-m2.1-previewMiniMax |
1,411 1,406–1,416 |
| 120 | mimo-v2-flashXiaomi |
1,410 1,404–1,416 |
| 127 | GPT-4.1OpenAI |
1,408 1,402–1,415 |
| 129 | Solar Pro 4Upstage |
1,409 1,403–1,414 |
| 133 | Qwen3.5-35B-A3BAlibaba |
1,408 1,404–1,411 |
| 133 | o3OpenAI |
1,405 1,398–1,411 |
| 133 | amazon-nova-experimental-chat-26-01-10Amazon |
1,403 1,394–1,411 |
| 136 | gemini-2.5-flash-lite-preview-09-2025Google |
1,407 1,404–1,411 |
| 137 | muse-glimmerMeta |
1,401 1,393–1,410 |
| 139 | amazon-nova-experimental-chat-10-20Amazon |
1,399 1,393–1,405 |
| 143 | GLM 4.6VZ.ai |
1,392 1,381–1,402 |
| 144 | GLM 4.5 AirZ.ai |
1,395 1,388–1,402 |
| 144 | GPT-5 MiniOpenAI · GPT-5 Mini (high) |
1,394 1,387–1,401 |
| 145 | Nemotron 3 SuperNVIDIA |
1,390 1,383–1,397 |
| 149 | MiniMax M2.5MiniMax |
1,386 1,382–1,389 |
| 149 | gpt-oss-120bOpenAI |
1,385 1,378–1,391 |
| 149 | Gemma 3 27BGoogle |
1,380 1,369–1,391 |
| 152 | Nova 2 LiteAmazon |
1,380 1,374–1,386 |
| 152 | granite-4.2-30bIBM |
1,377 1,368–1,386 |
| 156 | intellect-3Primeintellect |
1,373 1,365–1,381 |
| 156 | MiniMax M1MiniMax |
1,370 1,359–1,381 |
| 156 | o4 MiniOpenAI |
1,368 1,358–1,378 |
| 157 | trinity-large-previewArcee Ai |
1,373 1,369–1,377 |
| 157 | Trinity Large ThinkingArcee Ai |
1,371 1,367–1,375 |
| 157 | GLM 4.7 FlashZ.ai |
1,370 1,365–1,376 |
| 157 | Mercury 2Inception |
1,368 1,359–1,378 |
| 158 | Command ACohere |
1,363 1,357–1,370 |
| 161 | Nemotron 3 Nano 30B A3BNVIDIA |
1,362 1,357–1,367 |
| 161 | MiniMax M2MiniMax |
1,360 1,353–1,367 |
| 162 | nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA |
1,360 1,354–1,366 |
| 171 | Granite 4.2 8BIBM |
1,343 1,333–1,352 |
| 171 | olmo-3.1-32b-instructAi2 |
1,342 1,336–1,348 |
| 171 | granite-4.2-3bIBM |
1,327 1,317–1,337 |
| 173 | olmo-3-32b-thinkAi2 |
1,319 1,312–1,327 |
| 173 | granite-4.1-8bIBM |
1,311 1,302–1,320 |
| 173 | mercuryInception |
1,305 1,292–1,317 |
| 175 | olmo-3.1-32b-thinkAi2 |
1,300 1,294–1,307 |
Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.
What it measures
Human preference combined with labels of whether each answer's checkable claims were true (factuality weighted 25% by default).
What it does not measure
Not an error rate: claims that cannot be checked on the web are skipped, and preference still carries most of the weight.
Source
Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.