Invalid moves:
8 results above zero · % of moves, lower is better. Choose a model to highlight it.Clear highlight
- 16 Gemini 3.1 Flash-Lite (minimal reasoning)Google 0.2%
- 17 Mistral Medium 3.5Mistral AI 0.3%
- 18 Gemini 3.5 Flash (minimal reasoning)Google 0.6%
- 19 Seed-2.0-Mini (minimal reasoning)ByteDance 0.8%
- 20 Mistral Small 4 (no reasoning)Mistral AI 1.0%
- 21 Mistral Large 4Mistral AI 1.8%
- 22 GPT-5.4 nano (no reasoning)OpenAI 4.0%
- 23 Inkling Small (no reasoning)Thinking Machines 5.3%
15 models had none: Claude Haiku 4.5, Claude Sonnet 5.5 (low reasoning), Clef, Clef Flash, Decider V1 27B, GPT-5.4 mini (no reasoning), GPT-6 Luna Decisions, Gemini 3.5 Flash-Lite, Gemini 3.6 Flash (minimal reasoning), Gemini 3.8 Flash (low reasoning), Jev 1.13, Kev 4B, Mercury Decide, Mistral Medium 3.5 (no reasoning), d1.