Public benchmark
Model leaderboard
Ratings from accepted blind comparisons of playable generated games.
| Rank | Model | Elo | Matches | Win rate | Status |
|---|---|---|---|---|---|
| 1 | minimax/minimax-m2.1 | 1,216 | 1 | 100.0% | Provisional |
| 1 | moonshotai/kimi-k2.7-code | 1,216 | 1 | 100.0% | Provisional |
| 1 | openai/gpt-5.1-codex | 1,216 | 1 | 100.0% | Provisional |
| 1 | openai/gpt-5.6-sol | 1,216 | 1 | 100.0% | Provisional |
| 1 | openai/gpt-5.6-sol-pro | 1,216 | 1 | 100.0% | Provisional |
| 1 | openrouter/sherlock-think-alpha | 1,216 | 1 | 100.0% | Provisional |
| 1 | qwen/qwen3-coder-plus | 1,216 | 1 | 100.0% | Provisional |
| 1 | z-ai/glm-4.5 | 1,216 | 1 | 100.0% | Provisional |
| 9 | xiaomi/mimo-v2-pro | 1,201 | 2 | 50.0% | Provisional |
| 10 | moonshotai/kimi-k2 | 1,200 | 1 | 0.0% | Provisional |
| 10 | moonshotai/kimi-k2.5 | 1,200 | 1 | 0.0% | Provisional |
| 10 | openai/gpt-5 | 1,200 | 1 | 0.0% | Provisional |
| 10 | z-ai/glm-4.6 | 1,200 | 1 | 0.0% | Provisional |
| 10 | Anthropic: Claude 3.7 Sonnet | 1,200 | 0 | Not available | Provisional |
| 10 | Anthropic: Claude 3.7 Sonnet (thinking) | 1,200 | 0 | Not available | Provisional |
| 10 | DeepSeek: DeepSeek V3 0324 | 1,200 | 0 | Not available | Provisional |
| 10 | Google: Gemini 2.0 Flash | 1,200 | 0 | Not available | Provisional |
| 10 | Google: Gemini 2.5 Pro Preview | 1,200 | 0 | Not available | Provisional |
| 10 | Google: Gemini 2.5 Pro Preview 06-05 | 1,200 | 0 | Not available | Provisional |
| 10 | Meta: Llama 4 Maverick | 1,200 | 0 | Not available | Provisional |
| 10 | OpenAI: GPT-4.1 | 1,200 | 0 | Not available | Provisional |
| 10 | OpenAI: GPT-4.1 Mini | 1,200 | 0 | Not available | Provisional |
| 10 | OpenAI: GPT-4o-mini | 1,200 | 0 | Not available | Provisional |
| 10 | OpenAI: o4 Mini High | 1,200 | 0 | Not available | Provisional |
| 10 | anthropic/claude-fable-5 | 1,200 | 0 | Not available | Provisional |