JobBench leaderboard
10 ranked models · higher is better · labels show rank and score
View accessible chart data
| Model | Rank | Provider | Score |
|---|---|---|---|
| Muse Spark 1.1 | #1 | Meta | 54.7% |
| Kimi K3 | #2 | Moonshot AI | 52.9% |
| Claude Opus 4.7 (Adaptive) | #3 | Anthropic | 45.9% |
| GPT-5.5 | #4 | OpenAI | 42.7% |
| GPT-5.4 | #5 | OpenAI | 38.9% |
| Claude Sonnet 4.6 | #6 | Anthropic | 36.9% |
| Claude Opus 4.6 | #7 | Anthropic | 36.7% |
| GPT-5.2 | #8 | OpenAI | 34.3% |
| GPT-5.3-Codex | #9 | OpenAI | 33.7% |
| Claude Opus 4.5 | #10 | Anthropic | 32.3% |
