| GPT-5.6 Sol (max) gpt-5-6-sol-max | GPT-5.6 Sol | 56.2% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.6 Terra (max) gpt-5-6-terra-max | GPT-5.6 Terra | 51.0% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) claude-opus-4-7-max | Claude Opus 4.7 | 46.7% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.5 (xhigh) gpt-5-5-xhigh | GPT-5.5 | 45.8% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-5.2 (max) glm-5-2-max | GLM-5.2 | 42.7% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.7 Max source label without registered configuration ID | Qwen3.7-Max | 42.5% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.5 Flash (high) gemini-3-5-flash-high | Gemini 3.5 Flash | 40.3% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.6 Luna (max) gpt-5-6-luna-max | GPT-5.6 Luna | 40.3% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-5.1 (Reasoning) source label without registered configuration ID | GLM-5.1 | 40.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) claude-sonnet-4-6-max | Claude Sonnet 4.6 | 39.8% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V4 Pro (Reasoning, Max Effort) deepseek-v4-pro-max | DeepSeek V4 Pro | 38.3% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiMo-V2.5-Pro source label without registered configuration ID | MiMo-V2.5-Pro | 38.2% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemma 4 31B (Reasoning) source label without registered configuration ID | Gemma 4 31B | 37.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.5 27B (Reasoning) source label without registered configuration ID | Qwen3.5 27B | 35.5% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 mini (xhigh) gpt-5-4-mini-xhigh | GPT-5.4 mini | 35.2% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.5 397B A17B (Reasoning) source label without registered configuration ID | Qwen3.5 397B A17B | 34.1% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Grok 4.3 (high) source label without registered configuration ID | Grok 4.3 | 32.7% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V4 Flash (Reasoning, Max Effort) deepseek-v4-flash-max | DeepSeek V4 Flash | 31.5% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Kimi K2.6 source label without registered configuration ID | Kimi K2.6 | 31.2% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.1 Pro Preview source label without registered configuration ID | Gemini 3.1 Pro Preview | 30.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude 4.5 Haiku (Reasoning) source label without registered configuration ID | Claude Haiku 4.5 | 27.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiniMax-M2.7 source label without registered configuration ID | MiniMax M2.7 | 26.5% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 nano (xhigh) gpt-5-4-nano-xhigh | GPT-5.4 nano | 24.4% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemma 4 26B A4B (Reasoning) source label without registered configuration ID | Gemma 4 26B | 23.6% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.5 35B A3B (Reasoning) source label without registered configuration ID | Qwen3.5 35B | 21.5% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| NVIDIA Nemotron 3 Super 120B A12B (Reasoning) source label without registered configuration ID | Nemotron 3 Super | 1.1% | CurrentArtificial Analysis independent evaluation | Score input source-checked | ITBench-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|