| Kimi K3; Artificial Analysis EnterpriseOps-Gym-AA evaluation. source label without registered configuration ID | Kimi K3 | 45.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | Kimi K3 Intelligence, Performance & Price Analysis ↗Observed 2026-07-20 · checked 2026-07-21 |
|---|
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) claude-fable-5-max | Claude Fable 5 | 51.1% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.5 Flash (high) gemini-3-5-flash-high | Gemini 3.5 Flash | 50.1% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.5 (xhigh) gpt-5-5-xhigh | GPT-5.5 | 46.6% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.7 Max source label without registered configuration ID | Qwen3.7-Max | 45.0% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) claude-sonnet-5-max | Claude Sonnet 5 | 44.7% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) claude-opus-4-8-max | Claude Opus 4.8 | 44.0% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-5.2 (max) glm-5-2-max | GLM-5.2 | 42.7% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.1 Pro Preview source label without registered configuration ID | Gemini 3.1 Pro Preview | 42.2% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Grok 4.5 (high) source label without registered configuration ID | Grok 4.5 | 40.8% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.7 Plus source label without registered configuration ID | Qwen3.7-Plus | 40.6% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V4 Pro (Reasoning, Max Effort) deepseek-v4-pro-max | DeepSeek V4 Pro | 40.4% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Kimi K2.7 Code source label without registered configuration ID | Kimi K2.7 Code | 40.2% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V4 Flash (Reasoning, Max Effort) deepseek-v4-flash-max | DeepSeek V4 Flash | 39.6% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Kimi K2.6 source label without registered configuration ID | Kimi K2.6 | 38.5% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 mini (xhigh) gpt-5-4-mini-xhigh | GPT-5.4 mini | 34.6% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Mistral Medium 3.5 source label without registered configuration ID | Mistral Medium 3.5 | 33.7% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiniMax-M3 source label without registered configuration ID | MiniMax M3 | 32.1% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 nano (xhigh) gpt-5-4-nano-xhigh | GPT-5.4 nano | 31.5% | CurrentArtificial Analysis independent evaluation | Public reference · not scored source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.5 397B A17B (Reasoning) source label without registered configuration ID | Qwen3.5 397B A17B | 30.9% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude 4.5 Haiku (Reasoning) source label without registered configuration ID | Claude Haiku 4.5 | 29.4% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Nemotron 3 Ultra 550B A55B (Reasoning) source label without registered configuration ID | Nemotron 3 Ultra | 28.9% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemma 4 31B (Reasoning) source label without registered configuration ID | Gemma 4 31B | 28.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.1 Flash-Lite source label without registered configuration ID | Gemini 3.1 Flash-Lite | 28.0% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Grok 4.3 (high) source label without registered configuration ID | Grok 4.3 | 26.3% | CurrentArtificial Analysis independent evaluation | Score input source-checked | EnterpriseOps-Gym-AA Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|