| Qwen3.8-Flash-Next (Artificial Analysis independent run) qwen-3-8-flash-next-aa-unspecified | Qwen3.8-Flash-Next | 45.4% | 3Artificial Analysis tau3-Banking evaluation | Public reference · not scored independently-verified | Qwen3.8-Flash-Next individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) (Artificial Analysis independent run) claude-opus-4-7-max | Claude Opus 4.7 | 34.6% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| GLM-5.2 (max) (Artificial Analysis independent run) glm-5-2-max | GLM-5.2 | 34.6% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GLM-5.2 (max) individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Qwen3.5 122B A10B (Reasoning) (Artificial Analysis completed independent run) qwen3-5-122b-a10b-aa-reasoning-default | Qwen3.5-122B-A10B | 15.3% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Qwen3.5 122B A10B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Mistral Medium 3.5 (Artificial Analysis completed independent run) mistral-medium-3-5-128b-aa-reasoning-default | Mistral Medium 3.5 128B | 15.1% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Mistral Medium 3.5 current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Kimi K2.5 (Reasoning) (Artificial Analysis completed independent run) kimi-k2-5-thinking | Kimi K2.5 | 14.2% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Kimi K2.5 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Qwen3.5 397B A17B (Reasoning) (Artificial Analysis completed independent run) qwen3-5-397b-thinking | Qwen3.5 397B A17B | 13.4% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Qwen3.5 397B A17B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| LongCat 2.0 (Artificial Analysis independent run) longcat-2-0-default | LongCat-2.0 | 13.2% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | LongCat 2.0 individual evaluations ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Gemma 4 26B A4B (Reasoning) (Artificial Analysis completed independent run) gemma-4-26b-a4b-aa-reasoning-default | Gemma 4 26B A4B | 12.0% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Gemma 4 26B A4B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Qwen3.6 35B A3B (Reasoning) (Artificial Analysis completed independent run) qwen3-6-35b-a3b-aa-reasoning-default | Qwen3.6-35B-A3B | 9.3% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Qwen3.6 35B A3B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) (Artificial Analysis completed independent run) nemotron-3-nano-30b-aa-reasoning-default | Nemotron 3 Nano 30B | 6.0% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Trinity Large Thinking (Artificial Analysis completed independent run) trinity-large-thinking-aa-reasoning-default | Trinity-Large-Thinking | 5.8% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Trinity Large Thinking current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| GPT-4.1 mini (Artificial Analysis completed independent run) gpt-4-1-mini-epoch-gpt-4-1-mini-2025-04-14 | GPT-4.1 mini | 5.4% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-4.1 mini current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Mistral Small 4 (Reasoning) (Artificial Analysis completed independent run) mistral-small-4-reasoning | Mistral Small 4 | 4.9% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Mistral Small 4 (Reasoning) current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Llama 4 Maverick (Artificial Analysis completed independent run) llama-4-maverick-aa-non-reasoning-default | Llama 4 Maverick | 3.7% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Llama 4 Maverick current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| GPT-4.1 nano (Artificial Analysis completed independent run) gpt-4-1-nano-epoch-gpt-4-1-nano-2025-04-14 | GPT-4.1 nano | 3.5% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-4.1 nano current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Llama 4 Scout (Artificial Analysis completed independent run) llama-4-scout-aa-non-reasoning-default | Llama 4 Scout | 3.3% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Llama 4 Scout current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Gemma 3 27B Instruct (Artificial Analysis completed independent run) gemma-3-27b-aa-non-reasoning-default | Gemma 3 27B | 0.8% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Gemma 3 27B Instruct current model and individual-evaluation page ↗Observed 2026-08-29 · checked 2026-08-29 |
|---|
| Grok 4.6 (high; Artificial Analysis independent run) grok-4-6-high | Grok 4.6 | 50.7% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Grok 4.6 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GLM-5.3 (max; Artificial Analysis independent run) glm-5-3-max | GLM-5.3 | 50.3% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GLM-5.3 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GLM-5.3-Flash (max; Artificial Analysis independent run) glm-5-3-flash-max | GLM-5.3-Flash | 47.2% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GLM-5.3-Flash individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Kimi K3 (max; Artificial Analysis independent run) kimi-k3-max | Kimi K3 | 46.0% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Kimi K3 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GPT-5.6 Sol (max; Artificial Analysis independent run) gpt-5-6-sol-max | GPT-5.6 Sol | 44.3% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-5.6 Sol individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Claude Opus 5 (max; Artificial Analysis independent run) claude-opus-5-max | Claude Opus 5 | 42.1% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Claude Opus 5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Grok 4.5 (high; Artificial Analysis independent run) grok-4-5-aa-2-high | Grok 4.5 | 42.1% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Grok 4.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| DeepSeek V4 Flash Vision Exp (max; Artificial Analysis independent run) deepseek-v4-flash-vision-exp-max-harness | DeepSeek V4 Flash Vision Exp | 41.0% | 3Artificial Analysis tau3-Banking evaluation | Public reference · not scored independently-verified | DeepSeek V4 Flash Vision Exp individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GPT-5.6 Terra (max; Artificial Analysis independent run) gpt-5-6-terra-max | GPT-5.6 Terra | 40.2% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-5.6 Terra individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| DeepSeek V4 Pro 0813 (max; Artificial Analysis independent run) deepseek-v4-pro-0813-max | DeepSeek V4 Pro 0813 | 39.6% | 3Artificial Analysis tau3-Banking evaluation | Public reference · not scored independently-verified | DeepSeek V4 Pro 0813 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GPT-5.4 (xhigh; Artificial Analysis independent run) gpt-5-4-xhigh | GPT-5.4 | 39.6% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-5.4 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GPT-5.5 (xhigh; Artificial Analysis independent run) gpt-5-5-xhigh | GPT-5.5 | 39.0% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-5.5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Claude Fable 5 (max; Artificial Analysis independent run) claude-fable-5-max | Claude Fable 5 | 38.1% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Claude Fable 5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Claude Sonnet 5 (max; Artificial Analysis independent run) claude-sonnet-5-max | Claude Sonnet 5 | 37.3% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Claude Sonnet 5 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Gemini 3.7 Flash (medium; Artificial Analysis independent run) gemini-3-7-flash-medium | Gemini 3.7 Flash | 35.5% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Gemini 3.7 Flash individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Muse Spark 1.2 (xhigh; Artificial Analysis independent run) muse-spark-1-2-xhigh | Muse Spark 1.2 | 34.8% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Muse Spark 1.2 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Claude Opus 4.8 (max; Artificial Analysis independent run) claude-opus-4-8-max | Claude Opus 4.8 | 34.2% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Claude Opus 4.8 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Muse Spark 1.1 (xhigh; Artificial Analysis independent run) muse-spark-1-1-xhigh | Muse Spark 1.1 | 31.8% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Muse Spark 1.1 individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| GPT-5.6 Luna (max; Artificial Analysis independent run) gpt-5-6-luna-max | GPT-5.6 Luna | 31.1% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | GPT-5.6 Luna individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| Gemini 3.6 Flash (high; Artificial Analysis independent run) gemini-3-6-flash-high | Gemini 3.6 Flash | 29.9% | 3Artificial Analysis tau3-Banking evaluation | Score input independently-verified | Gemini 3.6 Flash individual evaluations ↗Observed 2026-08-27 · checked 2026-08-27 |
|---|
| DeepSeek V4 Flash max as published by Upstage deepseek-v4-flash-max | DeepSeek V4 Flash | 22.3% | bankingSolar Open 2 card English table | Relative comparison · not standard direct provider-reported | Solar Open 2 250B model card ↗Observed 2026-08-15 · checked 2026-08-15 |
|---|
| Solar Open 2 250B (high) solar-open2-250b-high | Solar Open 2 250B | 19.6% | bankingSolar Open 2 card English table | Score input provider-reported | Solar Open 2 250B model card ↗Observed 2026-08-15 · checked 2026-08-15 |
|---|
| MiMo-V2.5 as published by Upstage mimo-v2-5-solar-open2-unspecified | MiMo-V2.5 | 8.7% | bankingSolar Open 2 card English table | Relative comparison · not standard direct provider-reported | Solar Open 2 250B model card ↗Observed 2026-08-15 · checked 2026-08-15 |
|---|
| Solar Open 100B as published by Upstage solar-open-100b-reasoning-high | Solar Open 100B (Reasoning) | 7.4% | bankingSolar Open 2 card English table | Relative comparison · not standard direct provider-reported | Solar Open 2 250B model card ↗Observed 2026-08-15 · checked 2026-08-15 |
|---|
| Command A+ as published by Upstage command-a-plus-solar-open2-unspecified | Command A+ | 5.8% | bankingSolar Open 2 card English table | Relative comparison · not standard direct provider-reported | Solar Open 2 250B model card ↗Observed 2026-08-15 · checked 2026-08-15 |
|---|
| Mistral Medium 3.5 as published by Upstage mistral-medium-3-5-high | Mistral Medium 3.5 | 5.8% | bankingSolar Open 2 card English table | Relative comparison · not standard direct provider-reported | Solar Open 2 250B model card ↗Observed 2026-08-15 · checked 2026-08-15 |
|---|
| NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16; NVIDIA release evaluation; temperature=1.0; top_p=0.95 nemotron-3-5-lightning-30b-a3b-default | NVIDIA Nemotron 3.5 Lightning 30B-A3B | 9.3% | 3NVIDIA NeMo Gym / NeMo Evaluator SDK consistent release harness | Score input provider-reported | NVIDIA Nemotron 3.5 Lightning 30B-A3B BF16 model card ↗Observed 2026-08-11 · checked 2026-08-12 |
|---|
| Muse Glimmer-30B; high reasoning; temperature=1.0; top_p=0.95; top_k=64 muse-glimmer-30b-high | Muse Glimmer 30B | 23.5% | 3 / BankingArtificial Analysis τ³-Banking documented evaluation | Public reference · not scored provider-reported | Muse Glimmer Evaluation Methodology ↗Observed 2026-08-10 · checked 2026-08-10 |
|---|
| Artificial Analysis τ³-Banking independent evaluation. source label without registered configuration ID | Gemini 3.6 Flash | 24.5% | 3Artificial Analysis evaluation harness | Public reference · not scored source-checked | Gemini 3.6 Flash (Artificial Analysis) ↗Observed 2026-07-21 · checked 2026-07-21 |
|---|
| Artificial Analysis τ³-Banking independent evaluation. source label without registered configuration ID | Gemini 3.5 Flash-Lite | 16.5% | 3Artificial Analysis evaluation harness | Public reference · not scored source-checked | Gemini 3.5 Flash-Lite (Artificial Analysis) ↗Observed 2026-07-21 · checked 2026-07-21 |
|---|
| Kimi K3; Artificial Analysis τ³-Banking evaluation. source label without registered configuration ID | Kimi K3 | 33.4% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | Kimi K3 Intelligence, Performance & Price Analysis ↗Observed 2026-07-20 · checked 2026-07-21 |
|---|
| Muse Spark 1.1 (xhigh); Artificial Analysis independent evaluation configuration as published. muse-spark-1-1-xhigh | Muse Spark 1.1 | 25.2% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | Muse Spark 1.1 (xhigh) analysis ↗Observed 2026-07-16 · checked 2026-07-16 |
|---|
| GPT-5.6 Sol (max) gpt-5-6-sol-max | GPT-5.6 Sol | 33.0% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Grok 4.5 (high) source label without registered configuration ID | Grok 4.5 | 32.6% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.6 Terra (max) gpt-5-6-terra-max | GPT-5.6 Terra | 31.8% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.5 (xhigh) gpt-5-5-xhigh | GPT-5.5 | 31.3% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) claude-sonnet-4-6-max | Claude Sonnet 4.6 | 30.5% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 (xhigh) gpt-5-4-xhigh | GPT-5.4 | 30.3% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Opus 4.7 (Adaptive Reasoning, Max Effort) claude-opus-4-7-max | Claude Opus 4.7 | 28.9% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) claude-sonnet-5-max | Claude Sonnet 5 | 28.2% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Opus 4.8 (Adaptive Reasoning, Max Effort) claude-opus-4-8-max | Claude Opus 4.8 | 27.6% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.6 Luna (max) gpt-5-6-luna-max | GPT-5.6 Luna | 27.2% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-5.2 (max) glm-5-2-max | GLM-5.2 | 26.8% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) claude-fable-5-max | Claude Fable 5 | 26.8% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V4 Pro (Reasoning, Max Effort) deepseek-v4-pro-max | DeepSeek V4 Pro | 25.8% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.5 Flash (high) gemini-3-5-flash-high | Gemini 3.5 Flash | 25.4% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Muse Spark 1.1 (xhigh) muse-spark-1-1-xhigh | Muse Spark 1.1 | 25.2% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V4 Flash (Reasoning, Max Effort) deepseek-v4-flash-max | DeepSeek V4 Flash | 22.9% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 mini (xhigh) gpt-5-4-mini-xhigh | GPT-5.4 mini | 21.4% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.4 nano (xhigh) gpt-5-4-nano-xhigh | GPT-5.4 nano | 21.0% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Kimi K2.6 source label without registered configuration ID | Kimi K2.6 | 20.6% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Muse Spark source label without registered configuration ID | Muse Spark | 19.6% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5 (high) gpt-5-high | GPT-5 | 19.6% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude 4.5 Sonnet (Reasoning) source label without registered configuration ID | Claude Sonnet 4.5 | 19.0% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V3.2 (Reasoning) source label without registered configuration ID | DeepSeek V3.2 | 18.8% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Kimi K2.7 Code source label without registered configuration ID | Kimi K2.7 Code | 18.1% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.7 Plus source label without registered configuration ID | Qwen3.7-Plus | 17.9% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3 Flash Preview (Reasoning) source label without registered configuration ID | Gemini 3 Flash | 17.5% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.1 Pro Preview source label without registered configuration ID | Gemini 3.1 Pro Preview | 16.5% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.6 Plus source label without registered configuration ID | Qwen3.6 Plus | 16.5% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| DeepSeek V3.1 Terminus (Reasoning) source label without registered configuration ID | DeepSeek V3.1 Terminus | 15.9% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.6 27B (Reasoning) source label without registered configuration ID | Qwen3.6 27B | 15.3% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemma 4 31B (Reasoning) source label without registered configuration ID | Gemma 4 31B | 15.1% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Mistral Medium 3.5 source label without registered configuration ID | Mistral Medium 3.5 | 14.4% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Kimi K2.5 (Reasoning) source label without registered configuration ID | Kimi K2.5 | 14.2% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GPT-5.1 (high) gpt-5-1-high | GPT-5.1 | 14.0% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Nemotron 3 Ultra 550B A55B (Reasoning) source label without registered configuration ID | Nemotron 3 Ultra | 13.8% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude 4 Sonnet (Reasoning) source label without registered configuration ID | Claude Sonnet 4 | 13.8% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.5 122B A10B (Reasoning) source label without registered configuration ID | Qwen3.5 122B | 13.6% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.5 397B A17B (Reasoning) source label without registered configuration ID | Qwen3.5 397B A17B | 13.4% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiniMax-M3 source label without registered configuration ID | MiniMax M3 | 13.0% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Grok 4.3 (high) source label without registered configuration ID | Grok 4.3 | 12.2% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemma 4 26B A4B (Reasoning) source label without registered configuration ID | Gemma 4 26B | 11.8% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-5.1 (Reasoning) source label without registered configuration ID | GLM-5.1 | 11.5% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Qwen3.7 Max source label without registered configuration ID | Qwen3.7-Max | 10.9% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-4.6 (Reasoning) source label without registered configuration ID | GLM-4.6 | 10.5% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| NVIDIA Nemotron 3 Super 120B A12B (Reasoning) source label without registered configuration ID | Nemotron 3 Super | 10.1% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| GLM-4.7 (Reasoning) source label without registered configuration ID | GLM-4.7 | 9.7% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 2.5 Pro source label without registered configuration ID | Gemini 2.5 Pro | 9.3% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Claude 4.5 Haiku (Reasoning) source label without registered configuration ID | Claude Haiku 4.5 | 9.1% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiniMax-M2.7 source label without registered configuration ID | MiniMax M2.7 | 8.9% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Gemini 3.1 Flash-Lite source label without registered configuration ID | Gemini 3.1 Flash-Lite | 8.7% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiMo-V2.5-Pro source label without registered configuration ID | MiMo-V2.5-Pro | 8.7% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Nova 2.0 Pro Preview (medium) source label without registered configuration ID | Nova 2 Pro | 7.6% | 3Artificial Analysis independent evaluation | Score input source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| MiMo-V2.5 source label without registered configuration ID | MiMo-V2.5 | 6.6% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Mistral Large 3 source label without registered configuration ID | Mistral Large 3 | 5.8% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Command A+ source label without registered configuration ID | Command A+ | 5.8% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|
| Mistral Small 4 (Reasoning) source label without registered configuration ID | Mistral Small 4 | 5.2% | 3Artificial Analysis independent evaluation | Public reference · not scored source-checked | τ³-Banking Leaderboard ↗Observed 2026-07-15 · checked 2026-07-15 |
|---|