LLM benchmarks and leaderboard
Compare benchmark results for 292 AI models across intelligence, coding, math, output speed, context windows, and API pricing. Scores are provided by Artificial Analysis and retain the reasoning configuration that was tested.
Catalogue refreshed 2026-09-04T01:12:13Z.
LLM benchmark leaderboard
| Rank | Model | Lab | Open | Configuration | Intelligence | Coding | Math | Output tokens/s | Input / output per 1M tokens | Context |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 | Anthropic | Closed | Adaptive Reasoning, Max Effort, Default Fallback | 65.7 | 81.6 | not measured | 70.3 | $5 / $25 | 1M |
| 2 | Claude Opus 5 | Anthropic | Closed | Adaptive Reasoning, Max Effort | 63.1 | 78.0 | not measured | 49.0 | $2.5 / $12.5 | 1M |
| 3 | Claude Fable 5 | Anthropic | Closed | Adaptive Reasoning, Max Effort, Opus 4.8 Fallback | 62.1 | 76.5 | not measured | 66.9 | $3 / $18.5 | 1M |
| 4 | Muse Spark 1.3 | Meta | Closed | max | 62.1 | 76.3 | not measured | 110.8 | $1.25 / $4.25 | 1.05M |
| 5 | GPT-5.6 Sol | OpenAI | Closed | max | 60.9 | 77.4 | not measured | 80.0 | $1 / $5 | 1.05M |
| 6 | Grok 4.6 | xAI | Closed | high | 60.9 | 76.8 | not measured | 59.9 | $2 / $6 | 5K |
| 7 | Kimi K3 | Moonshot AI | Open | max | 59.7 | 76.2 | not measured | 37.9 | $2 / $8 | 1.05M |
| 8 | GLM-5.3 | Z.AI | Open | max | 59.5 | 74.8 | not measured | 73.6 | $0.4 / $1.4 | 1M |
| 9 | Gemini 3.8 Flash | Closed | high | 58.7 | 76.3 | not measured | 311.5 | $0.375 / $1.88 | 1.05M | |
| 10 | Qwen3.8 Max | Alibaba | Open | default | 58.1 | 71.8 | not measured | 39.5 | $1.6 / $4.8 | 1M |
| 11 | Qwen3.8 2.4T A95B | Alibaba | Open | default | 57.7 | 71.9 | not measured | 40.2 | $2 / $6 | 262K |
| 12 | GLM-5.3-Flash | Z.AI | Open | default | 57.5 | 71.5 | not measured | 43.8 | $0.015 / $0.05 | 1M |
| 13 | Claude Opus 4.8 | Anthropic | Closed | Adaptive Reasoning, Max Effort | 57.3 | 74.3 | not measured | not measured | $0.425 / $2.12 | 1M |
| 14 | Muse Spark 1.2 | Meta | Closed | xhigh | 56.8 | 72.2 | not measured | 200.9 | $1.25 / $4.25 | 1.05M |
| 15 | GPT-5.6 Terra | OpenAI | Closed | max | 56.6 | 76.7 | not measured | 100.6 | $1.5 / $2 | 1.05M |
| 16 | GPT-5.5 | OpenAI | Closed | xhigh | 56.3 | 74.9 | not measured | not measured | $0.188 / $1.12 | 1.05M |
| 17 | Gemini 3.7 Flash | Closed | high | 56.0 | 76.1 | not measured | 291.9 | $0.375 / $1.88 | 1.05M | |
| 18 | Grok 4.5 | xAI | Closed | high | 55.8 | 72.4 | not measured | 50.5 | $2 / $6 | 5K |
| 19 | Qwen3.8 Flash Next | Alibaba | Open | default | 55.8 | 73.1 | not measured | 89.1 | $0.12 / $0.4 | 262K |
| 20 | Claude Sonnet 5 | Anthropic | Closed | Adaptive Reasoning, Max Effort | 55.3 | 71.5 | not measured | 78.2 | $1 / $5 | 1M |
| 21 | Claude Opus 4.7 | Anthropic | Closed | Adaptive Reasoning, Max Effort | 55.0 | 73.6 | not measured | not measured | $2.5 / $12.5 | 1M |
| 22 | DeepSeek V4 Pro 0813 | DeepSeek | Open | Reasoning, Max Effort | 53.2 | 68.8 | not measured | 66.9 | $0.35 / $0.8 | 1.05M |
| 23 | Muse Spark 1.1 | Meta | Closed | xhigh | 53.2 | 71.3 | not measured | not measured | $1.25 / $4.25 | 1.05M |
| 24 | GPT-5.4 | OpenAI | Closed | xhigh | 53.1 | 71.1 | not measured | not measured | $0.75 / $6 | 1.05M |
| 25 | GLM-5.2 | Z.AI | Open | max | 52.6 | 68.8 | not measured | 68.6 | $0.3 / $1.05 | 1M |
| 26 | GPT-5.6 Luna | OpenAI | Closed | max | 52.3 | 71.4 | not measured | 116.2 | $0.1 / $0.6 | 1.05M |
| 27 | Gemini 3.5 Flash | Closed | high | 52.0 | 70.1 | not measured | 250.6 | $0.186 / $1.11 | 1.05M | |
| 28 | Qwen3.8 27B | Alibaba | Open | xhigh | 52.0 | 68.1 | not measured | 42.9 | $0.1 / $0.4 | 262K |
| 29 | DeepSeek V4 Flash 0731 | DeepSeek | Open | Reasoning, Max Effort | 51.8 | 69.1 | not measured | 129.7 | $0.03 / $0.1 | 1M |
| 30 | Gemini 3.6 Flash | Closed | high | 51.6 | 69.2 | not measured | 187.8 | $0.375 / $1.88 | 1.05M | |
| 31 | Claude Sonnet 4.6 | Anthropic | Closed | Adaptive Reasoning, Max Effort | 48.4 | 63.0 | not measured | 44.6 | $0.9 / $5.55 | 1M |
| 32 | Gemini 3.1 Pro Preview | Closed | default | 47.7 | 68.8 | not measured | 117.4 | $1 / $6 | 1.05M | |
| 33 | Motif 3 | Motif Technologies | Closed | default | 47.4 | 63.5 | not measured | not measured | $0.5 / $2 | 262K |
| 34 | Qwen3.7 Max | Alibaba | Closed | default | 46.7 | 66.0 | not measured | not measured | $0.825 / $2.48 | 1M |
| 35 | GPT-5.3 Codex | OpenAI | Closed | xhigh | 45.5 | not measured | not measured | 126.0 | $1.6 / $13 | 4K |
| 36 | MiniMax-M3 | MiniMax | Open | default | 45.4 | 58.6 | not measured | 77.1 | $0.225 / $0.9 | 1.05M |
| 37 | DeepSeek V4 Pro | DeepSeek | Open | Reasoning, Max Effort | 45.3 | 59.4 | not measured | 67.8 | $0.348 / $0.696 | 1M |
| 38 | Kimi K2.6 | Moonshot AI | Open | default | 45.1 | 61.8 | not measured | not measured | $0.22 / $1.14 | 262K |
| 39 | Claude Opus 4.6 | Anthropic | Closed | Adaptive Reasoning, Max Effort | 44.9 | not measured | not measured | not measured | $2.5 / $12.5 | 1M |
| 40 | GPT-5.2 | OpenAI | Closed | xhigh | 43.3 | not measured | 99.0 | not measured | $0.25 / $2 | 4K |
| 41 | Kimi K2.7 Code | Moonshot AI | Open | default | 43.0 | 60.8 | not measured | 38.1 | $0.275 / $1.1 | 262K |
| 42 | MiMo-V2.5-Pro | Xiaomi | Open | default | 42.9 | 60.2 | not measured | 37.6 | $0.4 / $0.8 | 1.05M |
| 43 | Inkling | Thinking Machines | Open | xhigh | 42.3 | 52.1 | not measured | 70.5 | $0.95 / $4.05 | 1.05M |
| 44 | Hy3 | Tencent | Open | default | 42.2 | 58.8 | not measured | 92.5 | $0.132 / $0.528 | 262K |
| 45 | DeepSeek V4 Flash | DeepSeek | Open | Reasoning, Max Effort | 42.1 | 56.2 | not measured | not measured | $0.051 / $0.104 | 1M |
| 46 | Claude Opus 4.5 | Anthropic | Closed | Reasoning | 41.9 | not measured | 91.3 | not measured | $0.71 / $3.57 | 2K |
| 47 | Nex N2 Pro | NEX AGI | Open | default | 41.7 | 59.1 | not measured | 134.0 | $0.25 / $1 | 262K |
| 48 | Solar Pro 4 | Upstage | Closed | default | 41.6 | 52.7 | not measured | 53.6 | $0.03 / $0.12 | 524K |
| 49 | MiMo-V2-Pro | Xiaomi | Open | default | 41.4 | not measured | not measured | not measured | $0.435 / $0.87 | 1.05M |
| 50 | GPT-5.2 Codex | OpenAI | Closed | xhigh | 41.2 | not measured | not measured | not measured | $0.14 / $1.14 | 4K |
| 51 | Inkling Small | Thinking Machines | Open | default | 41.2 | 52.9 | not measured | 76.9 | $0.45 / $1.2 | 524K |
| 52 | Qwen3.6 Max Preview | Alibaba | Open | default | 41.1 | not measured | not measured | not measured | $1.03 / $6.16 | 262K |
| 53 | GLM-5.1 | Z.AI | Open | Reasoning | 41.0 | 55.8 | not measured | not measured | $0.45 / $2.15 | 2K |
| 54 | GPT-5.4 mini | OpenAI | Closed | xhigh | 40.9 | 56.1 | not measured | not measured | $0.375 / $2.25 | 4K |
| 55 | GLM-5 | Z.AI | Open | Reasoning | 40.6 | not measured | not measured | not measured | $0.6 / $1.92 | 203K |
| 56 | Gemini 3 Pro Preview | Closed | high | 40.6 | not measured | 95.7 | not measured | $0.57 / $3.43 | 1.05M | |
| 57 | Qwen3.6 Plus | Alibaba | Open | default | 40.5 | 54.5 | not measured | not measured | $0.276 / $1.65 | 1M |
| 58 | Agnes 2.5 Pro Alpha | Sapiens AI | Open | default | 39.7 | 58.8 | not measured | 196.1 | $0.45 / $0.9 | 1M |
| 59 | GPT-5.4 nano | OpenAI | Closed | xhigh | 39.7 | 56.1 | not measured | not measured | $0.1 / $0.625 | 4K |
| 60 | Qwen3.7 Plus | Alibaba | Closed | default | 39.4 | 55.9 | not measured | 56.4 | $0.282 / $1.13 | 1M |
| 61 | GLM-5-Turbo | Z.AI | Open | default | 39.1 | not measured | not measured | not measured | $0.72 / $3.2 | 2K |
| 62 | MiniMax-M2.7 | MiniMax | Open | default | 38.9 | 52.6 | not measured | not measured | $0.08 / $0.32 | 205K |
| 63 | Gemini 3 Flash Preview | Closed | Reasoning | 38.7 | not measured | 97.0 | not measured | $0.07 / $0.43 | 1.05M | |
| 64 | Nemotron 3 Ultra 550B A55B | NVIDIA | Open | Reasoning | 38.3 | 49.3 | not measured | 148.3 | $0.1 / $0.1 | 1.05M |
| 65 | MiMo-V2.5 | Xiaomi | Open | default | 38.0 | 56.8 | not measured | 58.3 | $0.14 / $0.28 | 1.05M |
| 66 | Grok 4.3 | xAI | Closed | high | 37.9 | 42.2 | not measured | 129.3 | $1.25 / $2.5 | 1M |
| 67 | Ling 3.0 Flash | InclusionAI | Open | default | 37.8 | 50.6 | not measured | 336.0 | $0.021 / $0.063 | 262K |
| 68 | Qwen3.6 27B | Alibaba | Open | Reasoning | 37.7 | 53.7 | not measured | 52.7 | $0.6 / $0.6 | 262K |
| 69 | GPT-5.1 | OpenAI | Closed | high | 37.5 | 49.4 | 94.0 | not measured | $0.625 / $5 | 4K |
| 70 | Claude Sonnet 4.5 | Anthropic | Closed | Reasoning | 37.4 | 52.1 | 88.0 | not measured | $0.43 / $2.14 | 2K |
| 71 | Gemini 3.5 Flash Lite | Closed | default | 37.4 | 49.3 | not measured | 364.4 | $0.15 / $1.25 | 1.05M | |
| 72 | GPT-5-Codex | OpenAI | Closed | high | 37.0 | not measured | 98.7 | not measured | $1.07 / $8.5 | 4K |
| 73 | Kimi K2.5 | Moonshot AI | Open | Reasoning | 36.0 | 46.8 | not measured | not measured | $0.3 / $1.9 | 262K |
| 74 | MiMo V2 Omni | Xiaomi | Open | default | 35.9 | not measured | not measured | not measured | $0.14 / $0.28 | 262K |
| 75 | GPT-5.1 Codex | OpenAI | Closed | high | 35.6 | not measured | 95.7 | not measured | $1.07 / $8.5 | 4K |
| 76 | GLM-5V-Turbo | Z.AI | Closed | Reasoning | 35.3 | not measured | not measured | not measured | $0.72 / $3.2 | 2K |
| 77 | GPT-5 | OpenAI | Closed | high | 35.3 | 37.8 | 94.3 | not measured | $0.625 / $5 | 4K |
| 78 | muse-glimmer | Meta | Closed | high | 35.1 | 49.0 | not measured | 108.3 | not published / not published | not published |
| 79 | Qwen3.5 27B | Alibaba | Open | Reasoning | 34.6 | not measured | not measured | not measured | $0.086 / $0.688 | 262K |
| 80 | Claude Opus 4.1 | Anthropic | Closed | Reasoning | 34.5 | not measured | 80.3 | not measured | $7.5 / $37.5 | 2K |
| 81 | GLM-4.7 | Z.AI | Open | Reasoning | 34.5 | 45.3 | 95.0 | not measured | $0.2 / $0.8 | 205K |
| 82 | MiniMax-M2.5 | MiniMax | Open | default | 34.5 | not measured | not measured | not measured | $0.22 / $0.88 | 205K |
| 83 | Hy3 preview | Tencent | Open | Reasoning | 34.4 | not measured | not measured | not measured | $0.066 / $0.26 | 262K |
| 84 | GPT-5.5 Instant | OpenAI | Closed | May 2026 | 34.3 | not measured | not measured | 148.0 | $5 / $30 | 4K |
| 85 | Qwen3.5 397B-A17B | Alibaba | Open | Reasoning | 34.3 | 48.2 | not measured | 92.0 | $0.172 / $1.03 | 262K |
| 86 | Grok 4 | xAI | Closed | default | 34.1 | not measured | 92.7 | not measured | $3 / $15 | 256K |
| 87 | LongCat-2.0 | Meituan | Open | default | 34.0 | 45.3 | not measured | 40.5 | $0.3 / $1.2 | 1.05M |
| 88 | MiMo-V2-Flash | Xiaomi | Open | Feb 2026 | 34.0 | not measured | not measured | not measured | $0.1 / $0.3 | 262K |
| 89 | Kat Coder Pro V2 | Kwaipilot | Closed | default | 33.7 | 59.5 | not measured | not measured | $0.3 / $1.2 | 262K |
| 90 | Kimi K2 Thinking | Moonshot AI | Open | default | 33.5 | not measured | 94.7 | not measured | $0.47 / $2 | 262K |
| 91 | o3-pro | OpenAI | Closed | default | 33.3 | not measured | not measured | not measured | $20 / $40 | 2K |
| 92 | DeepSeek V3.2 | DeepSeek | Open | Reasoning | 32.8 | 44.2 | 92.0 | not measured | $0.18 / $0.35 | 164K |
| 93 | Qwen3.5 122B-A10B | Alibaba | Open | Reasoning | 32.8 | 45.7 | not measured | 135.4 | $0.115 / $0.917 | 262K |
| 94 | Qwen 3 Max Thinking | Alibaba | Open | default | 32.5 | not measured | not measured | not measured | $0.78 / $3.9 | 256K |
| 95 | MiniMax-M2.1 | MiniMax | Open | default | 32.1 | not measured | 82.7 | not measured | $0.27 / $1.1 | 205K |
| 96 | Qwen3.6 35B-A3B | Alibaba | Open | Reasoning | 32.1 | 41.9 | not measured | 141.4 | $0.07 / $0.42 | 262K |
| 97 | Claude Opus 4 | Anthropic | Closed | Reasoning | 31.7 | not measured | 73.3 | not measured | $13 / $64 | 2K |
| 98 | Ring-2.6-1T | InclusionAI | Open | default | 31.7 | 42.8 | not measured | 128.9 | $0.3 / $2.5 | 262K |
| 99 | GPT-5 Mini | OpenAI | Closed | medium | 31.6 | not measured | 85.0 | not measured | $0.04 / $0.29 | 4K |
| 100 | DeepSeek V3.1 Terminus | DeepSeek | Open | Reasoning | 31.4 | 43.5 | 89.7 | not measured | $0.25 / $0.7 | 128K |
| 101 | GPT-5.1 Codex mini | OpenAI | Closed | high | 31.3 | not measured | 91.7 | not measured | $0.22 / $1.8 | 4K |
| 102 | Grok 4.1 Fast | xAI | Closed | Reasoning | 31.3 | not measured | 89.3 | not measured | $0.2 / $0.5 | 2M |
| 103 | Qwen3.5 Omni Plus | Alibaba | Closed | default | 31.3 | not measured | not measured | 125.8 | free / free | 984K |
| 104 | o3 | OpenAI | Closed | default | 31.1 | not measured | 88.3 | 128.7 | $1 / $4 | 2K |
| 105 | Step 3.7 Flash | StepFun | Open | default | 30.9 | 39.6 | not measured | 101.9 | $0.185 / $1.11 | 256K |
| 106 | Mistral Medium 3.5 | Mistral | Open | default | 30.4 | 46.9 | not measured | 124.9 | $0.75 / $3.75 | 262K |
| 107 | Claude Haiku 4.5 | Anthropic | Closed | Reasoning | 29.9 | 43.9 | 83.7 | 100.2 | $0.14 / $0.71 | 2K |
| 108 | Qwen3.5 35B-A3B | Alibaba | Open | Reasoning | 29.9 | not measured | not measured | 157.3 | $0.057 / $0.459 | 262K |
| 109 | Claude Sonnet 4 | Anthropic | Closed | Reasoning | 29.8 | 37.6 | 74.3 | not measured | $2.6 / $13 | 2K |
| 110 | Gemma 4 31B | Open | Reasoning | 29.7 | 43.4 | not measured | 35.2 | $0.102 / $0.297 | 262K | |
| 111 | GLM-4.6 | Z.AI | Open | Reasoning | 29.3 | 45.8 | 86.0 | not measured | $0.286 / $1.14 | 205K |
| 112 | KAT-Coder-Pro V1 | Kwaipilot | Closed | default | 28.9 | not measured | 94.7 | not measured | $0.3 / $1.2 | 256K |
| 113 | MiniMax-M2 | MiniMax | Open | default | 28.9 | not measured | 78.3 | not measured | $0.2 / $1 | 205K |
| 114 | Grok 4 Fast | xAI | Closed | Reasoning | 27.9 | not measured | 89.7 | not measured | $0.2 / $0.5 | 2M |
| 115 | Claude 3.7 Sonnet | Anthropic | Closed | Reasoning | 27.6 | 36.4 | 56.3 | not measured | $2.6 / $13 | 2K |
| 116 | Ling-2.6-1T | InclusionAI | Open | default | 26.6 | not measured | not measured | not measured | $0.3 / $2.5 | 262K |
| 117 | Step 3.5 Flash 2603 | StepFun | Open | default | 26.5 | not measured | not measured | not measured | $0.1 / $0.3 | 256K |
| 118 | Gemma 4 26B A4B | Open | Reasoning | 26.1 | 39.3 | not measured | 68.8 | $0.042 / $0.22 | 262K | |
| 119 | o4-mini | OpenAI | Closed | high | 26.1 | not measured | 90.7 | not measured | $0.55 / $2.2 | 2K |
| 120 | Step 3.5 Flash | StepFun | Open | default | 26.0 | not measured | not measured | not measured | $0.09 / $0.3 | 256K |
| 121 | DeepSeek V3.2 Exp | DeepSeek | Open | Reasoning | 25.9 | not measured | 87.7 | not measured | $0.22 / $0.33 | 164K |
| 122 | Gemini 2.5 Pro | Closed | default | 25.9 | 33.3 | 87.7 | not measured | $0.625 / $5 | 1.05M | |
| 123 | Nemotron 3 Super 120B A12B | NVIDIA | Open | Reasoning | 25.7 | 37.7 | not measured | 141.6 | $0.085 / $0.4 | 262K |
| 124 | Gemini 3.1 Flash Lite | Closed | default | 25.6 | 34.7 | not measured | not measured | $0.125 / $0.75 | 1.05M | |
| 125 | Qwen3 Max | Alibaba | Closed | default | 24.5 | not measured | 80.7 | not measured | $0.36 / $1.43 | 262K |
| 126 | ling-3.0-tiny | InclusionAI | Closed | default | 24.5 | 26.5 | not measured | 206.2 | free / free | 262K |
| 127 | Gemini 2.5 Flash Preview | Closed | Sep '25, Reasoning | 24.2 | not measured | 78.3 | not measured | $0.15 / $0.6 | 1.05M | |
| 128 | GPT OSS 120B | OpenAI | Open | high | 24.1 | 30.4 | 93.4 | 151.6 | $0.039 / $0.1 | 131K |
| 129 | o1 | OpenAI | Closed | default | 23.9 | 39.7 | not measured | not measured | $14 / $54 | 2K |
| 130 | Nemotron 3.5 Lightning | NVIDIA | Open | default | 23.6 | 26.8 | not measured | 283.5 | $0.05 / $0.2 | 1M |
| 131 | GLM-4.7-Flash | Z.AI | Open | Reasoning | 23.3 | not measured | not measured | not measured | $0.06 / $0.4 | 2K |
| 132 | Command A Plus | Cohere | Open | default | 22.8 | 27.8 | not measured | 259.1 | $2.5 / $10 | 128K |
| 133 | DeepSeek-V3.2-Speciale | DeepSeek | Open | default | 22.6 | not measured | 96.7 | not measured | $0.58 / $1.68 | 128K |
| 134 | Ernie 5.0 Thinking Preview | Baidu | Closed | default | 22.3 | not measured | 85.0 | not measured | $1 / $3.5 | 128K |
| 135 | Gemma 4 12B Instruct | Open | Reasoning | 22.2 | 31.0 | not measured | 131.1 | $0.05 / $0.25 | 262K | |
| 136 | Grok Code Fast 1 | xAI | Closed | default | 22.0 | not measured | 43.3 | not measured | $0.18 / $1.35 | 256K |
| 137 | Mercury 2 | Inception | Closed | default | 21.9 | 31.1 | not measured | 854.3 | $0.25 / $0.75 | 128K |
| 138 | Qwen3.5 9B | Alibaba | Open | Reasoning | 21.8 | 28.7 | not measured | 84.6 | $0.04 / $0.15 | 262K |
| 139 | DeepSeek V3.1 | DeepSeek | Open | Non-reasoning | 21.4 | not measured | 49.7 | not measured | $0.2 / $0.7 | 164K |
| 140 | Qwen3 Coder Next | Alibaba | Open | default | 21.3 | 36.2 | not measured | 111.6 | $0.108 / $0.675 | 262K |
| 141 | Qwen3 VL 235B A22B | Alibaba | Open | Reasoning | 20.9 | not measured | 88.3 | not measured | $0.2 / $0.88 | 131K |
| 142 | DeepSeek R1 0528 | DeepSeek | Open | May '25 | 20.4 | not measured | 76.0 | not measured | $0.4 / $1.7 | 164K |
| 143 | Qwen3.5 4B | Alibaba | Open | Reasoning | 20.4 | 22.6 | not measured | 21.0 | $0.04 / $0.07 | 262K |
| 144 | Gemini 2.5 Flash | Closed | Reasoning | 20.3 | not measured | 73.3 | not measured | $0.09 / $0.71 | 1.05M | |
| 145 | North Mini Code | Cohere | Open | default | 20.2 | 36.5 | not measured | 81.4 | free / free | 256K |
| 146 | GPT-5 Nano | OpenAI | Closed | high | 20.1 | not measured | 83.7 | not measured | $0.025 / $0.2 | 4K |
| 147 | Qwen 3 235b A22B 2507 | Alibaba | Open | Reasoning | 19.9 | 22.1 | 91.0 | not measured | $0.072 / $0.464 | 262K |
| 148 | GLM-4.5 | Z.AI | Open | Reasoning | 19.7 | not measured | 73.7 | not measured | $0.286 / $1.14 | 131K |
| 149 | Kimi K2 | Moonshot AI | Open | default | 19.7 | not measured | 57.0 | not measured | $0.4 / $1.8 | 131K |
| 150 | Mistral Small 4 | Mistral | Open | Reasoning | 19.7 | 26.6 | not measured | 152.8 | $0.143 / $0.568 | 256K |
| 151 | GPT-4.1 | OpenAI | Closed | default | 19.6 | not measured | 34.7 | not measured | $1 / $4 | 1.05M |
| 152 | Granite 4.2 8B | IBM | Open | default | 19.6 | 22.4 | not measured | 148.7 | $0.1 / $0.15 | 131K |
| 153 | Devstral 2 | Mistral | Open | default | 19.2 | 31.3 | 36.7 | 126.1 | $0.4 / $2 | 262K |
| 154 | Qwen3.5 Omni Flash | Alibaba | Closed | default | 19.2 | not measured | not measured | 224.3 | free / free | 49K |
| 155 | o3-mini | OpenAI | Closed | default | 19.2 | not measured | not measured | not measured | $0.55 / $2.2 | 2K |
| 156 | o1-pro | OpenAI | Closed | default | 19.1 | not measured | not measured | not measured | $140 / $540 | 2K |
| 157 | Trinity Large Thinking | Arcee AI | Open | default | 18.7 | 25.8 | not measured | 320.4 | $0.25 / $0.8 | 262K |
| 158 | DeepSeek-R1 | DeepSeek | Open | Jan '25 | 18.6 | 24.6 | 68.0 | not measured | $0.4 / $1.7 | 128K |
| 159 | Grok 3 | xAI | Closed | default | 18.6 | not measured | 58.0 | not measured | $3 / $15 | 131K |
| 160 | Qwen3 235B A22B Instruct 2507 | Alibaba | Open | default | 18.4 | not measured | 71.7 | not measured | $0.087 / $0.35 | 262K |
| 161 | Qwen3 Coder 480B A35B Instruct | Alibaba | Open | default | 18.2 | not measured | 39.3 | not measured | $0.38 / $1.55 | 262K |
| 162 | Sonar Reasoning Pro | Perplexity | Closed | default | 18.0 | not measured | not measured | not measured | $2 / $8 | 128K |
| 163 | MiniMax M1 80K | MiniMax | Closed | default | 17.9 | not measured | 61.0 | not measured | $0.605 / $2.42 | 1M |
| 164 | Devstral Small 2 | Mistral | Open | default | 17.7 | 29.3 | 34.3 | 124.8 | $0.1 / $0.3 | 256K |
| 165 | GLM-4.6V | Z.AI | Open | Reasoning | 16.9 | not measured | 85.3 | not measured | $0.14 / $0.42 | 131K |
| 166 | Qwen3-Next 80B-A3B (Thinking) | Alibaba | Open | Reasoning | 16.9 | 17.4 | 84.3 | 188.5 | $0.15 / $0.65 | 131K |
| 167 | GLM-4.5-Air | Z.AI | Open | default | 16.7 | not measured | 80.7 | not measured | $0.114 / $0.286 | 131K |
| 168 | Ring-1T | InclusionAI | Open | default | 16.3 | not measured | 89.3 | not measured | $0.56 / $2.24 | 128K |
| 169 | Mistral Large 3 | Mistral | Open | default | 15.9 | 20.1 | 38.0 | 72.6 | $0.5 / $1.5 | 262K |
| 170 | intellect-3 | Prime Intellect | Closed | default | 15.7 | not measured | 88.0 | not measured | not published / not published | not published |
| 171 | DeepSeek V3 0324 | DeepSeek | Open | default | 15.2 | 21.2 | 41.0 | not measured | $0.2 / $0.8 | 164K |
| 172 | GPT OSS 20B | OpenAI | Open | high | 15.2 | 20.7 | 89.3 | 127.7 | $0.02 / $0.1 | 131K |
| 173 | Gemini 2.5 Flash Lite Preview | Closed | Sep '25, Reasoning | 15.2 | not measured | 68.7 | not measured | $0.15 / $0.6 | 1.05M | |
| 174 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | Open | default | 15.0 | 13.8 | not measured | 329.0 | $0.2 / $0.8 | 262K |
| 175 | Mistral Small 3.1 | Mistral | Closed | default | 14.9 | 26.3 | 3.7 | not measured | $0.1 / $0.3 | 128K |
| 176 | GPT-4.1 mini | OpenAI | Closed | default | 14.8 | 20.2 | 46.3 | not measured | $0.2 / $0.8 | 1.05M |
| 177 | Mistral Medium 3.1 | Mistral | Closed | default | 14.7 | 20.5 | 38.3 | not measured | $0.4 / $2 | 131K |
| 178 | Qwen3 30B A3B 2507 | Alibaba | Open | Reasoning | 14.6 | 12.1 | 56.3 | not measured | free / free | 262K |
| 179 | Llama 4 Maverick | Meta | Open | default | 14.5 | 16.3 | 19.3 | 82.9 | $0.15 / $0.6 | 1.05M |
| 180 | Nemotron 3 Nano 30B A3B | NVIDIA | Open | Reasoning | 14.5 | 14.4 | 91.0 | 219.3 | $0.05 / $0.2 | 262K |
| 181 | Solar Pro 3 | Upstage | Closed | default | 14.5 | 16.2 | not measured | 145.0 | $0.25 / $0.25 | 131K |
| 182 | Qwen3 VL 235B A22B Instruct | Alibaba | Open | default | 14.4 | not measured | 70.7 | not measured | $0.2 / $0.88 | 262K |
| 183 | DeepSeek V3 | DeepSeek | Open | Dec '24 | 14.2 | 23.0 | 26.0 | not measured | $0.32 / $0.89 | 164K |
| 184 | Ling-2.6-flash | InclusionAI | Open | default | 14.2 | 25.3 | not measured | not measured | $0.1 / $0.3 | 262K |
| 185 | Qwen3-Next 80B-A3B Instruct | Alibaba | Open | default | 13.8 | not measured | 66.3 | 184.0 | $0.144 / $0.574 | 131K |
| 186 | Qwen3-Coder 30B-A3B Instruct | Alibaba | Open | default | 13.6 | not measured | 29.0 | not measured | $0.06 / $0.25 | 262K |
| 187 | DiffusionGemma 26B-A4B IT | Closed | default | 13.5 | 19.7 | not measured | not measured | $0.5 / $0.5 | 262K | |
| 188 | Qwen3 235B-A22B | Alibaba | Open | Reasoning | 13.5 | not measured | 82.0 | not measured | $0.13 / $0.6 | 131K |
| 189 | QwQ 32B | Alibaba | Open | default | 13.4 | not measured | 29.0 | not measured | $0.4 / $0.4 | 131K |
| 190 | Qwen3-VL 30B-A3B | Alibaba | Open | Reasoning | 13.4 | not measured | 82.3 | not measured | $0.108 / $0.431 | 262K |
| 191 | Ling-1T | InclusionAI | Open | default | 12.7 | not measured | 71.3 | not measured | $0.56 / $2.24 | 128K |
| 192 | Mistral Medium 3 | Mistral | Closed | default | 12.5 | not measured | 30.3 | not measured | $0.4 / $2 | 131K |
| 193 | Solar Pro 2 | Upstage | Closed | Preview, Reasoning | 12.5 | not measured | not measured | not measured | $0.25 / $0.25 | 66K |
| 194 | Celeris 1 | Celeris | Closed | default | 12.4 | 14.4 | not measured | 2046.9 | $2 / $6 | 8K |
| 195 | GPT-4o | OpenAI | Closed | March 2025, chatgpt-4o-latest | 12.3 | not measured | 25.7 | not measured | $1.25 / $5 | 128K |
| 196 | Claude 3.5 Haiku | Anthropic | Closed | default | 12.2 | 15.9 | not measured | not measured | $0.68 / $3.4 | 2K |
| 197 | Gemini 2.0 Flash | Closed | Feb '25 | 12.2 | not measured | 21.7 | not measured | $0.1 / $0.42 | 1.05M | |
| 198 | Gemma 4 E4B Instruct | Open | Reasoning | 12.2 | 9.4 | not measured | 34.1 | $0.04 / $0.2 | 33K | |
| 199 | Llama 3.3 Nemotron Super 49B v1 | NVIDIA | Open | Reasoning | 12.2 | not measured | 54.7 | not measured | free / free | 131K |
| 200 | MiniCPM5-1B | OpenBMB | Open | Reasoning | 11.9 | not measured | not measured | not measured | $0.124 / $0.743 | 131K |
| 201 | Sarvam 105B | Sarvam | Open | high | 11.9 | not measured | not measured | not measured | $0.04 / $0.16 | 131K |
| 202 | Magistral Small 1.2 | Mistral | Open | default | 11.5 | 14.7 | 80.3 | not measured | $0.5 / $1.5 | 128K |
| 203 | Gemini 2.5 Flash-Lite | Closed | Reasoning | 11.4 | not measured | 53.3 | not measured | $0.1 / $0.1 | 1.05M | |
| 204 | Qwen3 32B | Alibaba | Open | Reasoning | 11.4 | 15.3 | 73.0 | not measured | $0.09 / $0.25 | 131K |
| 205 | Ministral 3 14B | Mistral | Open | default | 11.2 | 14.4 | 30.0 | 97.0 | $0.2 / $0.2 | 262K |
| 206 | DeepSeek R1 Distill Qwen 32B | DeepSeek | Open | default | 11.0 | not measured | 63.0 | not measured | $0.3 / $0.3 | 8K |
| 207 | LFM2.5 2.6B | Liquid AI | Open | default | 11.0 | 7.7 | not measured | 1914.3 | $0.1 / $0.2 | 128K |
| 208 | Qwen3 VL 32B Instruct | Alibaba | Open | default | 11.0 | not measured | 68.3 | not measured | $0.104 / $0.416 | 131K |
| 209 | Mistral Small 3.2 | Mistral | Open | default | 10.7 | 12.5 | 27.0 | not measured | $0.075 / $0.2 | 128K |
| 210 | Qwen3 14B | Alibaba | Open | Reasoning | 10.4 | 13.8 | 55.7 | not measured | $0.05 / $0.22 | 131K |
| 211 | DeepSeek R1 0528 Qwen3 8B | DeepSeek | Open | default | 10.3 | not measured | 63.7 | not measured | $0.06 / $0.09 | 128K |
| 212 | Llama 4 Scout | Meta | Open | default | 10.3 | 8.2 | 14.0 | 98.5 | $0.1 / $0.3 | 1.31M |
| 213 | Qwen 2.5 Max | Alibaba | Closed | default | 10.1 | not measured | not measured | not measured | $1.6 / $6.39 | 32K |
| 214 | Qwen3 VL 30B A3B Instruct | Alibaba | Closed | default | 9.9 | not measured | 72.3 | not measured | $0.15 / $0.6 | 262K |
| 215 | Claude 3.5 Sonnet | Anthropic | Closed | Oct '24 | 9.8 | 30.2 | not measured | not measured | $2.6 / $13 | 2K |
| 216 | DeepSeek R1 Distill Llama 70B | DeepSeek | Open | default | 9.8 | not measured | 53.7 | not measured | $0.03 / $0.13 | 131K |
| 217 | DeepSeek R1 Distill Qwen 14B | DeepSeek | Open | default | 9.7 | not measured | 55.7 | not measured | $0.15 / $0.15 | 33K |
| 218 | GPT-4.1 nano | OpenAI | Closed | default | 9.6 | 11.1 | 24.0 | not measured | $0.05 / $0.2 | 1.05M |
| 219 | Ling-flash-2.0 | InclusionAI | Closed | default | 9.6 | not measured | 65.3 | not measured | $0.14 / $0.57 | 131K |
| 220 | Gemma 4 E2B Instruct | Open | Reasoning | 9.5 | 7.2 | not measured | not measured | $0.02 / $0.1 | 131K | |
| 221 | Qwen2.5 72B | Alibaba | Open | default | 9.4 | not measured | 14.0 | not measured | $0.11 / $0.38 | 131K |
| 222 | Sonar | Perplexity | Closed | default | 9.4 | not measured | not measured | not measured | $1 / $1 | 128K |
| 223 | Llama 3.3 70B | Meta | Open | default | 9.3 | 11.9 | 7.7 | 85.6 | $0.05 / $0.23 | 128K |
| 224 | Qwen3 30B A3B | Alibaba | Open | Reasoning | 9.2 | not measured | 72.3 | not measured | $0.08 / $0.29 | 41K |
| 225 | Sonar Pro | Perplexity | Closed | default | 9.1 | not measured | not measured | not measured | $3 / $15 | 2K |
| 226 | GLM-4.5V | Z.AI | Open | Reasoning | 9.0 | not measured | 73.0 | not measured | $0.29 / $0.86 | 66K |
| 227 | Ministral 3 8B | Mistral | Open | default | 9.0 | 9.7 | 31.7 | 113.5 | $0.15 / $0.15 | 262K |
| 228 | ERNIE 4.5 300B A47B | Baidu | Open | default | 8.9 | not measured | 41.3 | not measured | $0.28 / $1.1 | 131K |
| 229 | Qwen3 30B A3B Instruct 2507 | Alibaba | Open | default | 8.9 | not measured | 66.3 | not measured | $0.048 / $0.193 | 262K |
| 230 | llama-3.1-nemotron-ultra-253b-v1 | NVIDIA | Closed | Reasoning | 8.9 | not measured | 63.7 | 52.9 | $0.598 / $1.79 | 128K |
| 231 | Nemotron Nano 12B v2 VL | NVIDIA | Open | Reasoning | 8.8 | not measured | 75.0 | 39.9 | $0.2 / $0.6 | 128K |
| 232 | Nemotron Nano 9B V2 | NVIDIA | Open | Reasoning | 8.7 | not measured | 69.7 | 100.5 | $0.06 / $0.23 | 131K |
| 233 | Gemini 2.0 Flash Lite | Closed | Feb '25 | 8.6 | not measured | not measured | not measured | $0.052 / $0.21 | 2M | |
| 234 | Llama 3.1 405B Instruct | Meta | Open | default | 8.3 | not measured | 3.0 | not measured | $1.95 / $1.95 | 128K |
| 235 | Qwen3 8B | Alibaba | Open | Reasoning | 8.3 | 9.0 | 19.0 | not measured | $0.035 / $0.138 | 131K |
| 236 | Qwen3 4B | Alibaba | Open | Reasoning | 8.2 | not measured | 22.3 | not measured | $0.03 / $0.03 | 128K |
| 237 | Qwen3 VL 8B Instruct | Alibaba | Open | default | 8.2 | not measured | 27.3 | not measured | $0.117 / $0.455 | 262K |
| 238 | Pixtral Large (25.02) | Mistral | Closed | default | 8.0 | not measured | 2.3 | not measured | $1.99 / $5.98 | 128K |
| 239 | ring-flash-2.0 | InclusionAI | Closed | default | 8.0 | not measured | 83.7 | not measured | not published / not published | not published |
| 240 | GPT-4 Turbo | OpenAI | Closed | default | 7.7 | 21.5 | not measured | not measured | $5 / $15 | 128K |
| 241 | Command A | Cohere | Open | default | 7.5 | not measured | 13.0 | 56.5 | $2.5 / $10 | 256K |
| 242 | Nova Pro | Amazon | Closed | default | 7.5 | not measured | 7.0 | not measured | $0.56 / $2.13 | 3K |
| 243 | Gemma 3 27B | Open | default | 7.4 | 10.1 | 20.7 | not measured | $0.08 / $0.16 | 131K | |
| 244 | Llama 3.1 8B | Meta | Open | default | 7.4 | 5.4 | 4.3 | not measured | $0.025 / $0.025 | 131K |
| 245 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | Open | default | 7.4 | not measured | 11.0 | 34.5 | $0.6 / $0.6 | 131K |
| 246 | Qwen3.5 2B | Alibaba | Open | Reasoning | 7.4 | 2.9 | not measured | not measured | $0.02 / $0.1 | 262K |
| 247 | Qwen2.5 32B Instruct | Alibaba | Open | default | 7.2 | not measured | not measured | not measured | $0.287 / $0.861 | 131K |
| 248 | Ministral 3 3B | Mistral | Open | default | 7.1 | 4.8 | 22.0 | 208.1 | $0.1 / $0.1 | 256K |
| 249 | Qwen2.5 Coder 32B | Alibaba | Open | default | 6.9 | not measured | not measured | not measured | $0.06 / $0.2 | 33K |
| 250 | GPT-4 | OpenAI | Closed | default | 6.8 | 13.1 | not measured | not measured | $30 / $60 | 8K |
| 251 | GPT-4o mini | OpenAI | Closed | default | 6.7 | 11.4 | 14.7 | not measured | $0.075 / $0.3 | 128K |
| 252 | Mistral Small 3 | Mistral | Open | default | 6.7 | not measured | 4.3 | not measured | $0.05 / $0.08 | 33K |
| 253 | Nova Lite | Amazon | Closed | default | 6.7 | not measured | 7.0 | not measured | $0.06 / $0.24 | 3K |
| 254 | Llama 3.1 70B | Meta | Open | default | 6.5 | not measured | 4.0 | not measured | $0.4 / $0.4 | 128K |
| 255 | Granite 4.1 8B | IBM | Open | default | 6.4 | 9.5 | not measured | 105.7 | $0.05 / $0.1 | 131K |
| 256 | Sarvam 30B | Sarvam | Open | high | 6.4 | not measured | not measured | not measured | $0.02 / $0.1 | 128K |
| 257 | DeepSeek R1 Distill Llama 8B | DeepSeek | Closed | default | 6.2 | not measured | 41.3 | not measured | free / free | 33K |
| 258 | Saba | Mistral | Open | default | 6.2 | not measured | not measured | not measured | $0.199 / $0.595 | 33K |
| 259 | solar-mini | Upstage | Closed | default | 6.0 | not measured | not measured | not measured | $0.15 / $0.15 | 33K |
| 260 | Phi-4-mini | Microsoft | Open | default | 5.7 | 3.8 | 6.7 | 46.5 | $0.075 / $0.3 | 128K |
| 261 | Gemma 3 12B | Open | default | 5.5 | 5.8 | 18.3 | not measured | $0.05 / $0.1 | 131K | |
| 262 | Qwen3.5 0.8B | Alibaba | Open | Reasoning | 5.2 | 0.0 | not measured | not measured | $0.06 / $0.12 | 262K |
| 263 | Granite-4.0-H-Small | IBM | Open | default | 4.9 | not measured | 13.7 | 41.6 | $0.064 / $0.265 | 131K |
| 264 | Qwen3 Omni 30B A3B Instruct | Alibaba | Open | default | 4.8 | not measured | 52.3 | 105.2 | $0.25 / $0.97 | 66K |
| 265 | LFM2 24B A2B | Liquid AI | Open | default | 4.6 | not measured | not measured | not measured | $0.03 / $0.12 | 33K |
| 266 | Phi 4 | Microsoft | Open | default | 4.6 | not measured | 18.0 | 40.7 | $0.07 / $0.14 | 128K |
| 267 | Nova Micro | Amazon | Closed | default | 4.4 | not measured | 6.0 | 248.9 | $0.03 / $0.1 | 128K |
| 268 | Mistral Small (latest) | Mistral | Open | Sep '24 | 4.3 | not measured | not measured | not measured | $0.1 / $0.3 | 256K |
| 269 | Phi 4 Multimodal | Microsoft | Open | default | 4.2 | not measured | not measured | 24.5 | $0.07 / $0.11 | 128K |
| 270 | Mistral Large | Mistral | Open | Feb '24 | 4.1 | not measured | not measured | not measured | $0.5 / $1.5 | 262K |
| 271 | Qwen2.5-Coder 7B Instruct | Alibaba | Open | default | 4.1 | not measured | not measured | not measured | $0.144 / $0.287 | 131K |
| 272 | Mixtral 8x22B | Mistral | Open | default | 4.0 | not measured | not measured | not measured | $2 / $6 | 66K |
| 273 | Llama 3.2 3B | Meta | Open | default | 3.9 | not measured | 3.3 | not measured | $0.02 / $0.02 | 131K |
| 274 | Reka Flash 3 | Reka | Open | default | 3.7 | not measured | 33.7 | 90.2 | $0.1 / $0.2 | 66K |
| 275 | Claude 3 Haiku | Anthropic | Closed | default | 3.5 | not measured | not measured | not measured | $0.21 / $1.1 | 2K |
| 276 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | Closed | default | 3.3 | not measured | 22.0 | not measured | free / free | 33K |
| 277 | GPT-3.5-turbo | OpenAI | Closed | default | 3.2 | 10.7 | not measured | not measured | $0.25 / $0.75 | 16K |
| 278 | Mistral Medium (latest) | Mistral | Open | default | 3.2 | not measured | not measured | not measured | $0.4 / $2 | 262K |
| 279 | Llama 3 70B Instruct | Meta | Open | default | 3.1 | not measured | not measured | not measured | $0.51 / $0.74 | 8K |
| 280 | Llama 3.2 11B Instruct | Meta | Open | Vision | 3.0 | not measured | 1.7 | 24.0 | $0.07 / $0.33 | 128K |
| 281 | Command R+ | Cohere | Open | Apr '24 | 2.6 | not measured | not measured | not measured | $2.5 / $10 | 128K |
| 282 | sarvam-m | Sarvam AI | Open | Reasoning | 2.6 | not measured | not measured | not measured | free / free | 128K |
| 283 | Apertus 70B | Swiss AI Initiative | Open | default | 2.0 | not measured | not measured | not measured | $0.46 / $2.42 | 66K |
| 284 | Granite 4.0 Micro | IBM | Open | default | 2.0 | not measured | 6.0 | not measured | $0.017 / $0.112 | 131K |
| 285 | Mixtral 8x7B | Mistral | Open | default | 2.0 | not measured | not measured | not measured | $0.7 / $0.7 | 32K |
| 286 | Command R | Cohere | Open | Mar '24 | 1.7 | not measured | not measured | not measured | $0.15 / $0.6 | 128K |
| 287 | Apertus 8B Instruct | Swiss AI Initiative | Open | default | 1.0 | not measured | not measured | not measured | $0.1 / $0.2 | 66K |
| 288 | Gemma 3 4B | Open | default | 1.0 | 2.7 | 12.7 | not measured | $0.04 / $0.08 | 131K | |
| 289 | Gemma 3N E4B Instruct | Open | default | 1.0 | 3.2 | 14.3 | not measured | $0.06 / $0.12 | 33K | |
| 290 | Gemma 3n E2b It | Open | default | 1.0 | not measured | 10.3 | not measured | free / free | 128K | |
| 291 | Llama 3 8B Instruct | Meta | Open | default | 1.0 | not measured | not measured | not measured | $0.04 / $0.04 | 8K |
| 292 | Llama 3.2 1B | Meta | Open | default | 1.0 | not measured | 0.0 | not measured | $0.01 / $0.01 | 6K |
How to read these LLM benchmarks
The Artificial Analysis Intelligence, Coding and Math indices are reported on a 0–100 scale. A model can have several evaluated reasoning settings; the leaderboard uses its highest Intelligence configuration and shows the speed measured for that same run when available. Missing measurements are never treated as zero.