LLM Leaderboard

Modelos de peso aberto (Llama, Qwen, DeepSeek, Mistral…) classificados lado a lado com a fronteira proprietária (GPT, Claude, Gemini, Grok) — preços ao vivo, contexto, benchmarks e capacidades. Sem marketing — apenas os fatos.

Dados ao vivo Carregando…
🕐 Máquina do tempo
#ModelCreatorIntelligenceCoding
1Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic59.976.5
2GPT-5.6 Sol (max)OpenAI58.977.4
3Kimi K3Kimi57.176.2
4Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic55.774.3
5GPT-5.6 Terra (max)OpenAI55.076.7
6GPT-5.5 (xhigh)OpenAI54.874.9
7Grok 4.5 (high)SpaceXAI53.872.4
8Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic53.573.6
9Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic53.471.5
10GPT-5.4 (xhigh)OpenAI51.471.1
11GPT-5.6 Luna (max)OpenAI51.271.4
12GLM-5.2 (max)Z AI51.168.8
13Muse Spark 1.1 (xhigh)Meta50.671.3
14Gemini 3.5 Flash (high)Google50.270.1
15Gemini 3.6 Flash (high)Google50.169.2
16Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic47.263.0
17Gemini 3.1 Pro PreviewGoogle46.568.8
18Qwen3.7 MaxAlibaba46.066.0
19MiniMax-M3MiniMax44.458.6
20DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek44.359.4
21GPT-5.3 Codex (xhigh)OpenAI44.3
22Kimi K2.6Kimi44.261.8
23Motif 3 (Beta)Motif Technologies44.162.0
24Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic43.7
25Muse SparkMeta43.158.6
26GPT-5.2 (xhigh)OpenAI42.2
27MiMo-V2.5-ProXiaomi42.260.2
28Kimi K2.7 CodeKimi41.960.8
29Hy3Tencent41.258.8
30Nex-N2-ProNex AGI41.059.1
31Claude Opus 4.5 (Reasoning)Anthropic40.8
32Inkling (xhigh)Thinking Machines40.752.1
33DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek40.356.2
34MiMo-V2-ProXiaomi40.3
35GLM-5.1 (Reasoning)Z AI40.255.8
36GPT-5.2 Codex (xhigh)OpenAI40.1
37GPT-5.4 mini (xhigh)OpenAI40.056.1
38Qwen3.6 Max PreviewAlibaba40.0
39Grok Build 0.1 0616SpaceXAI39.851.5
40Gemini 3 Pro Preview (high)Google39.6
41Qwen3.6 PlusAlibaba39.654.5
42GLM-5 (Reasoning)Z AI39.5
43Qwen3.7 PlusAlibaba39.055.9
44JT-4.1 Flash 236B A21BChina Mobile38.852.4
45GPT-5.4 nano (xhigh)OpenAI38.256.1
46GLM-5-TurboZ AI38.1
47MiniMax-M2.7MiniMax38.152.6
48Gemini 3 Flash Preview (Reasoning)Google37.8
49Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA37.849.3
50Grok 4.3 (high)SpaceXAI37.642.2
51MiMo-V2.5Xiaomi37.256.8
52Qwen3.6 27B (Reasoning)Alibaba37.153.7
53Grok 4.20 0309 v2 (Reasoning)SpaceXAI37.0
54GPT-5.1 (high)OpenAI36.949.4
55Gemini 3.5 Flash-LiteGoogle36.549.3
56Grok 4.20 0309 (Reasoning)SpaceXAI36.5
57Claude 4.5 Sonnet (Reasoning)Anthropic36.452.1
58MiMo-V2-Omni-0327Xiaomi36.4
59GPT-5 Codex (high)OpenAI36.1
60Kimi K2.5 (Reasoning)Kimi35.446.8
Carregando a classificação…

Como isso é classificado: modelos são ordenados pela popularidade de uso real (tokens semanais processados em aplicativos), via API OpenRouter. Apenas peso aberto modelos estão incluídos (Llama, DeepSeek, Qwen, Mistral, Gemma, Kimi, GLM, Phi, Nemotron, e mais). O preço é por milhão de tokens; o contexto é a janela máxima. As setas de movimento comparam a classificação de hoje com a captura anterior. Os dados são atualizados diariamente.