LLM Leaderboard

Open-Weight-Modelle (Llama, Qwen, DeepSeek, Mistral…) im Vergleich zu den proprietären Modellen (GPT, Claude, Gemini, Grok) — Live-Preise, Kontext, Benchmarks und Fähigkeiten. Keine Werbung — nur die Fakten.

Live-Daten Lade…
🕐 Zeitmaschine
#ModelCreatorIntelligenceCoding
1Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic59.976.5
2GPT-5.6 Sol (max)OpenAI58.977.4
3Kimi K3Kimi57.176.2
4Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic55.774.3
5GPT-5.6 Terra (max)OpenAI55.076.7
6GPT-5.5 (xhigh)OpenAI54.874.9
7Grok 4.5 (high)SpaceXAI53.872.4
8Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic53.573.6
9Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic53.471.5
10GPT-5.4 (xhigh)OpenAI51.471.1
11GPT-5.6 Luna (max)OpenAI51.271.4
12GLM-5.2 (max)Z AI51.168.8
13Muse Spark 1.1 (xhigh)Meta50.671.3
14Gemini 3.5 Flash (high)Google50.270.1
15Gemini 3.6 Flash (high)Google50.169.2
16Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic47.263.0
17Gemini 3.1 Pro PreviewGoogle46.568.8
18Qwen3.7 MaxAlibaba46.066.0
19MiniMax-M3MiniMax44.458.6
20DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek44.359.4
21GPT-5.3 Codex (xhigh)OpenAI44.3
22Kimi K2.6Kimi44.261.8
23Motif 3 (Beta)Motif Technologies44.162.0
24Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic43.7
25Muse SparkMeta43.158.6
26GPT-5.2 (xhigh)OpenAI42.2
27MiMo-V2.5-ProXiaomi42.260.2
28Kimi K2.7 CodeKimi41.960.8
29Hy3Tencent41.258.8
30Nex-N2-ProNex AGI41.059.1
31Claude Opus 4.5 (Reasoning)Anthropic40.8
32Inkling (xhigh)Thinking Machines40.752.1
33DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek40.356.2
34MiMo-V2-ProXiaomi40.3
35GLM-5.1 (Reasoning)Z AI40.255.8
36GPT-5.2 Codex (xhigh)OpenAI40.1
37GPT-5.4 mini (xhigh)OpenAI40.056.1
38Qwen3.6 Max PreviewAlibaba40.0
39Grok Build 0.1 0616SpaceXAI39.851.5
40Gemini 3 Pro Preview (high)Google39.6
41Qwen3.6 PlusAlibaba39.654.5
42GLM-5 (Reasoning)Z AI39.5
43Qwen3.7 PlusAlibaba39.055.9
44JT-4.1 Flash 236B A21BChina Mobile38.852.4
45GPT-5.4 nano (xhigh)OpenAI38.256.1
46GLM-5-TurboZ AI38.1
47MiniMax-M2.7MiniMax38.152.6
48Gemini 3 Flash Preview (Reasoning)Google37.8
49Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA37.849.3
50Grok 4.3 (high)SpaceXAI37.642.2
51MiMo-V2.5Xiaomi37.256.8
52Qwen3.6 27B (Reasoning)Alibaba37.153.7
53Grok 4.20 0309 v2 (Reasoning)SpaceXAI37.0
54GPT-5.1 (high)OpenAI36.949.4
55Gemini 3.5 Flash-LiteGoogle36.549.3
56Grok 4.20 0309 (Reasoning)SpaceXAI36.5
57Claude 4.5 Sonnet (Reasoning)Anthropic36.452.1
58MiMo-V2-Omni-0327Xiaomi36.4
59GPT-5 Codex (high)OpenAI36.1
60Kimi K2.5 (Reasoning)Kimi35.446.8
Lade die Rangliste…

So wird das eingestuft: Modelle sind nach der Beliebtheit der realen Nutzung (wöchentliche Tokens, die über Apps verarbeitet werden) über die OpenRouter API geordnet. Nur offene Modelle sind enthalten (Llama, DeepSeek, Qwen, Mistral, Gemma, Kimi, GLM, Phi, Nemotron und mehr). Die Preise gelten pro Million Tokens; der Kontext ist das maximale Fenster. Bewegungs-Pfeile vergleichen den heutigen Rang mit dem vorherigen Snapshot. Daten werden täglich aktualisiert.