Open-Weight-Modelle (Llama, Qwen, DeepSeek, Mistral…) im Vergleich zu den proprietären Modellen (GPT, Claude, Gemini, Grok) — Live-Preise, Kontext, Benchmarks und Fähigkeiten. Keine Werbung — nur die Fakten.
| # | Model | Creator | Intelligence | Coding |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 59.9 | 76.5 |
| 2 | GPT-5.6 Sol (max) | OpenAI | 58.9 | 77.4 |
| 3 | Kimi K3 | Kimi | 57.1 | 76.2 |
| 4 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 55.7 | 74.3 |
| 5 | GPT-5.6 Terra (max) | OpenAI | 55.0 | 76.7 |
| 6 | GPT-5.5 (xhigh) | OpenAI | 54.8 | 74.9 |
| 7 | Grok 4.5 (high) | SpaceXAI | 53.8 | 72.4 |
| 8 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 53.5 | 73.6 |
| 9 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 53.4 | 71.5 |
| 10 | GPT-5.4 (xhigh) | OpenAI | 51.4 | 71.1 |
| 11 | GPT-5.6 Luna (max) | OpenAI | 51.2 | 71.4 |
| 12 | GLM-5.2 (max) | Z AI | 51.1 | 68.8 |
| 13 | Muse Spark 1.1 (xhigh) | Meta | 50.6 | 71.3 |
| 14 | Gemini 3.5 Flash (high) | 50.2 | 70.1 | |
| 15 | Gemini 3.6 Flash (high) | 50.1 | 69.2 | |
| 16 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 47.2 | 63.0 |
| 17 | Gemini 3.1 Pro Preview | 46.5 | 68.8 | |
| 18 | Qwen3.7 Max | Alibaba | 46.0 | 66.0 |
| 19 | MiniMax-M3 | MiniMax | 44.4 | 58.6 |
| 20 | DeepSeek V4 Pro (Reasoning, Max Effort) | DeepSeek | 44.3 | 59.4 |
| 21 | GPT-5.3 Codex (xhigh) | OpenAI | 44.3 | — |
| 22 | Kimi K2.6 | Kimi | 44.2 | 61.8 |
| 23 | Motif 3 (Beta) | Motif Technologies | 44.1 | 62.0 |
| 24 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 43.7 | — |
| 25 | Muse Spark | Meta | 43.1 | 58.6 |
| 26 | GPT-5.2 (xhigh) | OpenAI | 42.2 | — |
| 27 | MiMo-V2.5-Pro | Xiaomi | 42.2 | 60.2 |
| 28 | Kimi K2.7 Code | Kimi | 41.9 | 60.8 |
| 29 | Hy3 | Tencent | 41.2 | 58.8 |
| 30 | Nex-N2-Pro | Nex AGI | 41.0 | 59.1 |
| 31 | Claude Opus 4.5 (Reasoning) | Anthropic | 40.8 | — |
| 32 | Inkling (xhigh) | Thinking Machines | 40.7 | 52.1 |
| 33 | DeepSeek V4 Flash (Reasoning, Max Effort) | DeepSeek | 40.3 | 56.2 |
| 34 | MiMo-V2-Pro | Xiaomi | 40.3 | — |
| 35 | GLM-5.1 (Reasoning) | Z AI | 40.2 | 55.8 |
| 36 | GPT-5.2 Codex (xhigh) | OpenAI | 40.1 | — |
| 37 | GPT-5.4 mini (xhigh) | OpenAI | 40.0 | 56.1 |
| 38 | Qwen3.6 Max Preview | Alibaba | 40.0 | — |
| 39 | Grok Build 0.1 0616 | SpaceXAI | 39.8 | 51.5 |
| 40 | Gemini 3 Pro Preview (high) | 39.6 | — | |
| 41 | Qwen3.6 Plus | Alibaba | 39.6 | 54.5 |
| 42 | GLM-5 (Reasoning) | Z AI | 39.5 | — |
| 43 | Qwen3.7 Plus | Alibaba | 39.0 | 55.9 |
| 44 | JT-4.1 Flash 236B A21B | China Mobile | 38.8 | 52.4 |
| 45 | GPT-5.4 nano (xhigh) | OpenAI | 38.2 | 56.1 |
| 46 | GLM-5-Turbo | Z AI | 38.1 | — |
| 47 | MiniMax-M2.7 | MiniMax | 38.1 | 52.6 |
| 48 | Gemini 3 Flash Preview (Reasoning) | 37.8 | — | |
| 49 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 37.8 | 49.3 |
| 50 | Grok 4.3 (high) | SpaceXAI | 37.6 | 42.2 |
| 51 | MiMo-V2.5 | Xiaomi | 37.2 | 56.8 |
| 52 | Qwen3.6 27B (Reasoning) | Alibaba | 37.1 | 53.7 |
| 53 | Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 37.0 | — |
| 54 | GPT-5.1 (high) | OpenAI | 36.9 | 49.4 |
| 55 | Gemini 3.5 Flash-Lite | 36.5 | 49.3 | |
| 56 | Grok 4.20 0309 (Reasoning) | SpaceXAI | 36.5 | — |
| 57 | Claude 4.5 Sonnet (Reasoning) | Anthropic | 36.4 | 52.1 |
| 58 | MiMo-V2-Omni-0327 | Xiaomi | 36.4 | — |
| 59 | GPT-5 Codex (high) | OpenAI | 36.1 | — |
| 60 | Kimi K2.5 (Reasoning) | Kimi | 35.4 | 46.8 |
So wird das eingestuft: Modelle sind nach der Beliebtheit der realen Nutzung (wöchentliche Tokens, die über Apps verarbeitet werden) über die OpenRouter API geordnet. Nur offene Modelle sind enthalten (Llama, DeepSeek, Qwen, Mistral, Gemma, Kimi, GLM, Phi, Nemotron und mehr). Die Preise gelten pro Million Tokens; der Kontext ist das maximale Fenster. Bewegungs-Pfeile vergleichen den heutigen Rang mit dem vorherigen Snapshot. Daten werden täglich aktualisiert.