Die Spitze ist ein Plateau — und eines der vier ist open weights
Claude Opus 5, Claude Fable 5, GPT-5.6 Sol und Kimi K3 liegen innerhalb von 3,6 Punkten voneinander in Bezug auf Intelligenz. Ihre Ausgabepreise variieren um 3,3×. Diese Lücke zwischen Fähigkeit und Preis ist die ganze Geschichte.
TL;DR — die kurze Version
Claude Opus 5 führt in beiden Indizes und kostet die Hälfte von dem, was Claude Fable 5 kostet. Das Flaggschiff von Anthropic ist nicht das beste Modell von Anthropic nach diesen Maßstäben.
Kimi K3 ist open-weight und liegt 3.6 Punkte hinter dem Führenden, bei 30 % des Ausgabepreises von Fable 5. Bei 15 $ pro Million Ausgabetokens kostet es genau so viel wie GPT-5.6 Terra — und erzielt 2,1 Punkte mehr.
Der Preis folgt nicht mehr der Fähigkeit an der Spitze. Wählen Sie nach Latenz, Lizenz und Kontextfenster, denn dort unterscheiden sich diese vier wirklich.
Die Zahlen, heute Morgen
Alles Folgende stammt aus unserer täglichen Benchmark-Fusion, die von Artificial Analysis bezogen und jeden Morgen neu erstellt wird. Zwei zusammengesetzte Indizes — Intelligenz und Programmierung — plus den Durchsatz und Preis, die wir selbst verfolgen. Keine Schätzungen, keine Aufrundungen.
| Modell | Intelligenz | Programmierung | $ / 1M aus | Tokens / s | Gewichte |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | Geschlossen |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | Geschlossen |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | Geschlossen |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | Offen |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | Geschlossen |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | Geschlossen |
| DeepSeek V4 Flash | 40.3 | 56.2 | $0.28 | 125.4 | Offen |
Lesen Sie die oberen vier Zeilen erneut. Die Spanne von Kimi K3 zu Opus 5 beträgt 3,6 Punkte Intelligenz — etwa sechs Prozent. Die Spanne im Ausgabepreis über diese vier Modelle beträgt 15 $ bis 50 $.Die Fähigkeit hat sich komprimiert; die Preise nicht.
Das Flaggschiff von Anthropic ist nicht sein bestes Modell
Claude Fable 5 ist das Modell, das Anthropic vorstellt, und es ist das teuerste der sieben mit 50 $ pro Million Ausgabetokens. Claude Opus 5 schlägt es in beiden Indizes — 60,7 gegen 59,9 in der Intelligenz, 78,0 gegen 76,5 in der Programmierung — zum halben Preis.
Opus 5 ist auch schneller beim ersten Token: 31 Sekunden gegenüber 80. Bei einem langen agentischen Lauf summiert sich dieser Unterschied.
Es gibt einen Vorbehalt, den man klar aussprechen sollte: Fable 5 läuft mit einer adaptiven Denk-Konfiguration und einem Opus 4.8-Backup, sodass die beiden keine identischen Produkte sind. Aber bei den Zahlen, die ein Käufer tatsächlich vergleicht — Punktzahl, Preis, Latenz — gewinnt das günstigere Modell in allen drei Kategorien.
Ein Open-Weights-Modell erreicht jetzt OpenAIs Mittelklasse, zum gleichen Preis
Kimi K3 von Moonshot AI wird mit open weights geliefert. Es erzielt 57.1 in der Intelligenz. GPT-5.6 Terra erzielt 55.0. Beide kosten $15 pro Million Ausgabetokens.
Das ist der Satz, für den diese Seite erstellt wurde. Ein open-weight Modell, das Sie herunterladen und selbst ausführen können, übertrifft ein geschlossenes Mid-Tier-Modell zum identischen Preis. Vor zwei Jahren wurde die offene Lücke in Generationen gemessen; hier liegt es 3.6 Punkte hinter dem absoluten Führenden.
GPT-5.6 sind vier Modelle, nicht eines
“GPT-5.6” bezeichnet eine Familie, und die Varianten sind weit auseinander. Sol erzielt 58,9 bei 30 $. Terra erzielt 55,0 bei 15 $. Luna erzielt 51,2 bei 6 $.
Lesen Sie das als eine Leiter und nicht als eine Aufstellung: Jeder Schritt nach unten kostet halb so viel und gibt drei bis vier Punkte auf.Luna kostet ein Fünftel von Sol’s Preis für 87 % seines Intelligenzscores und ist das schnellste hier mit 220 Tokens pro Sekunde. Für Klassifikation, Extraktion oder Zusammenfassung bedeutet die Zahlung für Sol, dass Sie für Spielraum bezahlen, den Sie nicht nutzen werden.
Was das Ranking nicht sagt
Opus 5 erzielt 89.1 auf Terminal-Bench und 93.2 auf GPQA.Es erzielt auch 30.3 auf τ-Bench Banking.Das bestplatzierte Modell der Welt löst ungefähr ein Drittel einer realistischen Bankagentenaufgabe richtig.
Zusammengesetzte Indizes gleichen genau diese Art von Varianz aus. Ein Modell, das bei Terminalarbeiten hervorragend und bei mehrstufigem Tool-Einsatz mittelmäßig ist, sieht wie eine einzelne Zahl aus, und diese Zahl wird nicht vorhersagen, wie es sich bei Ihrer Aufgabe verhält. Testen Sie mit Ihrer eigenen Arbeitslast, bevor Sie sich festlegen.
Das Gleiche gilt für die Zeit bis zum ersten Token, die keiner dieser Indizes berücksichtigt. DeepSeek V4 Flash antwortet in unter einer Sekunde.Kimi K3 benötigt 126 Sekunden zum Start. Für eine Chat-Oberfläche sind das unterschiedliche Produkte, egal was ihre Scores sagen.
Wie man auswählt
Schwierigste Argumentation, Kosten sekundär. Claude Opus 5. Es führt beide Indizes an und unterbietet Fable 5 um die Hälfte.
Sie wollen Geschwindigkeit über alles. GPT-5.6 Luna mit 220 Tokens pro Sekunde oder DeepSeek V4 Flash, wenn sub-sekündliche Latenz wichtiger ist als die letzten zehn Punkte des Scores.
Sie benötigen die Gewichte. Kimi K3 — für Nachvollziehbarkeit, lokale Bereitstellung oder weil eine Lizenzänderung in einer geschlossenen API ein Risiko darstellt, das Sie nicht tragen können. Sie akzeptieren die Durchsatzstrafe wissentlich.
Hohe Volumen, gewöhnliche Aufgaben. DeepSeek V4 Flash. Bei $0.28 pro Million Ausgabetokens ist es 179 Mal günstiger als Fable 5 und viermal schneller. Es erzielt zwei Drittel so gut, was für Extraktion und Klassifikation ausreicht.
Diese Zahlen ändern sich jeden Morgen
Preise, Kontextfenster und Benchmark-Indizes für über 500 Modelle, täglich neu erstellt. Kostenlos, keine Anmeldung.
Öffnen Sie den Vergleich →Das Fazit
Die Grenze hat sich abgeflacht. Wenn vier Modelle innerhalb von sechs Prozent ihrer Fähigkeiten liegen, während ihre Preise sich um 3.3× erstrecken, hört das Ranking auf, ein Einkaufsführer zu sein. Was sie noch trennt, ist Durchsatz, Latenz, Kontextfenster und ob Sie die Gewichte behalten dürfen.
Und die offene Seite dieser Tabelle ist kein Kompromiss mehr, den Sie Ihrem Vorstand erklären müssen. Es ist eine Zeile, 3.6 Punkte tiefer, bei 30 % des Preises.