Welches GPT-5.6-Niveau? Die falsche Frage
Sol, Terra und Luna wurden am selben Tag zu Preisen von 30 $, 15 $ und 6 $ pro Million Ausgabetokens veröffentlicht. Bei maximalem Aufwand liegen sie 7,7 Intelligenzpunkte auseinander. Die sechs Anstrengungsstufen innerhalb von Luna allein liegen 24,6 Punkte auseinander.
TL;DR — die kurze Version
GPT-5.6 ist nicht ein Modell, und auch nicht drei. Es sind drei Stufen, die jeweils sechs Aufwandsebenen offenbaren — achtzehn gemessene Konfigurationen unter einem Namen.
Die Stufe legt Ihren Einheitspreis fest. Die Aufwandsebene legt fast alles andere fest.
Über die drei Stufen hinweg bei maximalem Aufwand spannt der Intelligenzindex 7,7 Punkte. Innerhalb der billigsten Stufe allein spannt er 24,6.
Maximaler Aufwand ist nicht immer die beste Einstellung: Sol bei xhigh erzielt 78,3 in Codierung im Vergleich zu 77,4 bei max und beginnt 48,96 Sekunden früher zu antworten.
Drei Stufen, ein Veröffentlichungsdatum
Alle drei GPT-5.6 Stufen haben dasselbe Veröffentlichungsdatum, den 9. Juli 2026. Sie unterscheiden sich um den Faktor fünf im Preis und um ein Wort im Namen. Hier sind sie bei maximalem Aufwand, so wie sie in den Leaderboards aufgeführt sind.
| Stufe | Intelligenz | Programmierung | $ / 1M in | $ / 1M aus | Tokens / s | Erster Token |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol (max) | 58.9 | 77.4 | $5 | $30 | 90.2 | 87,13 s |
| GPT-5.6 Terra (max) | 55.0 | 76.7 | $2.5 | $15 | 165.4 | 151,8 s |
| GPT-5.6 Luna (max) | 51.2 | 71.4 | $1 | $6 | 220.4 | 84,29 s |
Wenn Sie diese Tabelle allein lesen, sieht die Entscheidung linear aus. Terra kostet genau die Hälfte von Sol sowohl bei Eingabe- als auch bei Ausgabetoken und gibt 3,9 Punkte Intelligenz auf. Luna kostet ein Fünftel von Sol und gibt 7,7 auf. Wählen Sie ein Budget, akzeptieren Sie den entsprechenden Haarschnitt und machen Sie weiter.
Zwei Details trüben die Geschichte. Terra benötigt bei maximalem Aufwand 151,8 Sekunden, um sein erstes Token zu produzieren, länger als Sol mit 87,13 und länger als Luna mit 84,29 — die mittlere Stufe ist die langsamste im Antworten. Und der Durchsatz läuft in die entgegengesetzte Richtung zum Preis. Beides sind Symptome desselben Problems: Jede Zeile oben wurde bei maximalem Aufwand gemessen, und maximaler Aufwand ist ein Anfrageparameter, kein Produkt.
Sechs Aufwandsebenen, und sie bewegen sich mehr als die Stufen.
Jede Stufe wird bei sechs Einstellungen benchmarked: max, xhigh, high, medium, low und Non-reasoning. Das sind achtzehn Zeilen, und das vollständige Raster ist der einzige ehrliche Weg, sich diese Familie anzusehen.
| Konfiguration | Intelligenz | Programmierung | Tokens / s | Erster Token |
|---|---|---|---|---|
| Sol · 5 $ / 30 $ | ||||
| max | 58.9 | 77.4 | 90.2 | 87,13 s |
| xhigh | 57.7 | 78.3 | 85.1 | 38,17 s |
| high | 55.9 | 77.2 | 81.8 | 8,65 s |
| medium | 53.6 | 76.3 | 85.7 | 7,08 s |
| low | 49.4 | 69.7 | 80.5 | 2,5 s |
| Non-reasoning | 41.2 | 65.1 | 79.3 | 0,85 s |
| Terra · $2.5 / $15 | ||||
| max | 55.0 | 76.7 | 165.4 | 151,8 s |
| xhigh | 51.6 | 70.6 | 136.7 | 9.55 s |
| high | 49.0 | 67.1 | 130.2 | 4.24 s |
| medium | 45.6 | 64.7 | 136.3 | 1.59 s |
| low | 40.5 | 58.1 | 129.8 | 1.28 s |
| Non-reasoning | 34.0 | 52.3 | 134.9 | 0.67 s |
| Luna · $1 / $6 | ||||
| max | 51.2 | 71.4 | 220.4 | 84,29 s |
| xhigh | 49.1 | 68.6 | 209 | 25.94 s |
| high | 46.1 | 63.3 | 211.7 | 7.66 s |
| medium | 38.1 | 50.7 | 197.9 | 2.52 s |
| low | 33.3 | 44.2 | 202.8 | 1.64 s |
| Non-reasoning | 26.6 | 39.3 | 201.3 | 0.65 s |
Achtzehn Konfigurationen, drei Preisstufen
Jetzt messen Sie die beiden Achsen gegeneinander. Zwischen den Stufen bei maximalem Aufwand bewegt sich der Intelligenzindex um 7.7 Punkte, von 58.9 auf 51.2. Innerhalb einer einzigen Stufe bewegt der Aufwand ihn weiter: 17.7 Punkte auf Sol, von 58.9 auf 41.2; 21.0 Punkte auf Terra, von 55.0 auf 34.0; 24.6 Punkte auf Luna, von 51.2 auf 26.6.
Der Drehknopf, über den niemand in einer Beschaffungsbesprechung streitet, bewegt den Score mehr als dreimal so weit wie der, über den jeder streitet. Der Kauf von Luna zu Sol multipliziert Ihren Einheitspreis mit fünf und kauft 7.7 Punkte; auf Luna zu bleiben und den Aufwand-Parameter zu ändern, kostet pro Token nichts und deckt 24.6 Punkte ab.
Maximaler Aufwand ist nicht die beste Einstellung
Auf Sol’s Coding-Index erzielt xhigh 78.3 und max 77.4. Die schnellere Einstellung ist der bessere Programmierer um 0.9 Punkte, und 78.3 ist der höchste Coding-Index in diesem Artikel — über Claude Opus 5 mit 78.0 und weit über Claude Fable 5 mit 76.5, das bei $50 pro Million Ausgabetokens gelistet ist.
Es kommt auch schneller an: 38.17 Sekunden bis zum ersten Token im Vergleich zu 87.13, ein Unterschied von 48.96 Sekunden bei jedem Aufruf. Die Zahlung von Sol-Preisen bei maximalem Aufwand zum Schreiben von Code kauft ein leicht schlechteres Ergebnis und mehr als doppelt so lange Wartezeit. Eine Zeile weiter unten erzielt Sol bei mittlerem Aufwand immer noch 76.3 und startet in 7.08 Sekunden. Über die vier besten Einstellungen von Sol spannt der Coding-Index 2.0 Punkte, während die Zeit bis zum ersten Token von 7.08 bis 87.13 Sekunden reicht, und Luna wiederholt das Muster: xhigh gibt 2.1 Punkte gegenüber max auf, 49.1 gegenüber 51.2, und startet 58.35 Sekunden früher.
Terra ist die einzige echte Ausnahme. Der Wechsel von max zu xhigh kostet 3.4 Punkte Intelligenz und 6.1 Punkte Coding, 76.7 auf 70.6 — ein Zusammenbruch statt eines Rundungsfehlers — im Austausch für ein erstes Token in 9.55 Sekunden statt 151.8.
Durchsatz läuft rückwärts zur Preisliste
Sobald die Generierung beginnt, ist die günstigste Stufe die schnellste. Luna hält 220.4 Tokens pro Sekunde, Terra 165.4, Sol 90.2. Die Stufe, die fünfmal mehr kostet, liefert Texte mit ungefähr zwei Fünfteln der Geschwindigkeit.
Das Gitter zeigt auch, wo jede Art von Geschwindigkeit lebt. Der Durchsatz reagiert kaum auf den Aufwand: über seine sechs Einstellungen bleibt Luna zwischen 197.9 und 220.4 Tokens pro Sekunde, Terra zwischen 129.8 und 165.4, Sol zwischen 79.3 und 90.2. Die Latenz reagiert auf nichts anderes, läuft von 0.85 bis 87.13 Sekunden auf Sol, 0.67 bis 151.8 auf Terra und 0.65 bis 84.29 auf Luna.
Wo sich die Stufen wirklich unterscheiden
Zusammengesetzte Indizes verbergen die Form eines Modells. Hier sind die einzelnen Benchmarks für die drei Stufen bei maximalem Aufwand, wo die veröffentlichten Aufschlüsselungen existieren.
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| GPQA | 94.1 | 92.5 | 91.1 |
| Die letzte Prüfung der Menschheit | 47.2 | 41.8 | 37.2 |
| IFBench | 72.7 | 71.2 | — |
| Langzeit-Kontext-Argumentation | 73.7 | 74 | 74 |
| SciCode | 56.1 | 53.9 | 52.5 |
| Terminal-Bench | 88.0 | 88.0 | 80.9 |
| Terminal-Bench Hard | 65.9 | 57.6 | — |
| τ-Bench Banking | 33 | 31.8 | 27.2 |
| τ²-Bench | 85.1 | 86.3 | — |
Die Stufen trennen sich bei schwerem Denken und wenig anderem. Die letzte Prüfung der Menschheit ist die größte Lücke mit 10.0 Punkten, 47.2 auf 37.2; GPQA ist die engste mit 3.0 Punkten, 94.1 auf 91.1. Zwei Zeilen kehren die Preisreihenfolge direkt um: bei Long Context Reasoning erzielen sowohl Terra als auch Luna 74 gegenüber Sol’s 73.7, und bei τ²-Bench erzielt Terra 86.3 gegenüber Sol’s 85.1.
Das Terminal-Bench-Paar ist die nützlichste Linie hier für jeden, der Agenten erstellt. Im Standardset entspricht Terra Sol genau mit 88.0, zum halben Preis; im harten Set trennen sich die beiden, 65.9 gegen 57.6. Terra ist Sol’s gleichwertig bei Shell-Arbeiten, bis die Shell-Arbeiten schwierig werden, was genau der Zeitpunkt ist, an dem Sie es bemerken.
Und eine Zahl, um alle ehrlich zu halten: die beste der drei Stufen erzielt 33 auf τ-Bench Banking. Die stärkste Konfiguration in dieser Familie beantwortet eine realistische mehrstufige Bankaufgabe etwa ein Drittel der Zeit korrekt, und kein zusammengesetzter Index wird Ihnen das sagen.
Die Kreuzungen, die echte Rechnungen entscheiden
Da der Aufwand weiter geht als die Stufe, kreuzen sich die Konfigurationen. Luna bei xhigh erzielt 49.1 und Terra bei high erzielt 49.0 — ein Zehntel Punkt Unterschied, $6 gegen $15 pro Million Ausgabetokens, 209 Tokens pro Sekunde gegen 130.2. Es gibt keine Lesart dieses Paares, in der Terra gewinnt. Das Gleiche gilt eine Stufe tiefer: Luna bei high erzielt 46.1 gegen Terra bei medium mit 45.6 und läuft mit 211.7 Tokens pro Sekunde gegen 136.3.
Eine Stufe höher kehrt sich der Handel um und wird zu einer Latenzfrage. Terra bei xhigh erzielt 51.6 und startet in 9.55 Sekunden; Luna bei max erzielt 51.2 und startet in 84.29. Hier kauft das zusätzliche $9 pro Million Ausgabetokens 74.74 Sekunden von jeder ersten Antwort, nicht die Fähigkeit.
Die teuerste Kreuzung ist ganz oben. Wenn Ihre Schwelle 55 Punkte beträgt, erreicht Terra bei max genau 55.0, nachdem es 151.8 Sekunden gewartet hat, während Sol bei high 55.9 nach 8.65 erreicht — 143.15 Sekunden früher und 0.9 Punkte höher, bei $30 statt $15. Die Regel, die aus dem Gitter hervorgeht: Finden Sie die günstigste Stufe, die Ihre Zielpunktzahl bei einem bestimmten Aufwandsniveau erreicht, und kaufen Sie dann den Aufwand anstelle der Stufe, es sei denn, die Latenz ist die bindende Einschränkung, nicht die Punktzahl.
Gegen den Rest des Boards
Nichts davon geschieht isoliert. Hier ist der Snapshot des gleichen Morgens mit den Nachbarn inkludiert.
| Modell | Intelligenz | Programmierung | $ / 1M aus | Tokens / s | Erster Token |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s |
| GPT-5.6 Sol (max) | 58.9 | 77.4 | $30 | 90.2 | 87,13 s |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125,71 s |
| Claude Opus 4.8 | 55.7 | 74.3 | $25 | 65 | 37,44 s |
| GPT-5.6 Terra (max) | 55.0 | 76.7 | $15 | 165.4 | 151,8 s |
| GPT-5.5 (xhigh) | 54.8 | 74.9 | $30 | — | — |
| Grok 4.5 (hoch) | 53.8 | 72.4 | $6 | 61.2 | 10.85 s |
| GPT-5.6 Luna (max) | 51.2 | 71.4 | $6 | 220.4 | 84,29 s |
Jede GPT-5.6-Stufe hat einen direkten Konkurrenten zu ihrem eigenen Preis oder darunter, und in jedem Fall liegt der Konkurrent im zusammengesetzten Index vorne.
Sol bei maximaler Leistung, zu $30 pro Million Ausgabetokens, ist die teuerste GPT-5.6-Konfiguration, die aufgeführt ist, und Claude Opus 5 schlägt sie in beiden Indizes zu einem niedrigeren Preis: 60.7 gegen 58.9 in Intelligenz, 78.0 gegen 77.4 im Programmieren, $25 gegen $30 und 31.35 Sekunden bis zum ersten Token gegen 87.13. Sols Antwort darauf ist eine spezifische Zelle des Rasters, xhigh Programmierung bei 78.3.
Terra teilt sich maximal seinen $15 Ausgabepreis mit Kimi K3, das 57.1 gegen 55.0 in Intelligenz und 76.2 gegen 76.7 in Coding erzielt, liefert open weights und hat 2.8 Billionen Parameter mit einem Kontextfenster von 1.048.576 Tokens. Kimi ist sogar schneller, 125.71 Sekunden bis zum ersten Token gegenüber 151.8. Was Terra zu diesem Preis kauft, ist ein nachhaltiger Durchsatz, 165.4 Tokens pro Sekunde gegenüber 32.9, und das ist der einzige Grund, es zu bevorzugen.
Luna bei maximaler Leistung teilt sich seine $6 mit Grok 4.5 bei hohem Aufwand, der 53.8 gegen 51.2 und 72.4 gegen 71.4 erzielt, und beginnt in 10.85 Sekunden zu antworten gegen 84.29. Lunas Gegenargument ist erneut der Durchsatz: 220.4 Tokens pro Sekunde gegen 61.2, mehr als dreimal so viel Text pro Sekunde, sobald es gestartet ist.
Eine Zeile verdient einen eigenen Satz. GPT-5.5 bei xhigh listet immer noch bei $30 pro Million Ausgabetokens für 54.8 in Intelligenz und 74.9 im Programmieren, sodass die obere Einstellung der vorherigen Generation doppelt so viel kostet wie Terra bei maximaler Leistung und in beiden Indizes verliert.
Das Entscheidungsraster
Jede Zeile unten benennt eine Konfiguration statt einer Stufe, und jede Zeile wird durch eine Zahl aus den obigen Tabellen entschieden.
| Bindende Einschränkung | Konfiguration | Die Zahl, die entscheidet |
|---|---|---|
| Schwierigste Argumentation | Sol (max) | 47.2 bei HLE |
| Code schreiben | Sol (xhigh) | 78.3 Programmierung |
| Höchste Punktzahl ohne Wartezeit | Sol (hoch) | 55.9 in 8.65 s |
| Shell-Agenten, zum halben Preis | Terra (max) | 88.0 Terminal-Bench |
| Mittlere Punktzahl, schneller erster Token | Terra (xhigh) | 51.6 in 9.55 s |
| Langzeit-Kontextabruf | Luna (max) | 74 gegen Sols 73.7 |
| Begrenztes Budget, agentische Arbeit | Luna (xhigh) | 49.1 bei $6 |
| Streaming-Chat | Luna (hoch) | 211.7 Tokens / s |
| Massenextraktion | Luna (Nicht-Argumentation) | 0.65 s bis zum ersten Token |
| Du benötigst die Gewichte | Kimi K3 | 57.1 bei Terra’s $15 |
| Oben auf dem Board | Claude Opus 5 | 60.7 und 78.0 bei $25 |
Terra ist maximal eine Falle, es sei denn, der Job läuft unbeaufsichtigt. Terminal-Bench 88.0 bei $15 ist der beste Preis für Shell-Kompetenz in dieser Familie, aber 151.8 Sekunden bis zum ersten Token ist die längste Wartezeit aller achtzehn Konfigurationen, und Terminal-Bench Hard fällt auf 57.6 im Vergleich zu Sol’s 65.9.
Luna bei Non-Reasoning ist nur für Aufgaben ohne jegliches Denken geeignet. Es antwortet in 0.65 Sekunden bei 201.3 Tokens pro Sekunde und erzielt 26.6 in Intelligenz und 39.3 im Coding. Alles mit einer Entscheidung gehört stattdessen zu hoch, 46.1, was genau gleich viel pro Token kostet.
Diese Zahlen ändern sich jeden Morgen
Preise, Durchsatz und Benchmark-Indizes für jedes Modell, das wir verfolgen, täglich neu erstellt. Kostenlos, keine Anmeldung erforderlich.
Öffne den Vergleich →Das Fazit
Die Frage im Titel hat eine kleine Antwort. Der Wechsel zwischen den drei GPT-5.6-Stufen bei maximalem Aufwand verändert den Intelligenzindex um 7.7 Punkte und deinen Stückpreis um den Faktor fünf. Die Frage, die niemand auf die Beschaffungsfolie setzt, hat eine große Antwort: Der Wechsel des Aufwandparameters innerhalb der günstigsten Stufe allein verändert den Index um 24.6 Punkte und deinen Stückpreis um nichts.
Also mach es in dieser Reihenfolge. Finde deinen Zielwert, finde die günstigste Stufe, die ihn bei einem bestimmten Aufwand erreicht, dann investiere den Aufwand — und überprüfe die Einstellungen über und unter der, die du angenommen hast, denn bei Sol’s Coding-Index ist maximaler Aufwand nicht die maximale Punktzahl. Dann stelle deine Stufe neben alles andere, was um diesen Preis herum gelistet ist: bei Sol’s $30 gibt es ein höher bewertetes Modell für $5 weniger, und bei Terra’s $15 gibt es eines, das seine Gewichte liefert.