Strumenti AI Progetti Directory
🏆 Classifica 📡 Notizie ✨ Prompts ⚖️ Confronta Modelli 🔧 Strumenti 📦 Progetti 🚀 Spazi
Blog
Analisi del modello

Quale livello GPT-5.6? La domanda sbagliata

Sol, Terra e Luna sono stati rilasciati lo stesso giorno a $30, $15 e $6 per milione di token di output. Con il massimo sforzo si trovano a 7.7 punti di intelligenza di distanza. I sei livelli di sforzo all'interno di Luna da soli si trovano a 24.6 punti di distanza.

Aggiornato il 28 luglio 2026·9 min di lettura·Nessun paywall

TL;DR — la versione breve

GPT-5.6 non è un modello, e nemmeno tre. Sono tre livelli, ognuno dei quali espone sei livelli di sforzo — diciotto configurazioni misurate sotto un nome.

Il livello imposta il tuo prezzo unitario. Il livello di sforzo imposta quasi tutto il resto.

Attraverso i tre livelli al massimo sforzo, l'indice di intelligenza si estende per 7.7 punti. All'interno del livello più economico si estende per 24.6.

Il massimo sforzo non è sempre la migliore impostazione: Sol a xhigh ottiene 78.3 in codifica contro 77.4 al massimo, e inizia a rispondere 48.96 secondi prima.

Tre livelli, una data di rilascio

Tutti e tre i livelli di GPT-5.6 hanno la stessa data di rilascio, 9 luglio 2026. Differiscono per un fattore di cinque nel prezzo e per una parola nel nome. Ecco come si presentano al massimo sforzo, come li elencano le leaderboard.

LivelloIntelligenzaCodifica$ / 1M in$ / 1M outToken / sPrimo token
GPT-5.6 Sol (max)58.977.4$5$3090.287.13 s
GPT-5.6 Terra (max)55.076.7$2.5$15165.4151.8 s
GPT-5.6 Luna (max)51.271.4$1$6220.484.29 s

Leggi quella tabella da sola e la decisione sembra lineare. Terra costa esattamente la metà di Sol sia per i token di input che per quelli di output e rinuncia a 3.9 punti di intelligenza. Luna costa un quinto di Sol e rinuncia a 7.7. Scegli un budget, accetta il taglio corrispondente, vai avanti.

Due dettagli rovinano la storia. Terra al massimo sforzo impiega 151.8 secondi per produrre il suo primo token, più a lungo di Sol a 87.13 e più a lungo di Luna a 84.29 — il livello intermedio è il più lento a rispondere. E il throughput corre in direzione opposta al prezzo. Entrambi sono sintomi della stessa cosa: ogni riga sopra è misurata al massimo sforzo, e il massimo sforzo è un parametro di richiesta, non un prodotto.

GPT-5.6 Sol, Terra and Luna compared on output price per million tokens
I tre livelli al massimo sforzo: $30, $15 e $6 per milione di token in output. Ridisegnati quotidianamente dai prezzi in tempo reale.

Sei livelli di sforzo, e si muovono più dei livelli

Ogni livello è valutato a sei impostazioni: max, xhigh, high, medium, low e Non-ragionamento. Sono diciotto righe, e la griglia completa è l'unico modo onesto per guardare a questa famiglia.

ConfigurazioneIntelligenzaCodificaToken / sPrimo token
Sol · $5 / $30
max58.977.490.287.13 s
xhigh57.778.385.138.17 s
high55.977.281.88.65 s
medium53.676.385.77.08 s
low49.469.780.52.5 s
Non-ragionamento41.265.179.30,85 s
Terra · $2,5 / $15
max55.076.7165.4151.8 s
xhigh51.670.6136.79,55 s
high49.067.1130.24,24 s
medium45.664.7136.31,59 s
low40.558.1129.81,28 s
Non-ragionamento34.052.3134.90,67 s
Luna · $1 / $6
max51.271.4220.484.29 s
xhigh49.168.620925,94 s
high46.163.3211.77,66 s
medium38.150.7197.92,52 s
low33.344.2202.81,64 s
Non-ragionamento26.639.3201.30,65 s

Diciotto configurazioni, tre fasce di prezzo

Ora misura i due assi l'uno contro l'altro. Tra i livelli a sforzo massimo, l'indice di intelligenza si sposta di 7,7 punti, da 58,9 a 51,2. All'interno di un singolo livello, lo sforzo lo sposta ulteriormente: 17,7 punti su Sol, da 58,9 a 41,2; 21,0 punti su Terra, da 55,0 a 34,0; 24,6 punti su Luna, da 51,2 a 26,6.

Il dial che nessuno contesta in una riunione di approvvigionamento sposta il punteggio più di tre volte rispetto a quello su cui tutti discutono. Acquistare da Luna a Sol moltiplica il prezzo unitario per cinque e acquista 7,7 punti; rimanere su Luna e muovere il parametro di sforzo non costa nulla per token e copre 24,6 punti di intervallo.

Il livello è l'unica metà di questa decisione che cambia cosa costa un token. La metà costosa ha l'effetto minore, e la metà gratuita decide cosa ottieni realmente.

Lo sforzo massimo non è la migliore impostazione

Sull'indice di codifica di Sol, xhigh ottiene 78,3 e max ottiene 77,4. L'impostazione più veloce è il miglior programmatore di 0,9 punti, e 78,3 è il più alto indice di codifica in questo articolo — sopra Claude Opus 5 a 78,0, e ben sopra Claude Fable 5 a 76,5, che si elenca a $50 per milione di token di output.

Arriva anche prima: 38,17 secondi per il primo token contro 87,13, una differenza di 48,96 secondi ad ogni chiamata. Pagare i prezzi di Sol a sforzo massimo per scrivere codice acquista un risultato leggermente peggiore e più del doppio dell'attesa. Una riga più in basso, Sol a medio ottiene ancora 76,3 e inizia in 7,08 secondi. Tra le quattro impostazioni migliori di Sol, l'indice di codifica si estende per 2,0 punti mentre il tempo per il primo token si estende da 7,08 a 87,13 secondi, e Luna ripete il modello: xhigh cede 2,1 punti rispetto a max, 49,1 rispetto a 51,2, e inizia 58,35 secondi prima.

Terra è l'unica vera eccezione. Passare da max a xhigh costa 3,4 punti di intelligenza e 6,1 punti di codifica, da 76,7 a 70,6 — un crollo piuttosto che un errore di arrotondamento — in cambio di un primo token in 9,55 secondi invece di 151,8.

Il throughput corre all'indietro rispetto alla lista dei prezzi

Una volta che la generazione inizia, il livello più economico è il più veloce. Luna sostiene 220,4 token al secondo, Terra 165,4, Sol 90,2. Il livello che costa cinque volte di più fornisce testo a circa due quinti della velocità.

La griglia mostra anche dove vive ciascun tipo di velocità. Il throughput risponde appena allo sforzo: tra le sue sei impostazioni Luna rimane tra 197,9 e 220,4 token al secondo, Terra tra 129,8 e 165,4, Sol tra 79,3 e 90,2. La latenza non risponde a nient'altro, variando da 0,85 a 87,13 secondi su Sol, da 0,67 a 151,8 su Terra e da 0,65 a 84,29 su Luna.

Il throughput è una proprietà del livello; la latenza è una proprietà del livello di sforzo. Se la risposta inizia troppo tardi, cambiare livello non lo risolverà e cambiare sforzo sì.

Dove i livelli differiscono realmente

Gli indici compositi nascondono la forma di un modello. Ecco i benchmark individuali per i tre livelli a sforzo massimo, che è dove esistono le suddivisioni pubblicate.

BenchmarkSolTerraLuna
GPQA94.192.591.1
Ultimo Esame dell'Umanità47.241.837.2
IFBench72.771.2
Ragionamento su contesti lunghi73.77474
SciCode56.153.952.5
Terminal-Bench88.088.080.9
Terminal-Bench Hard65.957.6
τ-Bench Banking3331.827.2
τ²-Bench85.186.3

I livelli si separano su ragionamenti difficili e poco altro. L'Ultimo Esame dell'Umanità è il divario più ampio a 10,0 punti, da 47,2 a 37,2; GPQA è il più stretto a 3,0 punti, da 94,1 a 91,1. Due righe invertiscono completamente l'ordine dei prezzi: su Long Context Reasoning sia Terra che Luna ottengono 74 contro i 73,7 di Sol, e su τ²-Bench Terra ottiene 86,3 contro gli 85,1 di Sol.

La coppia Terminal-Bench è la linea più utile qui per chiunque costruisca agenti. Sul set standard Terra corrisponde esattamente a Sol a 88,0, a metà prezzo; sul set difficile i due si separano, 65,9 contro 57,6. Terra è pari a Sol nel lavoro di shell fino a quando il lavoro di shell non diventa difficile, momento in cui lo noti.

E un numero per mantenere tutti onesti: il migliore dei tre livelli ottiene 33 su τ-Bench Banking. La configurazione più forte in questa famiglia risponde correttamente a un compito bancario multi-turno realistico circa un terzo delle volte, e nessun indice composito te lo dirà.

GPT-5.6 Sol against Claude Opus 5 and Kimi K3: output price per million tokens
Sol a $30 per milione di token di output, accanto al modello sopra di esso e al modello open-weight sotto di esso.

I crossover che decidono le fatture reali

Poiché lo sforzo si muove più lontano del livello, le configurazioni si incrociano. Luna a xhigh ottiene 49,1 e Terra a high ottiene 49,0 — un decimo di punto di distanza, $6 contro $15 per milione di token di output, 209 token al secondo contro 130,2. Non c'è lettura di quella coppia in cui Terra vince. Lo stesso vale un gradino più in basso: Luna a high ottiene 46,1 contro Terra a medium a 45,6, e funziona a 211,7 token al secondo contro 136,3.

Un gradino più in alto, il commercio si inverte e diventa una questione di latenza. Terra a xhigh ottiene 51,6 e inizia in 9,55 secondi; Luna a max ottiene 51,2 e inizia in 84,29. Qui i $9 extra per milione di token di output comprano 74,74 secondi da ogni prima risposta, non capacità.

Il crossover più costoso è in cima. Se la tua soglia è 55 punti, Terra a max raggiunge esattamente 55,0 dopo aver atteso 151,8 secondi, mentre Sol a high raggiunge 55,9 dopo 8,65 — 143,15 secondi prima e 0,9 punti più alto, a $30 invece di $15. La regola che emerge dalla griglia: trova il livello più economico che raggiunge il tuo punteggio target a un certo livello di sforzo, poi acquista lo sforzo piuttosto che il livello, a meno che la latenza piuttosto che il punteggio non sia il vincolo vincolante.

Contro il resto della scheda

Niente di tutto ciò accade in isolamento. Ecco l'istantanea della stessa mattina con i vicini inclusi.

ModelloIntelligenzaCodifica$ / 1M outToken / sPrimo token
Claude Opus 560.778.0$2562.831,35 s
Claude Fable 559.976.5$5071.380,07 s
GPT-5.6 Sol (max)58.977.4$3090.287.13 s
Kimi K357.176.2$1532.9125.71 s
Claude Opus 4.855.774.3$256537.44 s
GPT-5.6 Terra (max)55.076.7$15165.4151.8 s
GPT-5.5 (xhigh)54.874.9$30
Grok 4.5 (high)53.872.4$661.210.85 s
GPT-5.6 Luna (max)51.271.4$6220.484.29 s

Ogni livello di GPT-5.6 ha un concorrente diretto al suo stesso prezzo o inferiore, e in ogni caso il concorrente è in vantaggio nell'indice composito.

Sol al massimo, a $30 per milione di token di output, è la configurazione GPT-5.6 più costosa elencata, e Claude Opus 5 la supera su entrambi gli indici a un prezzo inferiore: 60.7 contro 58.9 in intelligenza, 78.0 contro 77.4 in coding, $25 contro $30, e 31.35 secondi per il primo token contro 87.13. La risposta di Sol a questo è una specifica cella della griglia, coding xhigh a 78.3.

Terra al massimo condivide il suo prezzo di output di $15 con Kimi K3, che ottiene 57.1 contro 55.0 su intelligenza e 76.2 contro 76.7 su codifica, spedisce open weights e porta 2.8 trilioni di parametri con una finestra di contesto di 1.048.576 token. Kimi è anche più veloce, 125.71 secondi per il primo token contro 151.8. Cosa compra Terra a quel prezzo è throughput sostenuto, 165.4 token al secondo contro 32.9, e questa è l'unica ragione per preferirlo.

Luna al massimo condivide il suo $6 con Grok 4.5 a sforzo alto, che ottiene 53.8 contro 51.2 e 72.4 contro 71.4, e inizia a rispondere in 10.85 secondi contro 84.29. L'argomento contro di Luna è di nuovo il throughput: 220.4 token al secondo contro 61.2, più di tre volte tanto testo al secondo una volta che ha iniziato.

Una riga merita una sua frase. GPT-5.5 a xhigh è ancora elencato a $30 per milione di token di output per 54.8 in intelligenza e 74.9 in coding, quindi l'impostazione superiore della generazione precedente costa il doppio di quanto costa Terra al massimo e perde su entrambi gli indici.

GPT-5.6 Luna against Grok 4.5: same output price per million tokens
Stesso $6 per milione di token di output. Uno inizia in 10.85 secondi, l'altro sostiene 220.4 token al secondo.

La griglia decisionale

Ogni riga qui sotto nomina una configurazione piuttosto che un livello, e ogni riga è decisa da un numero delle tabelle sopra.

Vincolo vincolanteConfigurazioneIl numero che decide
Ragionamento più difficileSol (max)47.2 su HLE
Scrivere codiceSol (xhigh)78.3 coding
Punteggio massimo senza attesaSol (high)55.9 in 8.65 s
Agenti shell, metà prezzoTerra (max)88.0 Terminal-Bench
Punteggio medio, primo token veloceTerra (xhigh)51.6 in 9.55 s
Recupero a lungo termineLuna (max)74 contro 73.7 di Sol
Budget limitato, lavoro agenticoLuna (xhigh)49.1 a $6
Chat in streamingLuna (high)211.7 token / s
Estrazione in bloccoLuna (Non-ragionamento)0.65 s per il primo token
Hai bisogno dei pesiKimi K357.1 a $15 di Terra
In cima alla classificaClaude Opus 560.7 e 78.0 a $25

Terra al massimo è una trappola a meno che il lavoro non venga eseguito senza supervisione. Terminal-Bench 88.0 a $15 è il miglior prezzo per la competenza shell in questa famiglia, ma 151.8 secondi per il primo token è l'attesa più lunga di tutte le diciotto configurazioni, e Terminal-Bench Hard scende a 57.6 contro il 65.9 di Sol.

Luna a Non-razionale è solo per compiti senza ragionamento. Risponde in 0.65 secondi a 201.3 token al secondo, e ottiene 26.6 in intelligenza e 39.3 in coding. Qualsiasi cosa con una decisione appartiene invece a alto, 46.1, che costa esattamente lo stesso per token.

Questi numeri cambiano ogni mattina

Prezzi, throughput e indici di benchmark per ogni modello che seguiamo, ricostruiti quotidianamente. Gratuito, senza registrazione.

Apri il comparatore →

Il punto fondamentale

La domanda nel titolo ha una piccola risposta. Passare attraverso i tre livelli di GPT-5.6 con il massimo sforzo cambia l'indice di intelligenza di 7.7 punti e il tuo prezzo unitario di un fattore cinque. La domanda che nessuno pone nella diapositiva di approvvigionamento ha una grande risposta: spostare il parametro di sforzo all'interno del livello più economico cambia l'indice di 24.6 punti e il tuo prezzo unitario di nulla.

Quindi fallo in quest'ordine. Trova il tuo punteggio target, trova il livello più economico che lo raggiunge a un certo livello di sforzo, poi spendi lo sforzo — e controlla l'impostazione sopra e sotto quella che hai assunto, perché sull'indice di coding di Sol il massimo sforzo non è il punteggio massimo. Poi metti il tuo livello accanto a qualsiasi altra cosa elencata intorno a quel prezzo: a $30 di Sol c'è un modello con punteggio più alto per $5 in meno, e a $15 di Terra ce n'è uno che spedisce i suoi pesi.