Strumenti AI Progetti Directory
🏆 Classifica 📡 Notizie ✨ Prompts ⚖️ Confronta Modelli 🔧 Strumenti 📦 Progetti 🚀 Spazi
Blog
Confronto dei modelli

Opus 5 contro Fable 5 — più recente, migliore, a metà prezzo

Claude Opus 5 è stato rilasciato quarantacinque giorni dopo Claude Fable 5. Ottiene punteggi più alti su entrambi gli indici compositi e costa esattamente la metà per token. Questo non dovrebbe accadere, e il motivo è più interessante del ranking.

Aggiornato il 28 luglio 2026·9 min di lettura·Nessun paywall

TL;DR — la versione breve

Opus 5 ottiene 60.7 in intelligenza e 78.0 in coding per $5 in e $25 out per milione di token. Fable 5 ottiene 59.9 e 76.5 per $10 in e $50 out. Stesso fornitore, modello più recente, 2× il prezzo per meno punti.

Fable 5 non è battuto ovunque. È più veloce nel throughput sostenuto a 71,3 token al secondo contro 62,8, e vince l'Ultimo Esame dell'Umanità e SciCode senza riserve.

L'impostazione conta più del modello. Opus 5 a sforzo medio segna già 56,3, sopra Opus 4.8 al suo massimo sforzo, e inizia a rispondere in 9,83 secondi invece di 37,44. Quella manopola muove la tua latenza e la tua fattura più della scelta tra questi due modelli.

I due modelli, affiancati

Entrambi i valori qui sotto provengono dallo stesso snapshot giornaliero, letto alle 05:30 del 28 luglio 2026 su 874 modelli misurati. Intelligenza e Codifica sono indici compositi di Artificial Analysis; throughput, tempo per il primo token e prezzo li monitoriamo insieme a loro. I prezzi sono dollari per milione di token.

MetricaClaude Opus 5Claude Fable 5
Rilasciato24 luglio 20269 giugno 2026
Intelligenza60.759.9
Codifica78.076.5
$ / 1M input$5$10
$ / 1M output$25$50
Token / s62.871.3
Tempo per il primo token31,35 s80,07 s

La linea dei prezzi vale la pena leggerla due volte. Non è all'incirca la metà, è esattamente la metà: $5 contro $10 in input, $25 contro $50 in output. Nulla nelle due colonne dei punteggi giustifica quel rapporto — il divario è 0,8 punti di intelligenza e 1,5 punti di codifica, entrambi a favore del modello più economico.

Claude Opus 5 versus Claude Fable 5: intelligence score and output price per million tokens
Due modelli dello stesso fornitore, a quarantacinque giorni di distanza. Ridisegnati quotidianamente dai prezzi in tempo reale.

Una avvertenza prima dei benchmark: entrambi i modelli eseguono una configurazione di ragionamento adattivo, quindi nessuno è un modello a passaggio singolo semplice. La colonna di Opus 5 è la sua impostazione a massimo sforzo, una delle cinque che monitoriamo; Fable 5 ha una singola configurazione misurata, che segna 59,9. Quel punto finale diventa l'intero argomento più avanti.

La divisione del benchmark non è unilaterale

Gli indici compositi sono medie, e le medie nascondono la forma di un modello. Ecco la stessa coppia sui nove benchmark individuali nel nostro snapshot.

BenchmarkClaude Opus 5Claude Fable 5
GPQA93.292.6
Ultimo Esame dell'Umanità52.653.3
Ragionamento su contesti lunghi7070
SciCode55.760.2
Terminal-Bench89.184.6
Terminal-Bench Hardnon misurato62.9
IFBenchnon misurato63.5
τ-Bench Banking30.326.8
τ²-Benchnon misurato98.5

Opus 5 vince il Terminal-Bench di 4,5 punti, 89,1 contro 84,6. Vince GPQA di 0,6, 93,2 contro 92,6. E vince τ-Bench Banking di 3,5, 30,3 contro 26,8 — su un benchmark dove il migliore dei due ottiene comunque meno di un terzo di un compito realistico di agente bancario.

Fable 5 vince l'Ultimo Esame dell'Umanità, 53,3 contro 52,6. E vince SciCode di 4,5 punti, 60,2 contro 55,7 — la dimensione esatta del divario che Opus 5 ha aperto su Terminal-Bench, nell'altra direzione. Su Long Context Reasoning sono identici a 70.

Tre delle nove righe non hanno affatto un numero di Opus 5: Terminal-Bench Hard, IFBench e τ²-Bench. Fable 5 pubblica 62,9, 63,5 e 98,5 su di essi. Una misurazione mancante non è un punteggio basso e non la tratteremo come tale — ma se il tuo carico di lavoro assomiglia a seguire istruzioni o utilizzo di strumenti multi-turno, Fable 5 è quello con prove pubblicate e Opus 5 è quello che devi testare tu stesso.

Quindi il riassunto onesto del confronto diretto è: Opus 5 vince i due compositi e tre dei sei benchmark dove entrambi sono misurati, Fable 5 vince due, uno è un pareggio e tre sono irrisolti. Questo è un risultato molto più ristretto rispetto a “il modello più recente è migliore,” e arriva comunque a metà prezzo.

Fable 5 è genuinamente più veloce — e genuinamente più lento

La velocità è due numeri diversi e qui non sono d'accordo. Una volta che Fable 5 sta generando, genera più velocemente: 71,3 token al secondo contro 62,8, un vantaggio di 8,5 token al secondo. Ma ci vuole molto più tempo per dire qualcosa: 80,07 secondi per il primo token contro 31,35.

Quale di questi ti interessa dipende interamente da cosa stai costruendo. Un pipeline batch che riassume diecimila documenti durante la notte si preoccupa del throughput e finirà prima su Fable 5. Un agente di codifica che effettua quaranta chiamate a strumenti sequenziali paga il costo del primo token quaranta volte, e su quel tipo di lavoro Fable 5 inizia 48,72 secondi dopo su ognuno di essi, prima che appaia un singolo token di output utile.

La manopola dello sforzo si muove più della scelta del modello

Opus 5 espone un'impostazione di sforzo, e ciascuno dei suoi cinque livelli è misurato separatamente. Qui è dove vive la vera decisione, perché la diffusione all'interno di Opus 5 è più grande della diffusione tra Opus 5 e Fable 5.

ImpostazioneIntelligenzaCodificaToken / sTempo per il primo token
Opus 5, massimo sforzo60.778.062.831,35 s
Opus 5, sforzo molto alto60.177.056.922.36 s
Opus 5, sforzo alto58.976.559.114.56 s
Opus 5, sforzo medio56.374.359.39.83 s
Opus 5, sforzo basso50.666.959.73.01 s
Opus 4.8, massimo sforzo55.774.36537.44 s

Leggi prima la colonna del throughput, perché è la sorpresa. Si muove a malapena: 62.8, 56.9, 59.1, 59.3, 59.7. Ridurre lo sforzo non fa generare più velocemente Opus 5. Ciò che collassa è il tempo per il primo token, da 31.35 secondi al massimo a 3.01 secondi al minimo.L'impostazione dello sforzo è un selettore di tempo di riflessione, non un selettore di velocità.

Ora la riga che dovrebbe cambiare come configuri le cose. Opus 5 a sforzo medio ottiene 56.3. Opus 4.8 al suo massimo sforzo ottiene 55.7. Il nuovo modello, deliberatamente limitato a metà della sua gamma, è 0.6 punti avanti rispetto alla generazione precedente che lavora al massimo — e inizia a rispondere in 9.83 secondi invece di 37.44. Nella codifica i due raggiungono esattamente la stessa cifra, 74.3 contro 74.3.

Claude Opus 5, Claude Fable 5 and Claude Opus 4.8: intelligence score against output price
Opus 5, Fable 5 e Opus 4.8 — due dei tre condividono un prezzo.

Opus 4.8 ha un prezzo identico a Opus 5, a $5 in e $25 out. Quindi su questa coppia l'aggiornamento è gratuito nel prezzo di listino e vale 5 punti di intelligenza al massimo della gamma: 60.7 contro 55.7. Non c'è versione dell'aritmetica in cui rimanere su 4.8 al massimo sforzo sia la scelta efficiente.

Opus 5 non supera Fable 5 in ogni impostazione

Il confronto principale utilizza Opus 5 al massimo sforzo, e quella cornice lo lusinga. Abbassalo di un gradino e il risultato si inverte.

Opus 5 a sforzo alto (58.9) scende sotto il 59.9 misurato di Fable 5. Configurato in quel modo, il modello più economico e nuovo perde il composito di un punto. Nella codifica i due sono a livello: 76.5 e 76.5.

L'impostazione che vince effettivamente il confronto su entrambi gli assi è xhigh: 60.1 intelligenza contro 59.9, 77.0 codifica contro 76.5, primo token in 22.36 secondi contro 80.07, a metà del prezzo pubblicato. Questa è la configurazione da citare se stai sostituendo Fable 5 in un sistema in esecuzione — non max, che acquista 0.6 punti di intelligenza in più per nove secondi di latenza in più prima che inizi l'output.

I livelli di sforzo non cambiano il prezzo pubblicato per token, quindi la fattura si muove attraverso quanti token il modello spende prima di rispondere, non attraverso il listino prezzi. La nostra istantanea misura quella spesa indirettamente, come tempo per il primo token, e attraverso le cinque impostazioni di Opus 5 che vanno da 31.35 secondi a 3.01.

Cosa significa questo per una fattura reale

Tre conclusioni pratiche, nell'ordine in cui un team di solito ne ha bisogno.

Se oggi sei su Fable 5, passa a Opus 5 a sforzo xhigh. Guadagni 0.2 punti di intelligenza e 0.5 di codifica, riduci la latenza del primo token da 80.07 secondi a 22.36, e il listino prezzi si dimezza sia per l'input che per l'output. L'unica cosa che perdi è il throughput sostenuto, 56.9 token al secondo contro 71.3, che conta per la generazione di massa e non molto altro.

Se stai scegliendo un'impostazione piuttosto che un modello, il medio è quello sottovalutato. Con 56.3 di intelligenza e 74.3 di codifica è sopra il tetto del precedente flagship, e 9.83 secondi per il primo token è all'interno dell'intervallo in cui uno strumento interattivo si sente ancora reattivo. Il massimo sforzo esiste per i problemi in cui 4.4 punti di indice decidono davvero l'esito; la maggior parte del traffico di produzione non è quei problemi.

Se il tuo carico di lavoro è seguire istruzioni o utilizzare strumenti multi-turno, fai un benchmark prima di cambiare. Fable 5 è l'unico dei due con numeri pubblicati su IFBench, Terminal-Bench Hard e τ²-Bench. Non inferiremo i punteggi di Opus 5 da quello composito, e neanche tu dovresti farlo.

Questi numeri cambiano ogni mattina

Prezzi, throughput e indici di benchmark per 874 modelli misurati, ricostruiti quotidianamente. Gratis, senza registrazione.

Apri il comparatore →

Il punto fondamentale

Un modello più recente che ottiene punteggi più alti e costa esattamente la metà non è un errore di prezzo, è ciò che accade quando un fornitore spedisce due prodotti per due motivi diversi a quarantacinque giorni di distanza. Fable 5 mantiene un reale vantaggio di throughput e due vittorie nei benchmark. Opus 5 prende i compositi, il lavoro terminale e la latenza.

Ma il numero da ricordare da questo articolo non è 60.7 contro 59.9. È 56.3 contro 55.7, a 9.83 secondi contro 37.44 — il precedente flagship battuto da un'impostazione a sforzo medio sul nuovo. La leva con il maggior impatto sulla tua fattura è quella all'interno del modello che hai già scelto.