Kimi K3 è open-weight — e questo non è lo stesso di runnable
Ottiene 57.1 in intelligenza a $15 per milione di token di output, davanti a GPT-5.6 Terra allo stesso prezzo e 1.8 punti dietro GPT-5.6 Sol, che costa il doppio. Poi leggi il conteggio dei parametri: 2.8 trilioni.
TL;DR — la versione breve
Kimi K3 ottiene 57.1 in intelligenza per $15 per milione di token di output. GPT-5.6 Terra costa lo stesso $15 e ottiene 55.0. GPT-5.6 Sol ottiene 58.9 e costa $30.
I pesi sono pubblicati. Il modello ha 2.8 trilioni di parametri. Entrambi i fatti si trovano nella stessa voce del catalogo, e insieme costituiscono l'articolo: open weights le dicono cosa può possedere, non cosa è attrezzata per eseguire.
La fattura arriva come latenza: 32.9 token al secondo e 125.71 secondi per il primo token, il throughput più lento dei sei modelli in cima alla nostra classifica.
I numeri, questa mattina
Moonshot AI ha rilasciato Kimi K3 il 16 luglio 2026. Tutto ciò che segue è stato letto il 28 luglio dal nostro benchmark fusion giornaliero, fornito da Artificial Analysis. Intelligenza e Codifica sono indici compositi; prezzo, throughput e tempo per il primo token li monitoriamo noi stessi. Ogni riga è la configurazione di massimo sforzo del fornitore, che conta in seguito.
| Modello | Intelligenza | Codifica | $ / 1M out | Token / s | Primo token | Pesi |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31,35 s | Chiuso |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80,07 s | Chiuso |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | 87.13 s | Chiuso |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s | Aperto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | 151.8 s | Chiuso |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | 84.29 s | Chiuso |
Una riga spedisce i suoi pesi. È la quarta riga e non l'ultima, ed è prezzata nel mezzo della classifica piuttosto che in fondo. Entrambi questi sono nuovi, e entrambi costano qualcosa.
A $15 supera il modello da $15
GPT-5.6 Terra e Kimi K3 costano entrambi $15 per milione di token di output. Terra ottiene 55.0 in intelligenza, Kimi K3 ottiene 57.1: 2.1 punti rispetto al modello open-weight a un prezzo di output identico, con un lato di input troppo vicino per decidere qualcosa a $2.50 contro $3.
Il confronto un passo sopra è quello che dovrebbe preoccupare un fornitore. GPT-5.6 Sol ottiene 58.9 per $30 per milione di token di output — 1.8 punti per il doppio del prezzo. Quei 1.8 punti sono reali su ragionamenti difficili, ma ora sono una voce di costo piuttosto che un motivo per smettere di cercare. La Codifica è l'unico indice che va nell'altra direzione allo stesso prezzo: Terra 76.7 contro 76.2 di Kimi K3.
Dove vince, e dove non vince
Un indice composito media la varianza che decide il lavoro reale, quindi ecco i benchmark individuali. La nostra istantanea include nove per questo livello e Kimi K3 ha un risultato su sei, senza alcuno su IFBench, Terminal-Bench Hard o τ²-Bench — vero anche per Claude Opus 5 e GPT-5.6 Luna, quindi leggi una cella vuota come un gap nella misurazione piuttosto che un fallimento.
| Benchmark | Kimi K3 | Il migliore degli altri cinque |
|---|---|---|
| Ragionamento su contesti lunghi | 74.7 | 74.0 · GPT-5.6 Terra e Luna |
| τ-Bench Banking | 33.4 | 33.0 · GPT-5.6 Sol |
| GPQA | 93.5 | 94.1 · GPT-5.6 Sol |
| SciCode | 58.7 | 60.2 · Claude Fable 5 |
| Terminal-Bench | 85.0 | 89.1 · Claude Opus 5 |
| Ultimo Esame dell'Umanità | 44.3 | 53.3 · Claude Fable 5 |
Due primi, e non del tipo decorativo. Long Context Reasoning 74.7 è il migliore dei sei, davanti a entrambe le varianti GPT-5.6 a 74.0 e chiaro di Opus 5 e Fable 5, che si trovano entrambi a 70. τ-Bench Banking 33.4 battendo il 33.0 di Sol, il che mette il modello open-weight in testa al set di frontiera su un compito multi-turno con strumenti — il carico di lavoro a cui ogni fornitore chiuso mira con il suo marketing.
GPQA è un pareggio in pratica, 93.5 contro 94.1. Le tre perdite sono più informative: SciCode 58.7 è 1.5 punti sotto Claude Fable 5, Terminal-Bench 85.0 è 4.1 punti sotto Opus 5, e Humanity’s Last Exam 44.3 è 9.0 punti sotto Fable 5. Se il tuo lavoro assomiglia alla parte più difficile del ragionamento non assistito, quel gap di nove punti è ciò che ti costa la riga aperta.
Poi leggi il conteggio dei parametri
Il nostro elenco del catalogo descrive Kimi K3 come “un modello di ragionamento multimodale open-weight con 2.8T di parametri”. Questo è 2.8 trilioni di parametri, e riorganizza tutto ciò che è sopra.
È anche l'unico conteggio di parametri in questo articolo, il che non è una svista. Nessun modello chiuso qui pubblica uno, quindi il confronto non può essere fatto affatto. Ottiene il numero precisamente perché i pesi sono open — la prima cosa che gli open weights le comprano è sapere quanto è grande la cosa prima di impegnarsi.
La seconda cosa che ti compra è un download. Non compra la macchina che tiene il download in memoria, e a questa dimensione quella macchina è l'intero progetto. Non pubblichiamo stime hardware e dovresti diffidare di qualsiasi cifra singola ti venga data, perché la risposta onesta dipende dalla quantizzazione, dalla dimensione del batch, dall'interconnessione e dalla latenza che tollererai — quattro decisioni che sono tue, non dell'editore.
Open weights è un permesso, non un deployment
Tre affermazioni si uniscono nella frase, e separarle è gran parte del lavoro di scelta.
Open weights non significa gratuito. Kimi K3 è servito a $3 in entrata e $15 in uscita per milione di token, un prezzo di frontiera piuttosto che un prezzo di commodity. Chiunque serva quei pesi paga comunque per l'hardware che contiene 2.8 trilioni di parametri, e quel costo si riflette nel prezzo indipendentemente da chi pubblica il checkpoint.
Open weights non significa self-hostable alla sua scala. Per un modello da sette miliardi di parametri i due sono praticamente la stessa frase. A 2.8 trilioni sono progetti diversi con budget diversi, e l'auto-ospitare smette di essere una questione di licenza e diventa una questione di pianificazione della capacità.
Open weights descrive disponibilità, non una concessione di licenza. I nostri dati registrano questo modello come open-weight e nulla di più preciso, quindi se il tuo motivo per volere i pesi è legale — audit, ridistribuzione, diritti di fine-tuning, una giurisdizione che vieta l'invio di prompt all'estero — i termini allegati al checkpoint sono il documento di cui hai bisogno, e una tabella di benchmark non è un sostituto per leggerli.
Ciò che sopravvive a queste tre sottrazioni è comunque sostanziale: puoi ispezionare il modello, fissare una versione che nessun fornitore può deprecare sotto di te, e eseguirlo in un luogo di tua scelta se puoi permetterti quel luogo. Per alcuni acquirenti quel profilo di rischio è l'unica cosa su questa pagina che conta.
Il prezzo che paghi effettivamente è il throughput
Kimi K3 genera 32.9 token al secondo. Nello stesso snapshot Opus 5 funziona a 62.8, Sol a 90.2, Terra a 165.4 e Luna a 220.4. Terra è cinque volte più veloce; Luna è quasi sette volte più veloce.
Un agente rende questo peggiore di una finestra di chat, perché non produce una lunga risposta — produce una risposta breve, chiama uno strumento, legge il risultato e produce un'altra. Moltiplica la penalità su venti andate e ritorni e l'indice di intelligenza smette di essere il numero decisivo.
Il tempo per il primo token punta nella stessa direzione, con una onesta avvertenza. Kimi K3 impiega 125.71 secondi per avviarsi, contro 31.35 per Opus 5 e 87.13 per Sol — ma Terra al massimo sforzo impiega 151.8, il che è peggio. Quindi queste cifre appartengono a configurazioni di ragionamento a massimo sforzo piuttosto che a Kimi K3 specificamente, e questo stabilisce la vera differenza.
I modelli chiusi forniscono un controllo della latenza
Il nostro snapshot include cinque livelli di sforzo per Claude Opus 5 e sei per ciascuna variante di GPT-5.6. Kimi K3 appare come una singola riga.
Quell'asimmetria vale denaro, perché i livelli sono un commercio documentato di punteggio contro tempo. Sol ad alto sforzo ottiene un punteggio di 55.9 e inizia in 8.65 secondi. Terra a sforzo xhigh ottiene 51.6 in 9.55 secondi. Opus 5 a basso sforzo ottiene 50.6 in 3.01 secondi. Quindi il confronto equo per un servizio vincolato dalla latenza non è Kimi K3 contro Sol a massimo sforzo; è 57.1 in 125.71 secondi contro 55.9 in 8.65 secondi. Rinuncia a 1.2 punti di indice e inizia quattordici volte prima.
Per un lavoro batch notturno il controllo non vale nulla e la riga aperta vince sul prezzo. Con una persona o un ciclo di agente che aspetta dall'altra parte, il controllo vale più dei 1.8 punti tra Kimi K3 e Sol.
Un milione di token di contesto, e cosa vale
L'elenco del catalogo riporta una finestra di contesto di 1,048,576 token, modalità testo+immagine→testo, e supporto per chiamate a strumenti. Il benchmark supporta la finestra piuttosto che semplicemente affermarla: 74.7 su Long Context Reasoning è il migliore dei sei, che è la prova che vuoi prima di fidarti di un prompt da un milione di token con qualsiasi cosa.
Sii chiaro su cosa compri con i $15, però. Ventinove altri elenchi nello stesso catalogo di 184 modelli riportano una finestra di un milione di token o più, e ventotto di essi addebitano meno di $15 per milione di token in uscita — la mediana è $0.98, e quindici sono sotto $1. Una finestra molto grande non è più una caratteristica premium. Ciò che i $15 comprano è il 57.1, il 33.4 su banking e il 93.5 su GPQA — ragionamento che regge attraverso la finestra, non la finestra stessa.
Questi numeri cambiano ogni mattina
Prezzi, finestre di contesto e indici di benchmark per centinaia di modelli, ricostruiti quotidianamente. Gratuito, senza registrazione.
Apri il comparatore →Come scegliere
Hai bisogno dei pesi tra le mani. Kimi K3, e budget per 2.8 trilioni di parametri piuttosto che per un download. Fai prima il lavoro di capacità, e leggi i termini allegati al checkpoint se il motivo è legale piuttosto che tecnico.
Vuoi il vertice della classifica e il costo è secondario. Claude Opus 5, a 60.7 e 78.0 per $25 per milione di token in uscita, e la configurazione a massimo sforzo più veloce per avviarsi a 31.35 secondi.
Il tuo ciclo di agente è vincolato dalla latenza. GPT-5.6 Sol a sforzo elevato — 55.9 in 8.65 secondi — o i 165.4 token al secondo di Terra se la generazione sostenuta è il collo di bottiglia. Per un alto volume su compiti ordinari, GPT-5.6 Luna a $6 e 220.4 token al secondo ottiene 51.2, che è il margine che hai già per classificazione ed estrazione.
Documenti lunghi e utilizzo di strumenti multi-turn. Kimi K3 di nuovo, sui due benchmark guida con 74.7 e 33.4. Se puoi assorbire il throughput, questo è il carico di lavoro in cui non è affatto un compromesso.
Il punto fondamentale
Un modello open-weight ora batte uno chiuso allo stesso prezzo e si avvicina a 1.8 punti da un modello che costa il doppio, mentre guida il set frontier su ragionamento a lungo contesto e su un compito realistico di agente bancario. Questo è ciò che dice il leaderboard, ed è vero.
La voce del catalogo racconta l'altra metà: 2.8 trilioni di parametri, 32.9 token al secondo, 125.71 secondi prima del primo token. I pesi sono suoi da detenere; la macchina non è inclusa e la latenza non è opzionale, e nessuno dei due appare in un punteggio di 57.1. Gli open weights hanno smesso di essere un compromesso sulla capacità e sono diventati una decisione sull'infrastruttura — un problema molto più interessante da avere.