Le sommet du classement est un plateau — et l'un des quatre est en open weights
Claude Opus 5, Claude Fable 5, GPT-5.6 Sol et Kimi K3 se situent à 3,6 points les uns des autres en intelligence. Leurs prix de sortie varient de 3,3×. Cet écart entre capacité et prix est toute l'histoire.
TL;DR — la version courte
Claude Opus 5 est en tête des deux indices et coûte la moitié du prix de Claude Fable 5. Le modèle phare d'Anthropic n'est pas le meilleur modèle d'Anthropic selon ces mesures.
Kimi K3 est open-weight et se classe à 3.6 points derrière le leader, à 30 % du prix de sortie de Fable 5. À 15 $ par million de tokens de sortie, il coûte exactement ce que coûte GPT-5.6 Terra — et obtient 2,1 points de plus.
Le prix ne suit plus la capacité au sommet. Choisissez en fonction de la latence, de la licence et de la fenêtre de contexte, car c'est là que ces quatre modèles diffèrent réellement.
Les chiffres, ce matin
Tout ce qui suit provient de notre fusion de benchmark quotidienne, sourcée auprès d'Artificial Analysis et reconstruite chaque matin. Deux indices composites — Intelligence et Codage — plus le débit et le prix que nous suivons nous-mêmes. Pas d'estimations, pas d'arrondis.
| Modèle | Intelligence | Codage | $ / 1M sortie | Tokens / s | Poids |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | Fermé |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | Fermé |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | Fermé |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | Ouvert |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | Fermé |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | Fermé |
| DeepSeek V4 Flash | 40.3 | 56.2 | $0.28 | 125.4 | Ouvert |
Lisez à nouveau les quatre premières lignes. L'écart entre Kimi K3 et Opus 5 est 3,6 points d'intelligence — environ six pour cent. L'écart de prix de sortie entre ces quatre modèles est 15 $ à 50 $. La capacité s'est compressée ; les prix non.
Le modèle phare d'Anthropic n'est pas son meilleur modèle
Claude Fable 5 est le modèle qu'Anthropic met en avant, et c'est le plus cher des sept à 50 $ par million de tokens de sortie. Claude Opus 5 le surpasse sur les deux indices — 60,7 contre 59,9 en intelligence, 78,0 contre 76,5 en codage — pour la moitié du prix.
Opus 5 est également plus rapide pour le premier token : 31 secondes contre 80. Sur une longue course agentique, cette différence s'accumule.
Il y a un avertissement qui mérite d'être énoncé clairement : Fable 5 fonctionne avec une configuration de raisonnement adaptatif avec un retour à Opus 4.8, donc les deux ne sont pas des produits identiques. Mais sur les chiffres qu'un acheteur compare réellement — score, prix, latence — le moins cher gagne sur les trois.
Un modèle open weights égale désormais la gamme moyenne d'OpenAI, au même prix
Kimi K3, de Moonshot AI, est livré avec des open weights. Il obtient 57.1 en intelligence. GPT-5.6 Terra obtient 55.0. Les deux coûtent $15 par million de tokens de sortie.
C'est la phrase que ce site a été construit pour pouvoir écrire. Un modèle open-weight, que vous pouvez télécharger et exécuter vous-même, surpasse un modèle intermédiaire fermé au même prix. Il y a deux ans, l'écart ouvert était mesuré en générations ; ici, il est à 3.6 points derrière le leader absolu.
GPT-5.6 est quatre modèles, pas un
“GPT-5.6” désigne une famille, et les variantes sont très éloignées. Sol obtient 58,9 à 30 $. Terra obtient 55,0 à 15 $. Luna obtient 51,2 à 6 $.
Considérez cela comme une échelle plutôt qu'une liste : chaque étape vers le bas coûte deux fois moins cher et donne trois à quatre points de moins.Luna coûte un cinquième du prix de Sol pour 87 % de son score d'intelligence, et c'est la chose la plus rapide ici à 220 tokens par seconde. Pour la classification, l'extraction ou la résumation, payer pour Sol, c'est payer pour une marge que vous n'utiliserez pas.
Ce que le leaderboard ne vous dit pas
Scores d'Opus 5 89.1 sur Terminal-Bench et 93.2 sur GPQA.Il obtient également un score de 30.3 sur τ-Bench Banking.Le modèle le mieux classé au monde réussit environ un tiers d'une tâche réaliste d'agent bancaire.
Les indices composites moyennent exactement ce genre de variance. Un modèle qui est excellent pour le travail terminal et médiocre pour l'utilisation d'outils multi-tours ressemble à un seul nombre, et ce nombre ne prédit pas comment il se comporte sur votre tâche. Testez sur votre propre charge de travail avant de vous engager.
Il en va de même pour le temps jusqu'au premier token, que aucun de ces indices n'inclut. DeepSeek V4 Flash répond en moins d'une seconde.Kimi K3 prend 126 secondes pour démarrer. Pour une interface de chat, ce sont des produits différents, peu importe ce que leurs scores disent.
Comment choisir
Raisonnement le plus difficile, coût secondaire. Claude Opus 5. Il mène les deux indices et sous-cote Fable 5 de moitié.
Vous voulez la vitesse avant tout. GPT-5.6 Luna à 220 tokens par seconde, ou DeepSeek V4 Flash si la latence sous la seconde est plus importante que les dix derniers points de score.
Vous avez besoin des poids. Kimi K3 — pour l'auditabilité, le déploiement sur site, ou parce qu'un changement de licence dans une API fermée est un risque que vous ne pouvez pas prendre. Vous acceptez la pénalité de débit en connaissance de cause.
Volume élevé, tâches ordinaires. DeepSeek V4 Flash. À 0,28 $ par million de tokens de sortie, il est 179 fois moins cher que Fable 5, et il est quatre fois plus rapide. Il obtient deux tiers du score, ce qui est suffisant pour l'extraction et la classification.
Ces chiffres changent chaque matin
Prix, fenêtres de contexte et indices de référence pour plus de 500 modèles, reconstruits quotidiennement. Gratuit, sans inscription.
Ouvrez le comparateur →Le constat
La frontière s'est aplatie. Lorsque quatre modèles se situent à six pour cent les uns des autres en capacité tandis que leurs prix varient de 3,3×, le leaderboard cesse d'être un guide d'achat. Ce qui les sépare encore, c'est le débit, la latence, la fenêtre de contexte et si vous êtes autorisé à conserver les poids.
Et le côté ouvert de ce tableau n'est plus un compromis que vous expliquez à votre conseil. C'est une ligne, 3,6 points en dessous, à 30 % du prix.