Outils IA Projets Annuaire
🏆 Classement 📡 Actualités ✨ Invites ⚖️ Comparer les Modèles 🔧 Outils 📦 Projets 🚀 Espaces
Blog
Comparaison de modèles

Le sommet du classement est un plateau — et l'un des quatre est en open weights

Claude Opus 5, Claude Fable 5, GPT-5.6 Sol et Kimi K3 se situent à 3,6 points les uns des autres en intelligence. Leurs prix de sortie varient de 3,3×. Cet écart entre capacité et prix est toute l'histoire.

Mis à jour le 28 juillet 2026·8 min de lecture·Pas de mur payant

TL;DR — la version courte

Claude Opus 5 est en tête des deux indices et coûte la moitié du prix de Claude Fable 5. Le modèle phare d'Anthropic n'est pas le meilleur modèle d'Anthropic selon ces mesures.

Kimi K3 est open-weight et se classe à 3.6 points derrière le leader, à 30 % du prix de sortie de Fable 5. À 15 $ par million de tokens de sortie, il coûte exactement ce que coûte GPT-5.6 Terra — et obtient 2,1 points de plus.

Le prix ne suit plus la capacité au sommet. Choisissez en fonction de la latence, de la licence et de la fenêtre de contexte, car c'est là que ces quatre modèles diffèrent réellement.

Les chiffres, ce matin

Tout ce qui suit provient de notre fusion de benchmark quotidienne, sourcée auprès d'Artificial Analysis et reconstruite chaque matin. Deux indices composites — Intelligence et Codage — plus le débit et le prix que nous suivons nous-mêmes. Pas d'estimations, pas d'arrondis.

ModèleIntelligenceCodage$ / 1M sortieTokens / sPoids
Claude Opus 560.778.0$2562.8Fermé
Claude Fable 559.976.5$5071.3Fermé
GPT-5.6 Sol58.977.4$3090.2Fermé
Kimi K357.176.2$1532.9Ouvert
GPT-5.6 Terra55.076.7$15165.4Fermé
GPT-5.6 Luna51.271.4$6220.4Fermé
DeepSeek V4 Flash40.356.2$0.28125.4Ouvert

Lisez à nouveau les quatre premières lignes. L'écart entre Kimi K3 et Opus 5 est 3,6 points d'intelligence — environ six pour cent. L'écart de prix de sortie entre ces quatre modèles est 15 $ à 50 $. La capacité s'est compressée ; les prix non.

Le modèle phare d'Anthropic n'est pas son meilleur modèle

Claude Fable 5 est le modèle qu'Anthropic met en avant, et c'est le plus cher des sept à 50 $ par million de tokens de sortie. Claude Opus 5 le surpasse sur les deux indices — 60,7 contre 59,9 en intelligence, 78,0 contre 76,5 en codage — pour la moitié du prix.

Opus 5 est également plus rapide pour le premier token : 31 secondes contre 80. Sur une longue course agentique, cette différence s'accumule.

Claude Opus 5 versus Claude Fable 5: output price per million tokens
Opus 5 est en tête des deux indices à moitié prix. Redessiné quotidiennement à partir des prix en direct.

Il y a un avertissement qui mérite d'être énoncé clairement : Fable 5 fonctionne avec une configuration de raisonnement adaptatif avec un retour à Opus 4.8, donc les deux ne sont pas des produits identiques. Mais sur les chiffres qu'un acheteur compare réellement — score, prix, latence — le moins cher gagne sur les trois.

Un modèle open weights égale désormais la gamme moyenne d'OpenAI, au même prix

Kimi K3, de Moonshot AI, est livré avec des open weights. Il obtient 57.1 en intelligence. GPT-5.6 Terra obtient 55.0. Les deux coûtent $15 par million de tokens de sortie.

C'est la phrase que ce site a été construit pour pouvoir écrire. Un modèle open-weight, que vous pouvez télécharger et exécuter vous-même, surpasse un modèle intermédiaire fermé au même prix. Il y a deux ans, l'écart ouvert était mesuré en générations ; ici, il est à 3.6 points derrière le leader absolu.

Kimi K3 versus GPT-5.6 Terra: output price per million tokens
Même prix, 2,1 points d'écart — et l'un d'eux expédie ses poids.
Kimi K3 paie cela avec un débit : 32,9 tokens par seconde, le plus lent des sept. GPT-5.6 Terra fonctionne à 165,4 — cinq fois plus rapide. Si vos utilisateurs attendent la sortie, cela compte plus que deux points d'indice.

GPT-5.6 est quatre modèles, pas un

“GPT-5.6” désigne une famille, et les variantes sont très éloignées. Sol obtient 58,9 à 30 $. Terra obtient 55,0 à 15 $. Luna obtient 51,2 à 6 $.

Considérez cela comme une échelle plutôt qu'une liste : chaque étape vers le bas coûte deux fois moins cher et donne trois à quatre points de moins.Luna coûte un cinquième du prix de Sol pour 87 % de son score d'intelligence, et c'est la chose la plus rapide ici à 220 tokens par seconde. Pour la classification, l'extraction ou la résumation, payer pour Sol, c'est payer pour une marge que vous n'utiliserez pas.

Ce que le leaderboard ne vous dit pas

Scores d'Opus 5 89.1 sur Terminal-Bench et 93.2 sur GPQA.Il obtient également un score de 30.3 sur τ-Bench Banking.Le modèle le mieux classé au monde réussit environ un tiers d'une tâche réaliste d'agent bancaire.

Les indices composites moyennent exactement ce genre de variance. Un modèle qui est excellent pour le travail terminal et médiocre pour l'utilisation d'outils multi-tours ressemble à un seul nombre, et ce nombre ne prédit pas comment il se comporte sur votre tâche. Testez sur votre propre charge de travail avant de vous engager.

Il en va de même pour le temps jusqu'au premier token, que aucun de ces indices n'inclut. DeepSeek V4 Flash répond en moins d'une seconde.Kimi K3 prend 126 secondes pour démarrer. Pour une interface de chat, ce sont des produits différents, peu importe ce que leurs scores disent.

Comment choisir

Raisonnement le plus difficile, coût secondaire. Claude Opus 5. Il mène les deux indices et sous-cote Fable 5 de moitié.

Vous voulez la vitesse avant tout. GPT-5.6 Luna à 220 tokens par seconde, ou DeepSeek V4 Flash si la latence sous la seconde est plus importante que les dix derniers points de score.

Vous avez besoin des poids. Kimi K3 — pour l'auditabilité, le déploiement sur site, ou parce qu'un changement de licence dans une API fermée est un risque que vous ne pouvez pas prendre. Vous acceptez la pénalité de débit en connaissance de cause.

Volume élevé, tâches ordinaires. DeepSeek V4 Flash. À 0,28 $ par million de tokens de sortie, il est 179 fois moins cher que Fable 5, et il est quatre fois plus rapide. Il obtient deux tiers du score, ce qui est suffisant pour l'extraction et la classification.

Ces chiffres changent chaque matin

Prix, fenêtres de contexte et indices de référence pour plus de 500 modèles, reconstruits quotidiennement. Gratuit, sans inscription.

Ouvrez le comparateur →

Le constat

La frontière s'est aplatie. Lorsque quatre modèles se situent à six pour cent les uns des autres en capacité tandis que leurs prix varient de 3,3×, le leaderboard cesse d'être un guide d'achat. Ce qui les sépare encore, c'est le débit, la latence, la fenêtre de contexte et si vous êtes autorisé à conserver les poids.

Et le côté ouvert de ce tableau n'est plus un compromis que vous expliquez à votre conseil. C'est une ligne, 3,6 points en dessous, à 30 % du prix.