O topo é um plateau — e um dos quatro é open weights
Claude Opus 5, Claude Fable 5, GPT-5.6 Sol e Kimi K3 estão a 3.6 pontos uns dos outros em inteligência. Seus preços de saída variam em 3.3×. Essa diferença entre capacidade e preço é toda a história.
TL;DR — a versão curta
Claude Opus 5 lidera em ambos os índices e custa metade do que Claude Fable 5 custa. O modelo principal da Anthropic não é o melhor modelo da Anthropic nessas medidas.
Kimi K3 é open-weight e fica 3.6 pontos atrás do líder, a 30 % do preço de saída do Fable 5. A $15 por milhão de tokens de saída, custa exatamente o que o GPT-5.6 Terra custa — e pontua 2.1 pontos a mais.
O preço não acompanha mais a capacidade no topo. Escolha com base em latência, licença e janela de contexto, porque é aí que esses quatro realmente diferem.
Os números, esta manhã
Tudo abaixo vem da nossa fusão diária de benchmarks, obtida da Artificial Analysis e reconstruída todas as manhãs. Dois índices compostos — Inteligência e Codificação — além da taxa de transferência e preço que rastreamos nós mesmos. Sem estimativas, sem arredondamentos.
| Modelo | Inteligência | Codificação | $ / 1M saída | Tokens / s | Pesos |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | Fechado |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | Fechado |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | Fechado |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | Aberto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | Fechado |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | Fechado |
| DeepSeek V4 Flash | 40.3 | 56.2 | $0.28 | 125.4 | Aberto |
Leia as quatro primeiras linhas novamente. A diferença de Kimi K3 para Opus 5 é 3.6 pontos de inteligência — cerca de seis por cento. A diferença no preço de saída entre esses mesmos quatro modelos é $15 a $50. A capacidade se comprimiu; o preço não.
O modelo principal da Anthropic não é seu melhor modelo
Claude Fable 5 é o modelo que a Anthropic apresenta, e é o mais caro dos sete a $50 por milhão de tokens de saída. Claude Opus 5 o supera em ambos os índices — 60.7 contra 59.9 em inteligência, 78.0 contra 76.5 em codificação — por metade do preço.
Opus 5 também é mais rápido para o primeiro token: 31 segundos contra 80. Em uma execução longa e agente, essa diferença se acumula.
Há uma ressalva que vale a pena afirmar claramente: Fable 5 executa uma configuração de raciocínio adaptativo com um fallback de Opus 4.8, então os dois não são produtos idênticos. Mas nos números que um comprador realmente compara — pontuação, preço, latência — o mais barato vence em todos os três.
Um modelo open weights iguala agora a gama média da OpenAI, ao mesmo preço
Kimi K3, da Moonshot AI, vem com open weights. Ele pontua 57.1 em inteligência. GPT-5.6 Terra pontua 55.0. Ambos custam $15 por milhão de tokens de saída.
Essa é a frase que este site foi construído para poder escrever. Um modelo de open-weight, que você pode baixar e executar por conta própria, supera um modelo médio fechado pelo mesmo preço. Dois anos atrás, a diferença aberta era medida em gerações; aqui está 3.6 pontos atrás do líder absoluto.
GPT-5.6 são quatro modelos, não um
“GPT-5.6” nomeia uma família, e as variantes estão bem distantes. Sol pontua 58.9 a $30. Terra pontua 55.0 a $15. Luna pontua 51.2 a $6.
Leia isso como uma escada em vez de uma fila: cada degrau abaixo custa metade e perde de três a quatro pontos.Luna é um quinto do preço de Sol’s por 87 % de sua pontuação de inteligência, e é a coisa mais rápida aqui a 220 tokens por segundo. Para classificação, extração ou sumarização, pagar por Sol é pagar por espaço que você não usará.
O que o leaderboard não te diz
Opus 5 pontua 89.1 no Terminal-Bench e 93.2 no GPQA.Ele também pontua 30.3 no τ-Bench Banking.O modelo melhor classificado do mundo acerta aproximadamente um terço de uma tarefa realista de agente bancário.
Índices compostos eliminam exatamente esse tipo de variação. Um modelo que é excelente em trabalho terminal e medíocre em uso de ferramentas de múltiplas interações parece um único número, e esse número não preverá como ele se comporta na sua tarefa. Teste na sua própria carga de trabalho antes de se comprometer.
O mesmo se aplica ao tempo até o primeiro token, que nenhum desses índices inclui. DeepSeek V4 Flash responde em menos de um segundo.Kimi K3 leva 126 segundos para iniciar. Para uma interface de chat, esses são produtos diferentes, independentemente do que suas pontuações dizem.
Como escolher
Raciocínio mais difícil, custo secundário. Claude Opus 5. Ele lidera ambos os índices e subcorta Fable 5 pela metade.
Você quer velocidade acima de tudo. GPT-5.6 Luna a 220 tokens por segundo, ou DeepSeek V4 Flash se a latência sub-segundo importa mais do que os últimos dez pontos de pontuação.
Você precisa dos pesos. Kimi K3 — para auditabilidade, implantação local, ou porque uma mudança de licença em uma API fechada é um risco que você não pode assumir. Você aceita a penalidade de throughput conscientemente.
Alto volume, tarefas ordinárias. DeepSeek V4 Flash. A $0.28 por milhão de tokens de saída, é 179 vezes mais barato que Fable 5, e é quatro vezes mais rápido. Ele pontua dois terços tão bem, o que para extração e classificação é suficiente.
Esses números mudam toda manhã
Preços, janelas de contexto e índices de benchmark para 500+ modelos, reconstruídos diariamente. Grátis, sem cadastro.
Abra o comparador →A conclusão
A fronteira se achatou. Quando quatro modelos estão dentro de seis por cento uns dos outros em capacidade enquanto seus preços variam em 3.3×, o leaderboard deixa de ser um guia de compra. O que ainda os separa é throughput, latência, janela de contexto e se você pode manter os pesos.
E o lado aberto daquela tabela não é mais um compromisso que você explica ao seu conselho. É uma linha, 3.6 pontos abaixo, a 30 % do preço.