Preços ao vivo por token para cada modelo principal — proprietário e open-weight — em um só lugar. Veja os custos de relance no gráfico, calcule sua conta mensal, compare modelos lado a lado e descubra quanto custaria executar a mesma carga de trabalho no seu próprio hardware: para modelos open-weight, nada além de eletricidade.
Preços extraídos de dados ao vivo · rastreados ao longo do tempo · olud.ai
Olud Ratio = Índice de Inteligência ÷ preço misto por milhão de tokens (ponderado entrada/saída 3:1) — pontos de inteligência por dólar, quanto maior, melhor.Os índices de Inteligência e Codificação são medidos por Artificial Analysis (variante com melhor pontuação por modelo); modelos sem um benchmark publicado mostram « — » e ficam em último lugar. Determinístico, sem ponderação editorial.
Barras escalam para o modelo mais caro mostrado. Menor é mais barato.
Todo preço acima é o que um provedor cobra para executar um modelo para você. Mas modelos open-weight — DeepSeek, Llama, Qwen, Mistral, Gemma — são gratuitos para baixar e executar na sua própria GPU. Após o hardware, o custo marginal por token é basicamente eletricidade. Para cargas de trabalho constantes e de alto volume, isso muda completamente a matemática.
Para cada modelo pago popular, aqui está o modelo open-weight para o qual as pessoas mudam, e onde ler sobre ele:
Método. Os preços são por milhão de tokens, extraídos da API OpenRouter e atualizados diariamente. O custo “misturado” pesa a entrada e a saída 3:1, um proxy comum de número único. O custo de auto-hospedagem é marginal (eletricidade) e exclui hardware — os números reais dependem da sua GPU, utilização e preço da energia. O histórico de movimentos de preços é registrado desde o lançamento, então a seção de movimentos se preencherá nas próximas semanas.
Os preços dizem o que um modelo custa. O leaderboard diz se ele é bom — modelos open-weight classificados por uso no mundo real.
Abra a classificação →