Preços ao vivo por token para cada modelo principal — proprietário e de peso aberto — em um só lugar. Veja os custos de relance no gráfico, calcule sua conta mensal, compare modelos lado a lado e descubra quanto custaria executar a mesma carga de trabalho no seu próprio hardware: para modelos de peso aberto, nada além de eletricidade.
Preços extraídos de dados ao vivo · rastreados ao longo do tempo · olud.ai
Barras escalam para o modelo mais caro mostrado. Menor é mais barato.
Todo preço acima é o que um provedor cobra para executar um modelo para você. Mas modelos de peso aberto — DeepSeek, Llama, Qwen, Mistral, Gemma — são gratuitos para baixar e executar em sua própria GPU. Após o hardware, o custo marginal por token é basicamente eletricidade. Para cargas de trabalho constantes e de alto volume, isso muda completamente a matemática.
Para cada modelo pago popular, aqui está o modelo de peso aberto para o qual as pessoas mudam, e onde ler sobre isso:
Método. Os preços são por milhão de tokens, extraídos da API OpenRouter e atualizados diariamente. O custo “misturado” pesa a entrada e a saída 3:1, um proxy comum de número único. O custo de auto-hospedagem é marginal (eletricidade) e exclui hardware — os números reais dependem da sua GPU, utilização e preço da energia. O histórico de movimentos de preços é registrado desde o lançamento, então a seção de movimentos se preencherá nas próximas semanas.
Os preços dizem o que um modelo custa. A classificação diz se ele é bom — modelos de pesos abertos classificados pelo uso no mundo real.
Abra a classificação →