Diga-nos qual máquina você tem — ou deixe seu navegador detectar o que pode — e veja instantaneamente quais modelos open-weight rodam nela, quais estão na borda e quais estão fora de alcance. Cada veredicto segue a regra de dimensionamento publicada no final da página. Nada é enviado: a verificação é executada inteiramente no seu navegador.
A regra de dimensionamento, publicada: necessidade de memória = pesos + cache KV + tempo de execução. Pesos: um modelo de 4 bits (Q4_K_M) pesa cerca de 0.58 GB por bilhão de parâmetros. Cache KV: cresce com o contexto que você usa — estimamos 0.125 MB por token a 8B, escalando com parâmetros na potência 0.45 (calibrado em arquiteturas GQA comuns como Llama: ~1 GB a 8K para um 8B, ~10 GB a 32K para um 70B; arquiteturas individuais variam em ±40%). Sobrecarga de tempo de execução: 0.8 GB. Um modelo se encaixa quando o total permanece abaixo 85% da sua memória GPU; 85–110% é na borda; além disso, a RAM da CPU pode ainda funcionar, mais lenta. Apple Silicon compartilha um pool: contamos 70% de RAM unificada — e apontamos você para construções MLX, o formato otimizado da Apple. Modelos de mistura de especialistas são dimensionados por seus total parâmetros. Contagens de parâmetros são lidas a partir dos nomes dos modelos; modelos sem um tamanho legível são excluídos. A lista mescla nosso catálogo de API hospedada com lançamentos apenas de pesos do catálogo público do Hugging Face (licença declarada, não restrita) — então modelos locais sem API também aparecem aqui. Determinístico, sem conta, sem telemetria — correções são bem-vindas em [email protected].