IA Local

Díganos qué máquina tiene — o deje que su navegador detecte lo que puede — y vea instantáneamente qué modelos open-weight se ejecutan en ella, cuáles están al borde y cuáles están fuera de alcance. Cada veredicto sigue la regla de tamaño publicada al final de la página. Nada se carga: la verificación se realiza completamente en su navegador.

Su máquina

Los navegadores ocultan su RAM y VRAM exactas por privacidad — la detección pre-rellena una mejor suposición, usted la corrige. Nada sale de esta página.

El veredicto, modelo por modelo

Cargando el catálogo open-weight…

La regla de tamaño, publicada: necesidad de memoria = pesos + caché KV + tiempo de ejecución. Pesos: un modelo de 4 bits (Q4_K_M) pesa aproximadamente 0.58 GB por mil millones de parámetros. Caché KV: crece con el contexto que utiliza — estimamos 0.125 MB por token a 8B, escalando con parámetros a la potencia 0.45 (calibrado en arquitecturas GQA comunes como Llama: ~1 GB a 8K para un 8B, ~10 GB a 32K para un 70B; las arquitecturas individuales varían en ±40%). Sobrecarga de tiempo de ejecución: 0.8 GB. Un modelo encaja cuando el total se mantiene por debajo 85% de la memoria de su GPU; 85–110% está en el límite; más allá, la RAM de la CPU puede funcionar, más lento. Apple Silicon comparte un solo grupo: contamos 70% de RAM unificada — y le indicamos a las compilaciones de MLX, el formato optimizado de Apple. Los modelos de mezcla de expertos se dimensionan por sus total parámetros. Los recuentos de parámetros se leen de los nombres de los modelos; los modelos sin un tamaño legible son excluidos. La lista fusiona nuestro catálogo de API alojadas con lanzamientos solo de pesos del catálogo público de Hugging Face (licencia declarada, no restringida) — por lo que los modelos locales sin API también aparecen aquí. Determinista, sin cuenta, sin telemetría — correcciones bienvenidas a [email protected].