La única regla que necesitas
Casi todos ejecutan modelos cuantizados — comprimidos a aproximadamente 4 bits por peso (el formato llamado Q4_K_M), que mantiene ~98% de la calidad a aproximadamente una cuarta parte del tamaño. La regla es simple:
En la práctica, los "miles de millones de parámetros" (B) de un modelo se mapean a la VRAM aproximadamente así: un 7–8B modelo necesita ~6–8 GB, un 14B necesita ~10–12 GB, un 32B necesita ~20–24 GB, y un 70B necesita ~40–48 GB — todo en Q4.
8 GB VRAM — nivel de entrada
Suficiente para chat diario, resúmenes y codificación simple. Ejecutar 7–9B modelos en Q4: Llama 3.1 8B, Qwen3 8B, o Gemma 3 4B con mayor calidad (Q8, ~4.5 GB). Para imágenes, Sana y SDXL también encajan aquí.
12 GB VRAM — el punto óptimo para la mayoría
La mejor categoría de valor. Ejecuta 12–14B modelos, que se sienten notablemente más inteligentes: Gemma 3 12B, Qwen3 14B, Phi-4 14B, o DeepSeek-R1-Distill 14B para razonamiento paso a paso.
16 GB VRAM — rango medio cómodo
Ejecuta modelos de 14B con espacio para un contexto largo, además de modelos de 20B diseñados para propósitos como gpt-oss-20B, e incluso Gemma 3 27B en Q4 si mantienes el contexto modesto. Un gran todoterreno.
24 GB VRAM — el nivel de potencia local
Donde la IA local realmente brilla. Ejecuta 27–35B modelos en Q4 con contexto largo: Qwen3 32B, Gemma 3 27B, o DeepSeek-R1 32B. Estos rivalizan con asistentes en la nube para la mayoría de las tareas y son excelentes para codificación.
48 GB+ y más allá
Con 48 GB alcanzas 70B modelos como Llama 3.3 70B en Q4 — calidad casi frontera. Más allá de eso, los modelos gigantes de Mixture-of-Experts (DeepSeek V3, Qwen3 235B) necesitan múltiples tarjetas o GPUs de servidor.
¿Sin GPU? Apple Silicon & CPU
Apple Silicon (M-series) es una joya oculta: su memoria unificada se comparte con la GPU, por lo que un Mac con 32 GB puede ejecutar modelos que necesitarían una tarjeta NVIDIA de 24 GB+. Un Mac de 64 GB ejecuta cómodamente modelos de 70B. En un CPU sin GPU, aún puedes ejecutar pequeños modelos de 1–4B (lentamente) usando RAM del sistema — bien para pruebas, no para uso diario.
Hoja de trucos de VRAM
| VRAM | Tamaño del modelo (Q4) | Modelos de ejemplo | Bueno para |
|---|---|---|---|
| 8 GB | 7–9B | Llama 3.1 8B, Qwen3 8B, Gemma 3 4B | Chat, resúmenes, codificación ligera |
| 12 GB | 12–14B | Gemma 3 12B, Qwen3 14B, Phi-4 14B | Chat más inteligente, razonamiento, codificación |
| 16 GB | 14–27B | gpt-oss-20B, Gemma 3 27B (Q4) | Contexto largo, codificación más fuerte |
| 24 GB | 27–35B | Qwen3 32B, DeepSeek-R1 32B | Calidad cercana a la nube, codificación seria |
| 48 GB+ | 70B+ | Llama 3.3 70B, modelos MoE | Clase frontera, local |
Preguntas Frecuentes
¿Cuánta VRAM necesito para ejecutar un LLM local?
8 GB es el mínimo práctico para un modelo útil (7–8B). 12–16 GB es el punto óptimo para la mayoría de las personas, y 24 GB te permite ejecutar modelos de 32B que rivalizan con asistentes en la nube.
¿Qué es la cuantización (Q4)?
La cuantización comprime un modelo a menos bits por peso. Q4_K_M (~4 bits) es el estándar: mantiene casi toda la calidad mientras reduce el tamaño — y la necesidad de VRAM — a aproximadamente una cuarta parte.
¿Puedo ejecutar un modelo de 70B en casa?
Sí, con ~48 GB de VRAM — dos tarjetas RTX 3090/4090, una RTX 6000, o un Mac Apple Silicon de 64 GB. En una sola tarjeta de 24 GB, un modelo de 32B es el límite práctico.
¿Necesito una GPU NVIDIA?
NVIDIA es la más fácil y rápida, pero no es obligatoria. Los Macs Apple Silicon son excelentes gracias a la memoria unificada, y las GPUs AMD funcionan con herramientas como Ollama y LM Studio.
¿Afecta la ventana de contexto a la VRAM?
Sí. Un contexto más largo (la cantidad de texto que el modelo lee a la vez) utiliza memoria extra para la "cache KV". Un contexto grande de 128K puede añadir varios GB, así que deja margen por encima del tamaño del modelo base.
¿Qué pasa si solo tengo una CPU?
Aún puedes ejecutar modelos pequeños de 1–4B usando RAM del sistema, pero es lento. Para una experiencia real, necesitas una GPU o un Mac Apple Silicon.