Herramientas de IA Proyectos Directorio
🏆 Tabla de Clasificación 📡 Noticias ✨ Prompts ⚖️ Comparar Modelos 🔧 Herramientas 📦 Proyectos 🚀 Espacios
Blog
Guía24 de julio de 2026⏱ 9 min de lectura

¿Qué modelo de AI puede ejecutar tu PC en 2026?
(Una guía por GPU & VRAM)

La pregunta más frecuente sobre AI local es "¿funcionará en mi máquina?" La respuesta se reduce a un número: la VRAM (memoria de video). Esta guía te ofrece una regla simple, luego un desglose por niveles — desde un portátil de 8 GB hasta una estación de trabajo de 24 GB — con los modelos abiertos exactos para ejecutar en cada nivel en 2026. Sin exageraciones, solo lo que se adapta.

La única regla que necesitas

Casi todos ejecutan modelos cuantizados — comprimidos a aproximadamente 4 bits por peso (el formato llamado Q4_K_M), que mantiene ~98% de la calidad a aproximadamente una cuarta parte del tamaño. La regla es simple:

📏 Regla general: la VRAM que necesitas ≈ el tamaño del archivo Q4 del modelo + aproximadamente 1–1.5 GB de sobrecarga. Ventanas de contexto largas (32K+) añaden más. Así que un modelo cuyo archivo Q4 es ~6 GB funciona cómodamente con 8 GB de VRAM.

En la práctica, los "miles de millones de parámetros" (B) de un modelo se mapean a la VRAM aproximadamente así: un 7–8B modelo necesita ~6–8 GB, un 14B necesita ~10–12 GB, un 32B necesita ~20–24 GB, y un 70B necesita ~40–48 GB — todo en Q4.

8 GB VRAM — nivel de entrada

GTX 1070 / RTX 3050 / RTX 4060 / la mayoría de las laptops para juegos

Suficiente para chat diario, resúmenes y codificación simple. Ejecutar 7–9B modelos en Q4: Llama 3.1 8B, Qwen3 8B, o Gemma 3 4B con mayor calidad (Q8, ~4.5 GB). Para imágenes, Sana y SDXL también encajan aquí.

12 GB VRAM — el punto óptimo para la mayoría

RTX 3060 12GB / RTX 4070

La mejor categoría de valor. Ejecuta 12–14B modelos, que se sienten notablemente más inteligentes: Gemma 3 12B, Qwen3 14B, Phi-4 14B, o DeepSeek-R1-Distill 14B para razonamiento paso a paso.

16 GB VRAM — rango medio cómodo

RTX 4060 Ti 16GB / RTX 4070 Ti Super / RTX 5070

Ejecuta modelos de 14B con espacio para un contexto largo, además de modelos de 20B diseñados para propósitos como gpt-oss-20B, e incluso Gemma 3 27B en Q4 si mantienes el contexto modesto. Un gran todoterreno.

24 GB VRAM — el nivel de potencia local

RTX 3090 / RTX 4090 / RTX 5090

Donde la IA local realmente brilla. Ejecuta 27–35B modelos en Q4 con contexto largo: Qwen3 32B, Gemma 3 27B, o DeepSeek-R1 32B. Estos rivalizan con asistentes en la nube para la mayoría de las tareas y son excelentes para codificación.

48 GB+ y más allá

Dual RTX 3090/4090, RTX 6000 Ada, o una tarjeta de centro de datos

Con 48 GB alcanzas 70B modelos como Llama 3.3 70B en Q4 — calidad casi frontera. Más allá de eso, los modelos gigantes de Mixture-of-Experts (DeepSeek V3, Qwen3 235B) necesitan múltiples tarjetas o GPUs de servidor.

¿Sin GPU? Apple Silicon & CPU

Apple Silicon (M-series) es una joya oculta: su memoria unificada se comparte con la GPU, por lo que un Mac con 32 GB puede ejecutar modelos que necesitarían una tarjeta NVIDIA de 24 GB+. Un Mac de 64 GB ejecuta cómodamente modelos de 70B. En un CPU sin GPU, aún puedes ejecutar pequeños modelos de 1–4B (lentamente) usando RAM del sistema — bien para pruebas, no para uso diario.

Hoja de trucos de VRAM

VRAMTamaño del modelo (Q4)Modelos de ejemploBueno para
8 GB7–9BLlama 3.1 8B, Qwen3 8B, Gemma 3 4BChat, resúmenes, codificación ligera
12 GB12–14BGemma 3 12B, Qwen3 14B, Phi-4 14BChat más inteligente, razonamiento, codificación
16 GB14–27Bgpt-oss-20B, Gemma 3 27B (Q4)Contexto largo, codificación más fuerte
24 GB27–35BQwen3 32B, DeepSeek-R1 32BCalidad cercana a la nube, codificación seria
48 GB+70B+Llama 3.3 70B, modelos MoEClase frontera, local
Cómo ejecutarlos realmente: instalar Ollama o LM Studio, elige un modelo de la lista, y descarga automáticamente el archivo cuantizado correcto. Guía completa en Ejecutar IA Localmente de Forma Gratuitay ver el Mejores Modelos de IA de Código Abierto para probar primero.

Preguntas Frecuentes

¿Cuánta VRAM necesito para ejecutar un LLM local?

8 GB es el mínimo práctico para un modelo útil (7–8B). 12–16 GB es el punto óptimo para la mayoría de las personas, y 24 GB te permite ejecutar modelos de 32B que rivalizan con asistentes en la nube.

¿Qué es la cuantización (Q4)?

La cuantización comprime un modelo a menos bits por peso. Q4_K_M (~4 bits) es el estándar: mantiene casi toda la calidad mientras reduce el tamaño — y la necesidad de VRAM — a aproximadamente una cuarta parte.

¿Puedo ejecutar un modelo de 70B en casa?

Sí, con ~48 GB de VRAM — dos tarjetas RTX 3090/4090, una RTX 6000, o un Mac Apple Silicon de 64 GB. En una sola tarjeta de 24 GB, un modelo de 32B es el límite práctico.

¿Necesito una GPU NVIDIA?

NVIDIA es la más fácil y rápida, pero no es obligatoria. Los Macs Apple Silicon son excelentes gracias a la memoria unificada, y las GPUs AMD funcionan con herramientas como Ollama y LM Studio.

¿Afecta la ventana de contexto a la VRAM?

Sí. Un contexto más largo (la cantidad de texto que el modelo lee a la vez) utiliza memoria extra para la "cache KV". Un contexto grande de 128K puede añadir varios GB, así que deja margen por encima del tamaño del modelo base.

¿Qué pasa si solo tengo una CPU?

Aún puedes ejecutar modelos pequeños de 1–4B usando RAM del sistema, pero es lento. Para una experiencia real, necesitas una GPU o un Mac Apple Silicon.