A única regra que você precisa
Quase todo mundo executa modelos quantizados — comprimidos para cerca de 4 bits por peso (o formato chamado Q4_K_M), que mantém ~98% da qualidade com aproximadamente um quarto do tamanho. A regra é simples:
Na prática, os "bilhões de parâmetros" (B) de um modelo se mapeiam para VRAM aproximadamente assim: um 7–8B modelo precisa de ~6–8 GB, um 14B precisa de ~10–12 GB, um 32B precisa de ~20–24 GB, e um 70B precisa de ~40–48 GB — todos em Q4.
8 GB VRAM — nível de entrada
Suficiente para bate-papos diários, resumos e codificação simples. Execute 7–9B modelos no Q4: Llama 3.1 8B, Qwen3 8B, ou Gemma 3 4B com qualidade superior (Q8, ~4.5 GB). Para imagens, Sana e SDXL também se encaixam aqui.
12 GB VRAM — o ponto ideal para a maioria
A melhor faixa de valor. Execute 12–14B modelos, que parecem notavelmente mais inteligentes: Gemma 3 12B, Qwen3 14B, Phi-4 14B, ou DeepSeek-R1-Distill 14B para raciocínio passo a passo.
16 GB VRAM — confortável na faixa média
Executa modelos de 14B com espaço para contexto longo, além de modelos de 20B projetados especificamente como gpt-oss-20B, e até mesmo Gemma 3 27B no Q4 se você mantiver o contexto modesto. Um ótimo modelo versátil.
24 GB VRAM — o nível de potência local
Onde a IA local realmente brilha. Execute 27–35B modelos no Q4 com contexto longo: Qwen3 32B, Gemma 3 27B, ou DeepSeek-R1 32B. Esses rivalizam com assistentes em nuvem para a maioria das tarefas e são excelentes para codificação.
48 GB+ e além
Com 48 GB você alcança 70B modelos como Llama 3.3 70B no Q4 — qualidade quase de fronteira. Além disso, modelos gigantes de Mixture-of-Experts (DeepSeek V3, Qwen3 235B) precisam de várias placas ou GPUs de servidor.
Sem GPU? Apple Silicon & CPU
Apple Silicon (M-series) é uma joia escondida: sua memória unificada é compartilhada com a GPU, então um Mac com 32 GB pode executar modelos que precisariam de uma placa NVIDIA de 24 GB ou mais. Um Mac de 64 GB executa confortavelmente modelos de 70B. Em um CPU sem GPU, você ainda pode executar pequenos modelos de 1–4B (lentamente) usando a RAM do sistema — bom para testes, não para uso diário.
Resumo de VRAM
| VRAM | Tamanho do modelo (Q4) | Modelos de exemplo | Bom para |
|---|---|---|---|
| 8 GB | 7–9B | Llama 3.1 8B, Qwen3 8B, Gemma 3 4B | Chat, resumos, codificação leve |
| 12 GB | 12–14B | Gemma 3 12B, Qwen3 14B, Phi-4 14B | Chat mais inteligente, raciocínio, codificação |
| 16 GB | 14–27B | gpt-oss-20B, Gemma 3 27B (Q4) | Contexto longo, codificação mais forte |
| 24 GB | 27–35B | Qwen3 32B, DeepSeek-R1 32B | Qualidade quase em nuvem, codificação séria |
| 48 GB+ | 70B+ | Llama 3.3 70B, modelos MoE | Classe frontier, local |
Perguntas Frequentes
Quanto de VRAM eu preciso para rodar um LLM local?
8 GB é o mínimo prático para um modelo útil (7–8B). 12–16 GB é o ponto ideal para a maioria das pessoas, e 24 GB permite rodar modelos de 32B que rivalizam com assistentes em nuvem.
O que é quantização (Q4)?
A quantização comprime um modelo para menos bits por peso. Q4_K_M (~4 bits) é o padrão: mantém quase toda a qualidade enquanto reduz o tamanho — e a necessidade de VRAM — para cerca de um quarto.
Posso rodar um modelo de 70B em casa?
Sim, com ~48 GB de VRAM — duas placas RTX 3090/4090, uma RTX 6000, ou um Mac Apple Silicon de 64 GB. Em uma única placa de 24 GB, um modelo de 32B é o teto prático.
Preciso de uma GPU NVIDIA?
NVIDIA é a mais fácil e rápida, mas não é obrigatória. Macs Apple Silicon são excelentes graças à memória unificada, e GPUs AMD funcionam com ferramentas como Ollama e LM Studio.
A janela de contexto afeta a VRAM?
Sim. Contexto mais longo (a quantidade de texto que o modelo lê de uma vez) usa memória extra para o "cache KV". Um grande contexto de 128K pode adicionar vários GB, então deixe espaço acima do tamanho base do modelo.
E se eu tiver apenas uma CPU?
Você ainda pode rodar pequenos modelos de 1–4B usando RAM do sistema, mas é lento. Para uma experiência real, você quer uma GPU ou um Mac Apple Silicon.