L'unica regola di cui hai bisogno
Quasi tutti eseguono modelli quantizzati — compressi a circa 4 bit per peso (il formato chiamato Q4_K_M), che mantiene ~98% della qualità a circa un quarto della dimensione. La regola è semplice:
In pratica, i "miliardi di parametri" (B) di un modello si mappano alla VRAM all'incirca in questo modo: un 7–8B modello ha bisogno di ~6–8 GB, un 14B ha bisogno di ~10–12 GB, un 32B ha bisogno di ~20–24 GB, e un 70B ha bisogno di ~40–48 GB — tutti a Q4.
8 GB VRAM — livello base
Abbastanza per chat quotidiane, riassunti e codifica semplice. Esegui 7–9B modelli a Q4: Llama 3.1 8B, Qwen3 8B, o Gemma 3 4B a qualità superiore (Q8, ~4.5 GB). Per le immagini, Sana e SDXL si adattano anche qui.
12 GB VRAM — il punto ideale per la maggior parte
Il miglior livello di valore. Esegui 12–14B modelli, che sembrano visibilmente più intelligenti: Gemma 3 12B, Qwen3 14B, Phi-4 14B, o DeepSeek-R1-Distill 14B per ragionamenti passo-passo.
16 GB VRAM — fascia media confortevole
Esegue modelli 14B con spazio per un lungo contesto, oltre a modelli specificamente progettati da 20B come gpt-oss-20B, e anche Gemma 3 27B a Q4 se mantieni il contesto modesto. Un ottimo tuttofare.
24 GB VRAM — la fascia di potenza locale
Dove l'IA locale brilla davvero. Esegui 27–35B modelli a Q4 con lungo contesto: Qwen3 32B, Gemma 3 27B, o DeepSeek-R1 32B. Questi rivaleggiano con gli assistenti cloud per la maggior parte dei compiti e sono eccellenti per la programmazione.
48 GB+ e oltre
Con 48 GB raggiungi 70B modelli come Llama 3.3 70B a Q4 — qualità quasi frontiera. Oltre a ciò, i modelli Mixture-of-Experts giganti (DeepSeek V3, Qwen3 235B) necessitano di più schede o GPU da server.
Nessuna GPU? Apple Silicon & CPU
Apple Silicon (M-series) è un gioiello nascosto: la sua memoria unificata è condivisa con la GPU, quindi un Mac con 32 GB può eseguire modelli che richiederebbero una scheda NVIDIA da 24 GB+. Un Mac da 64 GB esegue comodamente modelli da 70B. Su un CPU senza GPU, puoi comunque eseguire piccoli modelli da 1–4B (lentamente) utilizzando la RAM di sistema — buono per il testing, non per l'uso quotidiano.
Scheda di riferimento VRAM
| VRAM | Dimensione del modello (Q4) | Modelli di esempio | Buono per |
|---|---|---|---|
| 8 GB | 7–9B | Llama 3.1 8B, Qwen3 8B, Gemma 3 4B | Chat, riassunti, programmazione leggera |
| 12 GB | 12–14B | Gemma 3 12B, Qwen3 14B, Phi-4 14B | Chat più intelligente, ragionamento, codifica |
| 16 GB | 14–27B | gpt-oss-20B, Gemma 3 27B (Q4) | Lungo contesto, codifica più potente |
| 24 GB | 27–35B | Qwen3 32B, DeepSeek-R1 32B | Qualità quasi cloud, codifica seria |
| 48 GB+ | 70B+ | Llama 3.3 70B, modelli MoE | Classe frontier, locale |
Domande Frequenti
Quanta VRAM ho bisogno per eseguire un LLM locale?
8 GB è il minimo pratico per un modello utile (7–8B). 12–16 GB è il punto ideale per la maggior parte delle persone, e 24 GB ti consente di eseguire modelli da 32B che competono con gli assistenti cloud.
Cos'è la quantizzazione (Q4)?
La quantizzazione comprime un modello a meno bit per peso. Q4_K_M (~4 bit) è lo standard: mantiene quasi tutta la qualità riducendo le dimensioni — e il bisogno di VRAM — a circa un quarto.
Posso eseguire un modello da 70B a casa?
Sì, con ~48 GB di VRAM — due schede RTX 3090/4090, una RTX 6000, o un Mac Apple Silicon da 64 GB. Su una singola scheda da 24 GB, un modello da 32B è il limite pratico.
Ho bisogno di una GPU NVIDIA?
NVIDIA è la più semplice e veloce, ma non è obbligatoria. I Mac Apple Silicon sono eccellenti grazie alla memoria unificata, e le GPU AMD funzionano con strumenti come Ollama e LM Studio.
La finestra di contesto influisce sulla VRAM?
Sì. Un contesto più lungo (la quantità di testo che il modello legge in una volta) utilizza memoria extra per la "cache KV". Un grande contesto da 128K può aggiungere diversi GB, quindi lascia spazio sopra la dimensione base del modello.
E se ho solo una CPU?
Puoi comunque eseguire piccoli modelli da 1–4B utilizzando la RAM di sistema, ma è lento. Per un'esperienza reale hai bisogno di una GPU o di un Mac Apple Silicon.