Strumenti AI Progetti Directory
🏆 Classifica 📡 Notizie ✨ Prompts ⚖️ Confronta Modelli 🔧 Strumenti 📦 Progetti 🚀 Spazi
Blog
Guida24 luglio 2026⏱ 9 min di lettura

Quale modello AI può eseguire il tuo PC in 2026?
(Una guida per GPU & VRAM)

La domanda più comune sull'AI locale è "funzionerà sul mio computer?" La risposta si riduce a un numero: la tua GPU VRAM (memoria video). Questa guida ti offre una semplice regola empirica, poi una suddivisione livello per livello — da un laptop da 8 GB a una workstation da 24 GB — con i modelli open esatti da eseguire a ciascun livello nel 2026. Niente hype, solo ciò che si adatta.

L'unica regola di cui hai bisogno

Quasi tutti eseguono modelli quantizzati — compressi a circa 4 bit per peso (il formato chiamato Q4_K_M), che mantiene ~98% della qualità a circa un quarto della dimensione. La regola è semplice:

📏 Regola empirica: la VRAM di cui hai bisogno ≈ la dimensione del file Q4 del modello + circa 1–1.5 GB di overhead.Le lunghe finestre di contesto (32K+) aggiungono di più. Quindi un modello il cui file Q4 è ~6 GB funziona comodamente su 8 GB di VRAM.

In pratica, i "miliardi di parametri" (B) di un modello si mappano alla VRAM all'incirca in questo modo: un 7–8B modello ha bisogno di ~6–8 GB, un 14B ha bisogno di ~10–12 GB, un 32B ha bisogno di ~20–24 GB, e un 70B ha bisogno di ~40–48 GB — tutti a Q4.

8 GB VRAM — livello base

GTX 1070 / RTX 3050 / RTX 4060 / la maggior parte dei laptop da gioco

Abbastanza per chat quotidiane, riassunti e codifica semplice. Esegui 7–9B modelli a Q4: Llama 3.1 8B, Qwen3 8B, o Gemma 3 4B a qualità superiore (Q8, ~4.5 GB). Per le immagini, Sana e SDXL si adattano anche qui.

12 GB VRAM — il punto ideale per la maggior parte

RTX 3060 12GB / RTX 4070

Il miglior livello di valore. Esegui 12–14B modelli, che sembrano visibilmente più intelligenti: Gemma 3 12B, Qwen3 14B, Phi-4 14B, o DeepSeek-R1-Distill 14B per ragionamenti passo-passo.

16 GB VRAM — fascia media confortevole

RTX 4060 Ti 16GB / RTX 4070 Ti Super / RTX 5070

Esegue modelli 14B con spazio per un lungo contesto, oltre a modelli specificamente progettati da 20B come gpt-oss-20B, e anche Gemma 3 27B a Q4 se mantieni il contesto modesto. Un ottimo tuttofare.

24 GB VRAM — la fascia di potenza locale

RTX 3090 / RTX 4090 / RTX 5090

Dove l'IA locale brilla davvero. Esegui 27–35B modelli a Q4 con lungo contesto: Qwen3 32B, Gemma 3 27B, o DeepSeek-R1 32B. Questi rivaleggiano con gli assistenti cloud per la maggior parte dei compiti e sono eccellenti per la programmazione.

48 GB+ e oltre

Dual RTX 3090/4090, RTX 6000 Ada, o una scheda da data center

Con 48 GB raggiungi 70B modelli come Llama 3.3 70B a Q4 — qualità quasi frontiera. Oltre a ciò, i modelli Mixture-of-Experts giganti (DeepSeek V3, Qwen3 235B) necessitano di più schede o GPU da server.

Nessuna GPU? Apple Silicon & CPU

Apple Silicon (M-series) è un gioiello nascosto: la sua memoria unificata è condivisa con la GPU, quindi un Mac con 32 GB può eseguire modelli che richiederebbero una scheda NVIDIA da 24 GB+. Un Mac da 64 GB esegue comodamente modelli da 70B. Su un CPU senza GPU, puoi comunque eseguire piccoli modelli da 1–4B (lentamente) utilizzando la RAM di sistema — buono per il testing, non per l'uso quotidiano.

Scheda di riferimento VRAM

VRAMDimensione del modello (Q4)Modelli di esempioBuono per
8 GB7–9BLlama 3.1 8B, Qwen3 8B, Gemma 3 4BChat, riassunti, programmazione leggera
12 GB12–14BGemma 3 12B, Qwen3 14B, Phi-4 14BChat più intelligente, ragionamento, codifica
16 GB14–27Bgpt-oss-20B, Gemma 3 27B (Q4)Lungo contesto, codifica più potente
24 GB27–35BQwen3 32B, DeepSeek-R1 32BQualità quasi cloud, codifica seria
48 GB+70B+Llama 3.3 70B, modelli MoEClasse frontier, locale
Come eseguirli realmente: installa Ollama o LM Studio, scegli un modello dall'elenco e scarica automaticamente il file quantizzato corretto. Guida completa in Esegui AI Localmente Gratuitamentee vedere il Migliori modelli AI Open-Source da provare per primo.

Domande Frequenti

Quanta VRAM ho bisogno per eseguire un LLM locale?

8 GB è il minimo pratico per un modello utile (7–8B). 12–16 GB è il punto ideale per la maggior parte delle persone, e 24 GB ti consente di eseguire modelli da 32B che competono con gli assistenti cloud.

Cos'è la quantizzazione (Q4)?

La quantizzazione comprime un modello a meno bit per peso. Q4_K_M (~4 bit) è lo standard: mantiene quasi tutta la qualità riducendo le dimensioni — e il bisogno di VRAM — a circa un quarto.

Posso eseguire un modello da 70B a casa?

Sì, con ~48 GB di VRAM — due schede RTX 3090/4090, una RTX 6000, o un Mac Apple Silicon da 64 GB. Su una singola scheda da 24 GB, un modello da 32B è il limite pratico.

Ho bisogno di una GPU NVIDIA?

NVIDIA è la più semplice e veloce, ma non è obbligatoria. I Mac Apple Silicon sono eccellenti grazie alla memoria unificata, e le GPU AMD funzionano con strumenti come Ollama e LM Studio.

La finestra di contesto influisce sulla VRAM?

Sì. Un contesto più lungo (la quantità di testo che il modello legge in una volta) utilizza memoria extra per la "cache KV". Un grande contesto da 128K può aggiungere diversi GB, quindi lascia spazio sopra la dimensione base del modello.

E se ho solo una CPU?

Puoi comunque eseguire piccoli modelli da 1–4B utilizzando la RAM di sistema, ma è lento. Per un'esperienza reale hai bisogno di una GPU o di un Mac Apple Silicon.