AI Locale

Dicci che macchina hai — o lascia che il tuo browser rilevi cosa può — e vedi immediatamente quali modelli open-weight possono funzionare, quali sono al limite e quali sono fuori portata. Ogni verdetto segue la regola di dimensionamento pubblicata in fondo alla pagina. Niente viene caricato: il controllo avviene interamente nel tuo browser.

La tua macchina

I browser nascondono la tua RAM e VRAM esatte per motivi di privacy — il rilevamento precompila una migliore stima, tu la correggi. Niente lascia questa pagina.

Il verdetto, modello per modello

Caricamento del catalogo open-weight…

La regola di dimensionamento, pubblicata: necessità di memoria = pesi + cache KV + runtime. Pesi: un modello a 4 bit (Q4_K_M) pesa circa 0.58 GB per miliardo di parametri. Cache KV: cresce con il contesto che utilizzi — stimiamo 0.125 MB per token a 8B, scalando con i parametri alla potenza di 0.45 (calibrato su architetture GQA comuni come Llama: ~1 GB a 8K per un 8B, ~10 GB a 32K per un 70B; le architetture individuali variano di ±40%). Sovraccarico di runtime: 0.8 GB. Un modello si adatta quando il totale rimane sotto 85% della tua memoria GPU; 85–110% è al limite; oltre, la RAM CPU potrebbe ancora funzionare, più lentamente. Apple Silicon condivide un unico pool: contiamo 70% di RAM unificata — e ti indirizziamo a builds MLX, il formato ottimizzato di Apple. I modelli a miscela di esperti sono dimensionati in base ai loro totale parametri. I conteggi dei parametri sono letti dai nomi dei modelli; i modelli senza una dimensione leggibile sono esclusi. La lista unisce il nostro catalogo API ospitato con rilascio solo pesi dal catalogo pubblico di Hugging Face (licenza dichiarata, non gated) — quindi anche i modelli locali senza API appaiono qui. Deterministico, senza account, senza telemetria — correzioni benvenute a [email protected].