IA Locale

Dites-nous quelle machine vous avez — ou laissez votre navigateur détecter ce qu'il peut — et voyez instantanément quels modèles open-weight fonctionnent dessus, lesquels sont à la limite et lesquels sont hors de portée. Chaque verdict suit la règle de dimensionnement publiée en bas de la page. Rien n'est téléchargé : la vérification s'exécute entièrement dans votre navigateur.

Votre machine

Les navigateurs cachent votre RAM et VRAM exactes pour des raisons de confidentialité — la détection pré-remplit une meilleure estimation, vous la corrigez. Rien ne quitte cette page.

Le verdict, modèle par modèle

Chargement du catalogue open-weight…

La règle de dimensionnement, publiée : besoin en mémoire = poids + cache KV + temps d'exécution. Poids : un modèle 4 bits (Q4_K_M) pèse environ 0.58 Go par milliard de paramètres. Cache KV : augmente avec le contexte que vous utilisez — nous estimons 0.125 Mo par token à 8B, évoluant avec les paramètres à la puissance 0.45 (calibré sur des architectures GQA courantes comme Llama : ~1 Go à 8K pour un 8B, ~10 Go à 32K pour un 70B ; les architectures individuelles varient de ±40%). Surcharge d'exécution : 0.8 Go. Un modèle convient lorsque le total reste en dessous de 85% de votre mémoire GPU ; 85–110% est à la limite ; au-delà, la RAM CPU peut encore fonctionner, mais plus lentement. Apple Silicon partage un seul pool : nous comptons 70% de RAM unifiée — et nous vous orientons vers les builds MLX, le format optimisé d’Apple. Les modèles à mélange d’experts sont dimensionnés par leurs total paramètres. Les comptes de paramètres sont lus à partir des noms de modèles ; les modèles sans taille lisible sont exclus. La liste fusionne notre catalogue d'API hébergée avec versions uniquement de poids du catalogue public de Hugging Face (licence déclarée, non restreinte) — donc les modèles locaux sans API apparaissent ici aussi. Déterministe, sans compte, sans télémétrie — corrections bienvenues à [email protected].