La seule règle dont vous avez besoin
Presque tout le monde exécute des modèles quantifiés — compressés à environ 4 bits par poids (le format appelé Q4_K_M), ce qui conserve ~98% de la qualité à environ un quart de la taille. La règle est simple :
En pratique, les "milliards de paramètres" (B) d'un modèle correspondent à la VRAM à peu près comme ceci : un 7–8B modèle a besoin de ~6–8 Go, un 14B a besoin de ~10–12 Go, un 32B a besoin de ~20–24 Go, et un 70B a besoin de ~40–48 Go — tous à Q4.
8 Go VRAM — niveau d'entrée
Suffisant pour des discussions quotidiennes, des résumés et du codage simple. Exécutez 7–9B modèles au Q4 : Llama 3.1 8B, Qwen3 8B, ou Gemma 3 4B à une qualité supérieure (Q8, ~4,5 Go). Pour les images, Sana et SDXL s'adaptent également ici.
12 Go VRAM — le meilleur compromis pour la plupart
Le meilleur niveau de valeur. Exécutez 12–14B modèles, qui semblent nettement plus intelligents : Gemma 3 12B, Qwen3 14B, Phi-4 14B, ou DeepSeek-R1-Distill 14B pour un raisonnement étape par étape.
16 Go VRAM — milieu de gamme confortable
Exécute des modèles 14B avec de la place pour un long contexte, plus des modèles 20B spécialement conçus comme gpt-oss-20B, et même Gemma 3 27B au Q4 si vous gardez le contexte modeste. Un excellent polyvalent.
24 Go VRAM — le niveau de puissance local
Là où l'IA locale brille vraiment. Exécutez 27–35B modèles au Q4 avec un long contexte : Qwen3 32B, Gemma 3 27B, ou DeepSeek-R1 32B. Ceux-ci rivalisent avec les assistants cloud pour la plupart des tâches et sont excellents pour le codage.
48 Go+ et au-delà
Avec 48 Go, vous atteignez 70B des modèles comme Llama 3.3 70B au Q4 — qualité proche de la frontière. Au-delà, les modèles géants Mixture-of-Experts (DeepSeek V3, Qwen3 235B) nécessitent plusieurs cartes ou GPU de serveur.
Pas de GPU ? Apple Silicon & CPU
Apple Silicon (séries M) est une perle cachée : sa mémoire unifiée est partagée avec le GPU, donc un Mac avec 32 Go peut exécuter des modèles qui nécessiteraient une carte NVIDIA de 24 Go+. Un Mac de 64 Go exécute confortablement des modèles 70B. Sur un CPU sans GPU, vous pouvez toujours exécuter de petits modèles 1–4B (lentement) en utilisant la RAM système — bien pour les tests, pas pour un usage quotidien.
Feuille de triche VRAM
| VRAM | Taille du modèle (Q4) | Modèles exemples | Bon pour |
|---|---|---|---|
| 8 Go | 7–9B | Llama 3.1 8B, Qwen3 8B, Gemma 3 4B | Chat, résumés, codage léger |
| 12 Go | 12–14B | Gemma 3 12B, Qwen3 14B, Phi-4 14B | Chat plus intelligent, raisonnement, codage |
| 16 Go | 14–27B | gpt-oss-20B, Gemma 3 27B (Q4) | Long contexte, codage plus puissant |
| 24 Go | 27–35B | Qwen3 32B, DeepSeek-R1 32B | Qualité proche du cloud, codage sérieux |
| 48 Go+ | 70B+ | Llama 3.3 70B, modèles MoE | Classe frontier, local |
Questions fréquentes
De combien de VRAM ai-je besoin pour exécuter un LLM local ?
8 Go est le minimum pratique pour un modèle utile (7–8B). 12–16 Go est le meilleur choix pour la plupart des gens, et 24 Go vous permet d'exécuter des modèles 32B qui rivalisent avec les assistants cloud.
Qu'est-ce que la quantification (Q4) ?
La quantification compresse un modèle à moins de bits par poids. Q4_K_M (~4 bits) est la norme : il conserve presque toute la qualité tout en réduisant la taille — et le besoin en VRAM — à environ un quart.
Puis-je exécuter un modèle 70B à la maison ?
Oui, avec ~48 Go de VRAM — deux cartes RTX 3090/4090, une RTX 6000, ou un Mac Apple Silicon de 64 Go. Sur une seule carte de 24 Go, un modèle 32B est le plafond pratique.
Ai-je besoin d'un GPU NVIDIA ?
NVIDIA est le plus simple et le plus rapide, mais ce n'est pas obligatoire. Les Macs Apple Silicon sont excellents grâce à la mémoire unifiée, et les GPU AMD fonctionnent avec des outils comme Ollama et LM Studio.
Le fenêtre de contexte affecte-t-elle la VRAM ?
Oui. Un contexte plus long (la quantité de texte que le modèle lit à la fois) utilise de la mémoire supplémentaire pour le "cache KV". Un grand contexte de 128K peut ajouter plusieurs Go, donc laissez de la marge au-dessus de la taille du modèle de base.
Que faire si je n'ai qu'un CPU ?
Vous pouvez toujours exécuter de petits modèles de 1 à 4B en utilisant la RAM système, mais c'est lent. Pour une véritable expérience, vous voulez un GPU ou un Mac Apple Silicon.