Outils IA Projets Annuaire
🏆 Classement 📡 Actualités ✨ Invites ⚖️ Comparer les Modèles 🔧 Outils 📦 Projets 🚀 Espaces
Blog
Guide24 juillet 2026⏱ 9 min de lecture

Quel modèle IA votre PC peut-il exécuter en 2026?
(Un guide par GPU & VRAM)

La question la plus posée sur l'IA locale est "fonctionnera-t-il sur ma machine ?" La réponse se résume à un chiffre : votre GPU VRAM (mémoire vidéo). Ce guide vous donne une règle simple, puis une répartition par niveaux — d'un ordinateur portable de 8 Go à une station de travail de 24 Go — avec les modèles open exacts à exécuter à chaque niveau en 2026. Pas de battage, juste ce qui convient.

La seule règle dont vous avez besoin

Presque tout le monde exécute des modèles quantifiés — compressés à environ 4 bits par poids (le format appelé Q4_K_M), ce qui conserve ~98% de la qualité à environ un quart de la taille. La règle est simple :

📏 Règle de base : la VRAM dont vous avez besoin ≈ la taille du fichier Q4 du modèle + environ 1–1,5 Go de surcharge. De longues fenêtres de contexte (32K+) ajoutent plus. Ainsi, un modèle dont le fichier Q4 est ~6 Go fonctionne confortablement sur 8 Go de VRAM.

En pratique, les "milliards de paramètres" (B) d'un modèle correspondent à la VRAM à peu près comme ceci : un 7–8B modèle a besoin de ~6–8 Go, un 14B a besoin de ~10–12 Go, un 32B a besoin de ~20–24 Go, et un 70B a besoin de ~40–48 Go — tous à Q4.

8 Go VRAM — niveau d'entrée

GTX 1070 / RTX 3050 / RTX 4060 / la plupart des ordinateurs portables de jeu

Suffisant pour des discussions quotidiennes, des résumés et du codage simple. Exécutez 7–9B modèles au Q4 : Llama 3.1 8B, Qwen3 8B, ou Gemma 3 4B à une qualité supérieure (Q8, ~4,5 Go). Pour les images, Sana et SDXL s'adaptent également ici.

12 Go VRAM — le meilleur compromis pour la plupart

RTX 3060 12 Go / RTX 4070

Le meilleur niveau de valeur. Exécutez 12–14B modèles, qui semblent nettement plus intelligents : Gemma 3 12B, Qwen3 14B, Phi-4 14B, ou DeepSeek-R1-Distill 14B pour un raisonnement étape par étape.

16 Go VRAM — milieu de gamme confortable

RTX 4060 Ti 16 Go / RTX 4070 Ti Super / RTX 5070

Exécute des modèles 14B avec de la place pour un long contexte, plus des modèles 20B spécialement conçus comme gpt-oss-20B, et même Gemma 3 27B au Q4 si vous gardez le contexte modeste. Un excellent polyvalent.

24 Go VRAM — le niveau de puissance local

RTX 3090 / RTX 4090 / RTX 5090

Là où l'IA locale brille vraiment. Exécutez 27–35B modèles au Q4 avec un long contexte : Qwen3 32B, Gemma 3 27B, ou DeepSeek-R1 32B. Ceux-ci rivalisent avec les assistants cloud pour la plupart des tâches et sont excellents pour le codage.

48 Go+ et au-delà

Dual RTX 3090/4090, RTX 6000 Ada, ou une carte de centre de données

Avec 48 Go, vous atteignez 70B des modèles comme Llama 3.3 70B au Q4 — qualité proche de la frontière. Au-delà, les modèles géants Mixture-of-Experts (DeepSeek V3, Qwen3 235B) nécessitent plusieurs cartes ou GPU de serveur.

Pas de GPU ? Apple Silicon & CPU

Apple Silicon (séries M) est une perle cachée : sa mémoire unifiée est partagée avec le GPU, donc un Mac avec 32 Go peut exécuter des modèles qui nécessiteraient une carte NVIDIA de 24 Go+. Un Mac de 64 Go exécute confortablement des modèles 70B. Sur un CPU sans GPU, vous pouvez toujours exécuter de petits modèles 1–4B (lentement) en utilisant la RAM système — bien pour les tests, pas pour un usage quotidien.

Feuille de triche VRAM

VRAMTaille du modèle (Q4)Modèles exemplesBon pour
8 Go7–9BLlama 3.1 8B, Qwen3 8B, Gemma 3 4BChat, résumés, codage léger
12 Go12–14BGemma 3 12B, Qwen3 14B, Phi-4 14BChat plus intelligent, raisonnement, codage
16 Go14–27Bgpt-oss-20B, Gemma 3 27B (Q4)Long contexte, codage plus puissant
24 Go27–35BQwen3 32B, DeepSeek-R1 32BQualité proche du cloud, codage sérieux
48 Go+70B+Llama 3.3 70B, modèles MoEClasse frontier, local
Comment les exécuter réellement : installer Ollama ou LM Studio, choisissez un modèle dans la liste, et il télécharge automatiquement le bon fichier quantifié. Guide complet dans Exécutez l'IA localement gratuitementet voir le Meilleurs modèles d'IA open-source pour lequel essayer en premier.

Questions fréquentes

De combien de VRAM ai-je besoin pour exécuter un LLM local ?

8 Go est le minimum pratique pour un modèle utile (7–8B). 12–16 Go est le meilleur choix pour la plupart des gens, et 24 Go vous permet d'exécuter des modèles 32B qui rivalisent avec les assistants cloud.

Qu'est-ce que la quantification (Q4) ?

La quantification compresse un modèle à moins de bits par poids. Q4_K_M (~4 bits) est la norme : il conserve presque toute la qualité tout en réduisant la taille — et le besoin en VRAM — à environ un quart.

Puis-je exécuter un modèle 70B à la maison ?

Oui, avec ~48 Go de VRAM — deux cartes RTX 3090/4090, une RTX 6000, ou un Mac Apple Silicon de 64 Go. Sur une seule carte de 24 Go, un modèle 32B est le plafond pratique.

Ai-je besoin d'un GPU NVIDIA ?

NVIDIA est le plus simple et le plus rapide, mais ce n'est pas obligatoire. Les Macs Apple Silicon sont excellents grâce à la mémoire unifiée, et les GPU AMD fonctionnent avec des outils comme Ollama et LM Studio.

Le fenêtre de contexte affecte-t-elle la VRAM ?

Oui. Un contexte plus long (la quantité de texte que le modèle lit à la fois) utilise de la mémoire supplémentaire pour le "cache KV". Un grand contexte de 128K peut ajouter plusieurs Go, donc laissez de la marge au-dessus de la taille du modèle de base.

Que faire si je n'ai qu'un CPU ?

Vous pouvez toujours exécuter de petits modèles de 1 à 4B en utilisant la RAM système, mais c'est lent. Pour une véritable expérience, vous voulez un GPU ou un Mac Apple Silicon.