Die eine Regel, die Sie benötigen
Fast jeder führt Modelle aus quantisiert — komprimiert auf etwa 4 Bit pro Gewicht (das Format genannt Q4_K_M), das ~98% der Qualität bei ungefähr einem Viertel der Größe beibehält. Die Regel ist einfach:
In der Praxis entspricht die "Milliarden von Parametern" (B) eines Modells ungefähr so dem VRAM: ein 7–8B Modell benötigt ~6–8 GB, ein 14B benötigt ~10–12 GB, ein 32B benötigt ~20–24 GB, und ein 70B benötigt ~40–48 GB — alles bei Q4.
8 GB VRAM — Einstiegsebene
Viel für alltägliche Chats, Zusammenfassungen und einfaches Programmieren. Führen Sie 7–9B Modelle bei Q4 aus: Llama 3.1 8B, Qwen3 8B, oder Gemma 3 4B in höherer Qualität (Q8, ~4.5 GB). Für Bilder, Sana und SDXL passen auch hier.
12 GB VRAM — der Sweet Spot für die meisten
Die beste Wertstufe. Führen Sie 12–14B Modelle aus, die merklich intelligenter wirken: Gemma 3 12B, Qwen3 14B, Phi-4 14B, oder DeepSeek-R1-Distill 14B für schrittweises Denken.
16 GB VRAM — komfortabler Mittelbereich
Führt 14B-Modelle mit Platz für langen Kontext aus, plus speziell entwickelte 20B-Modelle wie gpt-oss-20B, und sogar Gemma 3 27B bei Q4, wenn Sie den Kontext bescheiden halten. Ein großartiger Allrounder.
24 GB VRAM — die lokale Leistungsebene
Wo lokale KI wirklich glänzt. Führen Sie 27–35B Modelle bei Q4 mit langem Kontext aus: Qwen3 32B, Gemma 3 27B, oder DeepSeek-R1 32B. Diese stehen Cloud-Assistenten bei den meisten Aufgaben in nichts nach und sind hervorragend zum Programmieren.
48 GB+ und mehr
Mit 48 GB erreichen Sie 70B Modelle wie Llama 3.3 70B bei Q4 — nahezu Grenzqualität. Darüber hinaus benötigen riesige Mixture-of-Experts-Modelle (DeepSeek V3, Qwen3 235B) mehrere Karten oder Server-GPUs.
Keine GPU? Apple Silicon & CPU
Apple Silicon (M-Serie) ist ein verstecktes Juwel: sein einheitlicher Speicher wird mit der GPU geteilt, sodass ein Mac mit 32 GB Modelle ausführen kann, die eine 24 GB+ NVIDIA-Karte benötigen. Ein 64 GB Mac kann problemlos 70B-Modelle ausführen. Auf einem CPU ohne GPU, können Sie dennoch kleine 1–4B-Modelle (langsam) mit dem Systemspeicher ausführen — gut zum Testen, nicht für den täglichen Gebrauch.
VRAM-Spickzettel
| VRAM | Modellgröße (Q4) | Beispielmodelle | Gut für |
|---|---|---|---|
| 8 GB | 7–9B | Llama 3.1 8B, Qwen3 8B, Gemma 3 4B | Chat, Zusammenfassungen, leichtes Programmieren |
| 12 GB | 12–14B | Gemma 3 12B, Qwen3 14B, Phi-4 14B | Intelligenterer Chat, Argumentation, Programmierung |
| 16 GB | 14–27B | gpt-oss-20B, Gemma 3 27B (Q4) | Langer Kontext, stärkere Programmierung |
| 24 GB | 27–35B | Qwen3 32B, DeepSeek-R1 32B | Nahe Cloud-Qualität, ernsthaftes Programmieren |
| 48 GB+ | 70B+ | Llama 3.3 70B, MoE-Modelle | Frontier-Klasse, lokal |
Häufig gestellte Fragen
Wie viel VRAM benötige ich, um ein lokales LLM auszuführen?
8 GB ist das praktische Minimum für ein nützliches Modell (7–8B). 12–16 GB ist der optimale Bereich für die meisten Menschen, und 24 GB ermöglichen es Ihnen, 32B-Modelle auszuführen, die mit Cloud-Assistenten konkurrieren.
Was ist Quantisierung (Q4)?
Quantisierung komprimiert ein Modell auf weniger Bits pro Gewicht. Q4_K_M (~4 Bits) ist der Standard: Es behält fast die gesamte Qualität bei, während die Größe — und der VRAM-Bedarf — auf etwa ein Viertel reduziert wird.
Kann ich ein 70B-Modell zu Hause ausführen?
Ja, mit ~48 GB VRAM — zwei RTX 3090/4090-Karten, einer RTX 6000 oder einem 64 GB Apple Silicon Mac. Auf einer einzelnen 24 GB-Karte ist ein 32B-Modell die praktische Obergrenze.
Brauche ich eine NVIDIA GPU?
NVIDIA ist am einfachsten und schnellsten, aber nicht erforderlich. Apple Silicon Macs sind dank des einheitlichen Speichers hervorragend, und AMD GPUs funktionieren mit Tools wie Ollama und LM Studio.
Beeinflusst das Kontextfenster den VRAM?
Ja. Längerer Kontext (die Menge an Text, die das Modell auf einmal liest) benötigt zusätzlichen Speicher für den "KV-Cache". Ein großer 128K-Kontext kann mehrere GB hinzufügen, also lassen Sie Spielraum über der Basis-Modellgröße.
Was ist, wenn ich nur eine CPU habe?
Sie können dennoch kleine 1–4B-Modelle mit dem Systemspeicher ausführen, aber es ist langsam. Für ein echtes Erlebnis benötigen Sie eine GPU oder einen Apple Silicon Mac.