Die eine Regel, die Sie brauchen
Fast jeder führt Modelle aus quantisiert — komprimiert auf etwa 4 Bit pro Gewicht (das Format genannt Q4_K_M), was ~98% der Qualität bei ungefähr einem Viertel der Größe erhält. Die Regel ist einfach:
In der Praxis entspricht die "Milliarden von Parametern" (B) eines Modells ungefähr so: ein 7–8B Modell benötigt ~6–8 GB, ein 14B benötigt ~10–12 GB, ein 32B benötigt ~20–24 GB, und ein 70B benötigt ~40–48 GB — alles im Q4.
8 GB VRAM — Einstiegsebene
Viel für alltägliche Chats, Zusammenfassungen und einfaches Programmieren. Führen Sie 7–9B aus. Modelle bei Q4: Llama 3.1 8B, Qwen3 8B, oder Gemma 3 4B in höherer Qualität (Q8, ~4,5 GB). Für Bilder, Sana und SDXL passen auch hier.
12 GB VRAM — der Sweet Spot für die meisten
Die beste Wertstufe. Führen Sie 12–14B Modelle aus, die merklich intelligenter wirken: Gemma 3 12B, Qwen3 14B, Phi-4 14B, oder DeepSeek-R1-Distill 14B für schrittweises Denken.
16 GB VRAM — komfortabler Mittelbereich
Führt 14B-Modelle mit Platz für langen Kontext aus, plus speziell entwickelte 20B-Modelle wie gpt-oss-20B, und sogar Gemma 3 27B bei Q4, wenn Sie den Kontext bescheiden halten. Ein großartiger Allrounder.
24 GB VRAM — die lokale Power-Stufe
Wo lokale KI wirklich glänzt. Führen Sie 27–35B Modelle bei Q4 mit langem Kontext aus: Qwen3 32B, Gemma 3 27B, oder DeepSeek-R1 32B. Diese konkurrieren mit Cloud-Assistenten bei den meisten Aufgaben und sind hervorragend zum Programmieren geeignet.
48 GB+ und mehr
Mit 48 GB erreichen Sie 70B Modelle wie Llama 3.3 70B bei Q4 — nahezu Grenzqualität. Darüber hinaus benötigen riesige Mixture-of-Experts-Modelle (DeepSeek V3, Qwen3 235B) mehrere Karten oder Server-GPUs.
Keine GPU? Apple Silicon & CPU
Apple Silicon (M-Serie) ist ein verstecktes Juwel: sein einheitlicher Speicher wird mit der GPU geteilt, sodass ein Mac mit 32 GB Modelle ausführen kann, die eine 24 GB+ NVIDIA-Karte benötigen würden. Ein 64 GB Mac führt bequem 70B-Modelle aus. Auf einem CPU ohne GPU, können Sie dennoch kleine 1–4B-Modelle (langsam) mit System-RAM ausführen — gut zum Testen, nicht für den täglichen Gebrauch.
VRAM-Spickzettel
| VRAM | Modellgröße (Q4) | Beispielmodelle | Gut für |
|---|---|---|---|
| 8 GB | 7–9B aus. | Llama 3.1 8B, Qwen3 8B, Gemma 3 4B | Chat, Zusammenfassungen, leichtes Programmieren |
| 12 GB | 12–14B | Gemma 3 12B, Qwen3 14B, Phi-4 14B | Intelligenterer Chat, Argumentation, Programmierung |
| 16 GB | 14–27B | gpt-oss-20B, Gemma 3 27B (Q4) | Langer Kontext, stärkere Programmierung |
| 24 GB | 27–35B | Qwen3 32B, DeepSeek-R1 32B | Nahezu Cloud-Qualität, ernsthafte Programmierung |
| 48 GB+ | 70B+ | Llama 3.3 70B, MoE-Modelle | Frontier-Klasse, lokal |
Häufig gestellte Fragen
Wie viel VRAM benötige ich, um ein lokales LLM auszuführen?
8 GB sind das praktische Minimum für ein nützliches Modell (7–8B). 12–16 GB sind der Sweet Spot für die meisten Menschen, und 24 GB ermöglichen es dir, 32B-Modelle auszuführen, die mit Cloud-Assistenten konkurrieren.
Was ist Quantisierung (Q4)?
Quantisierung komprimiert ein Modell auf weniger Bits pro Gewicht. Q4_K_M (~4 Bits) ist der Standard: Es behält fast die gesamte Qualität bei und reduziert die Größe — und den VRAM-Bedarf — auf etwa ein Viertel.
Kann ich ein 70B-Modell zu Hause ausführen?
Ja, mit ~48 GB VRAM — zwei RTX 3090/4090-Karten, eine RTX 6000 oder ein 64 GB Apple Silicon Mac. Auf einer einzelnen 24 GB-Karte ist ein 32B-Modell die praktische Obergrenze.
Brauche ich eine NVIDIA-GPU?
NVIDIA ist am einfachsten und schnellsten, aber nicht erforderlich. Apple Silicon Macs sind dank des einheitlichen Speichers hervorragend, und AMD-GPUs funktionieren mit Tools wie Ollama und LM Studio.
Beeinflusst das Kontextfenster den VRAM?
Ja. Längerer Kontext (die Menge an Text, die das Modell auf einmal liest) benötigt zusätzlichen Speicher für den "KV-Cache". Ein großer 128K-Kontext kann mehrere GB hinzufügen, also lasse Spielraum über der Basis-Modellgröße.
Was ist, wenn ich nur eine CPU habe?
Du kannst immer noch kleine 1–4B-Modelle mit System-RAM ausführen, aber es ist langsam. Für ein echtes Erlebnis benötigst du eine GPU oder einen Apple Silicon Mac.