KI-Tools Projekte Verzeichnis
🏆 Rangliste 📡 Nachrichten ✨ Eingabeaufforderungen ⚖️ Modelle vergleichen 🔧 Werkzeuge 📦 Projekte 🚀 Räume
Blog
Leitfaden24. Juli 2026⏱ 9 Minuten Lesezeit

Welches KI-Modell kann Ihr PC ausführen in 2026?
(Ein Leitfaden für GPU & VRAM)

Die am häufigsten gestellte Frage zu lokaler KI ist: "Wird es auf meinem Gerät laufen?" Die Antwort hängt von einer Zahl ab: dem VRAM Ihrer GPU. VRAM (Videospeicher). Dieser Leitfaden gibt Ihnen eine einfache Faustregel und dann eine tierweise Aufschlüsselung — von einem 8 GB Laptop bis zu einer 24 GB Workstation — mit den genauen offenen Modellen, die auf jedem Niveau im Jahr 2026 ausgeführt werden können. Kein Hype, nur das, was passt.

Die eine Regel, die Sie brauchen

Fast jeder führt Modelle aus quantisiert — komprimiert auf etwa 4 Bit pro Gewicht (das Format genannt Q4_K_M), was ~98% der Qualität bei ungefähr einem Viertel der Größe erhält. Die Regel ist einfach:

📏 Faustregel: der benötigte VRAM ≈ die Q4-Dateigröße des Modells + etwa 1–1,5 GB Overhead.Lange Kontextfenster (32K+) fügen mehr hinzu. Ein Modell, dessen Q4-Dateigröße ~6 GB beträgt, läuft bequem auf 8 GB VRAM.

In der Praxis entspricht die "Milliarden von Parametern" (B) eines Modells ungefähr so: ein 7–8B Modell benötigt ~6–8 GB, ein 14B benötigt ~10–12 GB, ein 32B benötigt ~20–24 GB, und ein 70B benötigt ~40–48 GB — alles im Q4.

8 GB VRAM — Einstiegsebene

GTX 1070 / RTX 3050 / RTX 4060 / die meisten Gaming-Laptops

Viel für alltägliche Chats, Zusammenfassungen und einfaches Programmieren. Führen Sie 7–9B aus. Modelle bei Q4: Llama 3.1 8B, Qwen3 8B, oder Gemma 3 4B in höherer Qualität (Q8, ~4,5 GB). Für Bilder, Sana und SDXL passen auch hier.

12 GB VRAM — der Sweet Spot für die meisten

RTX 3060 12GB / RTX 4070

Die beste Wertstufe. Führen Sie 12–14B Modelle aus, die merklich intelligenter wirken: Gemma 3 12B, Qwen3 14B, Phi-4 14B, oder DeepSeek-R1-Distill 14B für schrittweises Denken.

16 GB VRAM — komfortabler Mittelbereich

RTX 4060 Ti 16GB / RTX 4070 Ti Super / RTX 5070

Führt 14B-Modelle mit Platz für langen Kontext aus, plus speziell entwickelte 20B-Modelle wie gpt-oss-20B, und sogar Gemma 3 27B bei Q4, wenn Sie den Kontext bescheiden halten. Ein großartiger Allrounder.

24 GB VRAM — die lokale Power-Stufe

RTX 3090 / RTX 4090 / RTX 5090

Wo lokale KI wirklich glänzt. Führen Sie 27–35B Modelle bei Q4 mit langem Kontext aus: Qwen3 32B, Gemma 3 27B, oder DeepSeek-R1 32B. Diese konkurrieren mit Cloud-Assistenten bei den meisten Aufgaben und sind hervorragend zum Programmieren geeignet.

48 GB+ und mehr

Dual RTX 3090/4090, RTX 6000 Ada oder eine Rechenzentrums-Karte

Mit 48 GB erreichen Sie 70B Modelle wie Llama 3.3 70B bei Q4 — nahezu Grenzqualität. Darüber hinaus benötigen riesige Mixture-of-Experts-Modelle (DeepSeek V3, Qwen3 235B) mehrere Karten oder Server-GPUs.

Keine GPU? Apple Silicon & CPU

Apple Silicon (M-Serie) ist ein verstecktes Juwel: sein einheitlicher Speicher wird mit der GPU geteilt, sodass ein Mac mit 32 GB Modelle ausführen kann, die eine 24 GB+ NVIDIA-Karte benötigen würden. Ein 64 GB Mac führt bequem 70B-Modelle aus. Auf einem CPU ohne GPU, können Sie dennoch kleine 1–4B-Modelle (langsam) mit System-RAM ausführen — gut zum Testen, nicht für den täglichen Gebrauch.

VRAM-Spickzettel

VRAMModellgröße (Q4)BeispielmodelleGut für
8 GB7–9B aus.Llama 3.1 8B, Qwen3 8B, Gemma 3 4BChat, Zusammenfassungen, leichtes Programmieren
12 GB12–14BGemma 3 12B, Qwen3 14B, Phi-4 14BIntelligenterer Chat, Argumentation, Programmierung
16 GB14–27Bgpt-oss-20B, Gemma 3 27B (Q4)Langer Kontext, stärkere Programmierung
24 GB27–35BQwen3 32B, DeepSeek-R1 32BNahezu Cloud-Qualität, ernsthafte Programmierung
48 GB+70B+Llama 3.3 70B, MoE-ModelleFrontier-Klasse, lokal
Wie man sie tatsächlich ausführt: installieren Ollama oder LM Studio, wähle ein Modell aus der Liste, und es lädt automatisch die richtige quantisierte Datei herunter. Vollständige Anleitung in Führen Sie AI lokal kostenlos ausund sieh dir die Beste Open-Source-AI-Modelle an, die du zuerst ausprobieren solltest.

Häufig gestellte Fragen

Wie viel VRAM benötige ich, um ein lokales LLM auszuführen?

8 GB sind das praktische Minimum für ein nützliches Modell (7–8B). 12–16 GB sind der Sweet Spot für die meisten Menschen, und 24 GB ermöglichen es dir, 32B-Modelle auszuführen, die mit Cloud-Assistenten konkurrieren.

Was ist Quantisierung (Q4)?

Quantisierung komprimiert ein Modell auf weniger Bits pro Gewicht. Q4_K_M (~4 Bits) ist der Standard: Es behält fast die gesamte Qualität bei und reduziert die Größe — und den VRAM-Bedarf — auf etwa ein Viertel.

Kann ich ein 70B-Modell zu Hause ausführen?

Ja, mit ~48 GB VRAM — zwei RTX 3090/4090-Karten, eine RTX 6000 oder ein 64 GB Apple Silicon Mac. Auf einer einzelnen 24 GB-Karte ist ein 32B-Modell die praktische Obergrenze.

Brauche ich eine NVIDIA-GPU?

NVIDIA ist am einfachsten und schnellsten, aber nicht erforderlich. Apple Silicon Macs sind dank des einheitlichen Speichers hervorragend, und AMD-GPUs funktionieren mit Tools wie Ollama und LM Studio.

Beeinflusst das Kontextfenster den VRAM?

Ja. Längerer Kontext (die Menge an Text, die das Modell auf einmal liest) benötigt zusätzlichen Speicher für den "KV-Cache". Ein großer 128K-Kontext kann mehrere GB hinzufügen, also lasse Spielraum über der Basis-Modellgröße.

Was ist, wenn ich nur eine CPU habe?

Du kannst immer noch kleine 1–4B-Modelle mit System-RAM ausführen, aber es ist langsam. Für ein echtes Erlebnis benötigst du eine GPU oder einen Apple Silicon Mac.