Teilen Sie uns mit, welche Maschine Sie haben — oder lassen Sie Ihren Browser erkennen, was er kann — und sehen Sie sofort, welche Open-Weight-Modelle darauf laufen, welche an der Grenze sind und welche unerreichbar sind. Jedes Urteil folgt der veröffentlichten Größenregel am Ende der Seite. Nichts wird hochgeladen: die Überprüfung läuft vollständig in Ihrem Browser.
Die veröffentlichte Größenregel: Speicherbedarf = Gewichte + KV-Cache + Laufzeit.Gewichte: Ein 4-Bit-Modell (Q4_K_M) wiegt etwa 0.58 GB pro Milliarde Parameter.KV-Cache: wächst mit dem Kontext, den Sie verwenden — wir schätzen 0.125 MB pro Token bei 8B, skaliert mit Parametern zur 0.45-Power (kalibriert auf gängige GQA-Architekturen wie Llama: ~1 GB bei 8K für ein 8B, ~10 GB bei 32K für ein 70B; individuelle Architekturen variieren um ±40%). Laufzeitüberhead: 0.8 GB. Ein Modell passt, wenn die Gesamtsumme unter 85% Ihrer GPU-Speicherkapazität bleibt; 85–110% ist an der Grenze; darüber hinaus kann CPU-RAM immer noch funktionieren, langsamer. Apple Silicon teilt einen Pool: wir zählen 70% einheitlichen RAM — und wir weisen Sie auf MLX-Bauten hin, Apples optimiertes Format. Mixture-of-Experts-Modelle werden nach ihren gesamt Parameter. Die Parameteranzahl wird aus den Modellnamen gelesen; Modelle ohne lesbare Größe werden ausgeschlossen. Die Liste kombiniert unser gehostetes API-Katalog mit weights-only Veröffentlichungen aus dem öffentlichen Hugging Face-Katalog (erklärte Lizenz, nicht eingeschränkt) — daher erscheinen hier auch lokal-first Modelle ohne API. Deterministisch, kein Konto, keine Telemetrie — Korrekturen sind willkommen unter [email protected].