Kimi K3 ist open-weight — und das ist nicht dasselbe wie ausführbar
Es erzielt 57,1 in der Intelligenz bei 15 $ pro Million Ausgabetokens, vor GPT-5.6 Terra zum gleichen Preis und 1,8 Punkte hinter GPT-5.6 Sol, das doppelt so viel kostet. Dann liest man die Parameteranzahl: 2,8 Billionen.
TL;DR — die kurze Version
Kimi K3 erzielt 57,1 Punkte in der Intelligenz für 15 $ pro Million Ausgabetokens. GPT-5.6 Terra kostet ebenfalls 15 $ und erzielt 55,0 Punkte. GPT-5.6 Sol erzielt 58,9 Punkte und kostet 30 $.
Die Gewichte sind veröffentlicht. Das Modell hat 2,8 Billionen Parameter. Beide Fakten befinden sich im selben Katalogeintrag, und zusammen bilden sie den Artikel: open weights sagt Ihnen, was Sie halten dürfen, nicht was Sie ausführen können.
Die Rechnung kommt als Latenz: 32,9 Tokens pro Sekunde und 125,71 Sekunden bis zum ersten Token, der langsamste Durchsatz der sechs Modelle an der Spitze unseres Boards.
Die Zahlen, heute Morgen
Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026. Alles unten wurde am 28. Juli aus unserer täglichen Benchmark-Fusion gelesen, die von Artificial Analysis stammt. Intelligenz und Codierung sind zusammengesetzte Indizes; Preis, Durchsatz und Zeit bis zum ersten Token verfolgen wir selbst. Jede Zeile ist die Top-Bemühungskonfiguration des Anbieters, die später wichtig ist.
| Modell | Intelligenz | Programmierung | $ / 1M aus | Tokens / s | Erster Token | Gewichte |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s | Geschlossen |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s | Geschlossen |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | 87,13 s | Geschlossen |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125,71 s | Offen |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | 151,8 s | Geschlossen |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | 84,29 s | Geschlossen |
Eine Zeile liefert ihre Gewichte. Es ist die vierte Zeile und nicht die letzte, und sie ist im mittleren Preissegment des Boards angesiedelt, nicht am unteren Ende. Beides ist neu, und beides kostet etwas.
Für 15 $ übertrifft es das 15 $ Modell
GPT-5.6 Terra und Kimi K3 kosten beide 15 $ pro Million Ausgabetokens. Terra erzielt 55.0 in der Intelligenz, Kimi K3 erzielt 57.1: 2,1 Punkte zum open-weight Modell bei identischem Ausgabepreis, mit einer Eingangsseite, die zu nah ist, um etwas bei 2,50 $ gegen 3 $ zu entscheiden.
Der Vergleich eine Stufe höher ist der, der einen Anbieter beunruhigen sollte. GPT-5.6 Sol erzielt 58.9 für $30 pro Million Ausgabetokens — 1,8 Punkte für den doppelten Preis. Diese 1,8 Punkte sind real bei schwierigen Überlegungen, aber sie sind jetzt ein Posten, den du kalkulieren kannst, anstatt einen Grund, mit dem Einkaufen aufzuhören. Codierung ist der eine Index, der sich bei gleichem Preis anders verhält: Terra 76,7 gegen Kimi K3’s 76,2.
Wo es gewinnt und wo nicht
Ein zusammengesetzter Index mittelt die Varianz, die die echte Arbeit entscheidet, also hier sind die einzelnen Benchmarks. Unser Snapshot umfasst neun für diese Stufe und Kimi K3 hat ein Ergebnis auf sechs, mit keinem auf IFBench, Terminal-Bench Hard oder τ²-Bench — auch wahr für Claude Opus 5 und GPT-5.6 Luna, also lies eine leere Zelle als eine Lücke in der Messung und nicht als ein Versagen.
| Benchmark | Kimi K3 | Das Beste der anderen fünf |
|---|---|---|
| Langzeit-Kontext-Argumentation | 74.7 | 74,0 · GPT-5.6 Terra und Luna |
| τ-Bench Banking | 33.4 | 33,0 · GPT-5.6 Sol |
| GPQA | 93.5 | 94,1 · GPT-5.6 Sol |
| SciCode | 58.7 | 60,2 · Claude Fable 5 |
| Terminal-Bench | 85.0 | 89,1 · Claude Opus 5 |
| Die letzte Prüfung der Menschheit | 44.3 | 53,3 · Claude Fable 5 |
Zwei erste Plätze, und nicht die dekorativen Art. Long Context Reasoning 74,7 ist das Beste der sechs, vor beiden GPT-5.6 Varianten mit 74,0 und klar vor Opus 5 und Fable 5, die beide bei 70 sitzen. τ-Bench Banking 33,4 übertrifft Sol’s 33,0, was das open-weight Modell an die Spitze des Grenzsets bei einer Multi-Turn-Aufgabe mit Werkzeugen bringt — die Arbeitslast, auf die jeder geschlossene Anbieter sein Marketing ausrichtet.
GPQA ist in der Praxis ein Unentschieden, 93,5 gegen 94,1. Die drei Verluste sind informativer: SciCode 58,7 liegt 1,5 Punkte unter Claude Fable 5, Terminal-Bench 85,0 liegt 4,1 Punkte unter Opus 5, und Humanity’s Last Exam 44,3 liegt 9,0 Punkte unter Fable 5. Wenn deine Arbeit wie das härteste Ende unassisted reasoning aussieht, kostet dich diese neun Punkte die offene Zeile.
Dann siehst du die Parameteranzahl
Unser Katalogeintrag beschreibt Kimi K3 als “ein 2,8T Parameter open-weight multimodales Denkmodell”. Das ist 2,8 Billionen Parameter, und es reorganisiert alles darüber.
Es ist auch die einzige Parameteranzahl in diesem Artikel, was kein Versehen ist. Kein geschlossenes Modell veröffentlicht hier eine, sodass der Vergleich überhaupt nicht angestellt werden kann. Sie erhalten die Zahl genau, weil die Gewichte offen sind — das erste, was open weights Ihnen tatsächlich kaufen, ist zu wissen, wie groß das Ding ist, bevor Sie sich dafür entscheiden.
Das zweite, was es Ihnen bietet, ist ein Download. Es kauft nicht die Maschine, die den Download im Speicher hält, und bei dieser Größe ist diese Maschine das gesamte Projekt. Wir veröffentlichen keine Hardware-Schätzung und Sie sollten jeder einzelnen Zahl, die Ihnen gegeben wird, misstrauen, denn die ehrliche Antwort hängt von Quantisierung, Batch-Größe, Interkonnektivität und der Latenz ab, die Sie tolerieren werden — vier Entscheidungen, die Ihre sind, nicht die des Herausgebers.
Open weights ist eine Erlaubnis, kein Deployment
Drei Ansprüche werden in den Satz zusammengefasst, und sie zu trennen ist der größte Teil der Arbeit bei der Auswahl.
Open weights bedeutet nicht kostenlos. Kimi K3 wird mit 3 $ für den Input und 15 $ für den Output pro Million Tokens angeboten, ein Grenzpreis und kein Warenpreis. Wer diese Gewichte bereitstellt, zahlt immer noch für die Hardware, die 2,8 Billionen Parameter hält, und diese Kosten fließen in den Preis ein, egal wer den Checkpoint veröffentlicht.
Open weights bedeutet nicht, dass es in Ihrem Maßstab selbst gehostet werden kann. Für ein Modell mit sieben Milliarden Parametern sind die beiden fast dasselbe. Bei 2,8 Billionen sind es unterschiedliche Projekte mit unterschiedlichen Budgets, und das Selbst-Hosting hört auf, eine Lizenzfrage zu sein, und wird zu einer Kapazitätsplanungsfrage.
Open weights beschreibt die Verfügbarkeit, nicht die Lizenzvergabe. Unsere Daten verzeichnen dieses Modell als open-weight und nichts Genaueres, sodass, wenn Ihr Grund für das Wünschen der Gewichte rechtlicher Natur ist — Prüfung, Weiterverteilung, Rechte zur Feinabstimmung, eine Gerichtsbarkeit, die das Versenden von Eingabeaufforderungen ins Ausland verbietet — die Bedingungen, die an den Checkpoint angehängt sind, das Dokument sind, das Sie benötigen, und eine Benchmark-Tabelle ist kein Ersatz für deren Durchsicht.
Was von diesen drei Subtraktionen übrig bleibt, ist immer noch erheblich: Sie können das Modell inspizieren, eine Version festlegen, die kein Anbieter unter Ihnen abwerten kann, und es irgendwo Ihrer Wahl ausführen, wenn Sie sich das irgendwo leisten können. Für einige Käufer ist dieses Risikoprofil das einzige, was auf dieser Seite zählt.
Der Preis, den Sie tatsächlich zahlen, ist der Durchsatz.
Kimi K3 generiert 32,9 Tokens pro Sekunde. Im selben Snapshot läuft Opus 5 bei 62,8, Sol bei 90,2, Terra bei 165,4 und Luna bei 220,4. Terra ist fünfmal schneller; Luna ist fast siebenmal schneller.
Ein Agent macht das schlimmer als ein Chatfenster, weil er nicht eine lange Antwort produziert — er produziert eine kurze, ruft ein Tool auf, liest das Ergebnis und produziert eine weitere. Multiplizieren Sie die Strafe über zwanzig Rundreisen und der Intelligenzindex hört auf, die entscheidende Zahl zu sein.
Die Zeit bis zum ersten Token zeigt in die gleiche Richtung, mit einer ehrlichen Ausnahme. Kimi K3 benötigt 125,71 Sekunden zum Start, im Vergleich zu 31,35 für Opus 5 und 87,13 für Sol — aber Terra benötigt bei maximalem Aufwand 151,8, was schlechter ist. Diese Zahlen gehören also zu maximalen Anstrengungskonfigurationen und nicht speziell zu Kimi K3, und das stellt den wirklichen Unterschied dar.
Die geschlossenen Modelle liefern einen Latenzregler.
Unser Snapshot enthält fünf Aufwandsebenen für Claude Opus 5 und sechs für jede GPT-5.6-Variante. Kimi K3 erscheint als eine einzige Reihe.
Diese Asymmetrie ist Geld wert, denn die Ebenen sind ein dokumentierter Handel von Punktzahl gegen Zeit. Sol bei hohem Aufwand erzielt 55.9 und startet in 8,65 Sekunden. Terra bei xhigh erzielt 51,6 in 9,55 Sekunden. Opus 5 bei niedrigem Aufwand erzielt 50,6 in 3,01 Sekunden. Der faire Vergleich für einen latenzgebundenen Dienst ist also nicht Kimi K3 gegen Sol bei maximalem Aufwand; es ist 57,1 in 125,71 Sekunden gegen 55,9 in 8,65 Sekunden. Geben Sie 1,2 Punkte des Index auf und starten Sie vierzehn Mal früher.
Für einen nächtlichen Batch-Job ist der Regler nichts wert und die offene Reihe gewinnt im Preis. Mit einer Person oder einem Agentenloop, der am anderen Ende wartet, ist der Regler mehr wert als die 1,8 Punkte zwischen Kimi K3 und Sol.
Eine Million Tokens Kontext und was es wert ist.
Der Katalogeintrag listet ein Kontextfenster von 1.048.576 Tokens, Modalität text+Bild→text, und unterstützt das Aufrufen von Tools. Die Benchmark unterstützt das Fenster, anstatt es nur zu behaupten: 74,7 bei Long Context Reasoning ist das Beste der sechs, was der Beweis ist, den Sie wollen, bevor Sie einer Million-Token-Eingabeaufforderung mit irgendetwas vertrauen.
Seien Sie sich jedoch klar darüber, was die 15 $ kaufen. Neunundzwanzig andere Einträge im gleichen Katalog mit 184 Modellen listen ein Fenster von einer Million Tokens oder mehr, und achtundzwanzig von ihnen verlangen weniger als 15 $ pro Million Ausgabetokens — der Median liegt bei 0,98 $, und fünfzehn liegen unter 1 $. Ein sehr großes Fenster ist kein Premium-Feature mehr. Was die 15 $ kaufen, sind die 57,1, die 33,4 bei Banking und die 93,5 bei GPQA — Argumentation, die über das Fenster hinweg Bestand hat, nicht das Fenster selbst.
Diese Zahlen ändern sich jeden Morgen
Preise, Kontextfenster und Benchmark-Indizes für Hunderte von Modellen, täglich neu aufgebaut. Kostenlos, keine Anmeldung erforderlich.
Öffnen Sie den Vergleich →Wie man auswählt
Sie brauchen die Gewichte in Ihren Händen. Kimi K3, und budgetieren Sie für 2,8 Billionen Parameter anstelle eines Downloads. Machen Sie zuerst die Kapazitätsarbeit und lesen Sie die Bedingungen, die an den Checkpoint angehängt sind, wenn der Grund rechtlicher Natur und nicht technischer Natur ist.
Sie wollen die Spitze der Liste und die Kosten sind sekundär. Claude Opus 5, bei 60,7 und 78,0 für 25 $ pro Million Ausgabetokens, und die schnellste Top-Effort-Konfiguration, die bei 31,35 Sekunden startet.
Ihr Agentenloop ist latenzgebunden. GPT-5.6 Sol bei hohem Aufwand — 55,9 in 8,65 Sekunden — oder Terras 165,4 Tokens pro Sekunde, wenn die nachhaltige Generierung der Engpass ist. Für hohe Volumen bei gewöhnlichen Aufgaben erzielt GPT-5.6 Luna bei 6 $ und 220,4 Tokens pro Sekunde 51,2, was Spielraum ist, den Sie bereits für Klassifizierung und Extraktion haben.
Lange Dokumente und mehrstufige Toolnutzung. Kimi K3 erneut, bei den beiden Benchmarks führt es mit 74,7 und 33,4. Wenn Sie den Durchsatz bewältigen können, ist dies die Arbeitslast, bei der es überhaupt keinen Kompromiss gibt.
Das Fazit
Ein open-weight Modell übertrifft jetzt ein geschlossenes Modell zum gleichen Preis und kommt innerhalb von 1.8 Punkten eines Modells, das doppelt so viel kostet, während es die Führungsgruppe bei langfristigem Kontextdenken und bei einer realistischen Bank-Agenten-Aufgabe anführt. Das sagt die LLM Leaderboard, und es ist wahr.
Der Katalogeintrag sagt die andere Hälfte: 2.8 Billionen Parameter, 32.9 Tokens pro Sekunde, 125.71 Sekunden bis zum ersten Token. Die Gewichte gehören Ihnen; die Maschine ist nicht enthalten und die Latenz ist nicht optional, und beides zeigt sich nicht in einem Score von 57.1. Open weights hat aufgehört, ein Kompromiss bei der Leistungsfähigkeit zu sein, und ist zu einer Entscheidung über die Infrastruktur geworden — ein viel interessanteres Problem.