[NeurIPS 2024] KVQuant: Verso 10 milioni di lunghezza di contesto LLM Inference con quantizzazione KV Cache
Implementa un'elaborazione efficiente della lunghezza del contesto lungo per modelli di linguaggio utilizzando tecniche di archiviazione dati a bassa precisione.
Rivendica la sua pagina: indicizzata qualunque sia il rango, tradotta in sei lingue e arricchita con le tue parole.
Ricevi un avviso via email alla prossima release o quando decolla — non perderti nulla.
Gratis · senza carta · disdici quando vuoi[NeurIPS 2024] KVQuant: Verso 10 milioni di lunghezza di contesto LLM Inference con quantizzazione KV Cache
KVQuant ha 433 stelle su GitHub. È stato forkato 48 volte. KVQuant è scritto principalmente in Python. È in sviluppo attivo dal 2024. I suoi temi principali sono: compression, efficient-inference, efficient-model, large-language-models.
[NeurIPS 2024] KVQuant: Verso 10 milioni di lunghezza di contesto LLM Inference con quantizzazione KV Cache
KVQuant è un progetto open source.
Sì. KVQuant è gratuito e open source: puoi usarlo, modificarlo e ospitarlo autonomamente.
KVQuant è scritto principalmente in Python.
Aggiungi questo badge live al tuo README — le tue stelle GitHub e il ranking della directory, aggiornati quotidianamente.
[](https://olud.ai/project/squeezeailab-kvquant.html)
Misurato dai topic GitHub comuni a entrambi i progetti, ponderati per la loro rarita.