[NeurIPS 2024] KVQuant : Vers une inférence LLM de 10 millions de longueurs de contexte avec quantification de cache KV
Implémentez un traitement efficace des longues longueurs de contexte pour les modèles de langage en utilisant des techniques de stockage de données à faible précision.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout moment[NeurIPS 2024] KVQuant : Vers une inférence LLM de 10 millions de longueurs de contexte avec quantification de cache KV
KVQuant compte 433 étoiles sur GitHub. Il a été forké 48 fois. KVQuant est écrit principalement en Python. Il est développé activement depuis 2024. Ses principaux thèmes sont : compression, efficient-inference, efficient-model, large-language-models.
[NeurIPS 2024] KVQuant : Vers une inférence LLM de 10 millions de longueurs de contexte avec quantification de cache KV
KVQuant est un projet open source.
Oui. KVQuant est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
KVQuant est écrit principalement en Python.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://olud.ai/project/squeezeailab-kvquant.html)
Mesuré à partir des topics GitHub communs aux deux projets, pondérés par leur rareté.