[NeurIPS 2024] KVQuant: Hacia 10 Millones de Longitud de Contexto en Inferencia de LLM con Cuantización de Caché KV
Implementa un procesamiento eficiente de longitud de contexto largo para modelos de lenguaje utilizando técnicas de almacenamiento de datos de baja precisión.
Reivindica su pagina: indexada sea cual sea su posicion, traducida a seis idiomas y enriquecida con tus propias palabras.
Recibe una alerta por correo en su próximo lanzamiento o cuando despegue — no te pierdas nada.
Gratis · sin tarjeta · cancela cuando quieras[NeurIPS 2024] KVQuant: Hacia 10 Millones de Longitud de Contexto en Inferencia de LLM con Cuantización de Caché KV
KVQuant tiene 433 estrellas en GitHub. Se ha bifurcado 48 veces. KVQuant está escrito principalmente en Python. Se desarrolla activamente desde 2024. Sus temas principales son: compression, efficient-inference, efficient-model, large-language-models.
[NeurIPS 2024] KVQuant: Hacia 10 Millones de Longitud de Contexto en Inferencia de LLM con Cuantización de Caché KV
KVQuant es un proyecto de código abierto.
Sí. KVQuant es gratuito y de código abierto: puedes usarlo, modificarlo y alojarlo tú mismo.
KVQuant está escrito principalmente en Python.
Agrega este distintivo en vivo a tu README — tus estrellas de GitHub y rango en el directorio, actualizados diariamente.
[](https://olud.ai/project/squeezeailab-kvquant.html)
Medido a partir de los topics de GitHub comunes a ambos proyectos, ponderados por su rareza.