[NeurIPS 2024] KVQuant: Rumo a 10 Milhões de Comprimento de Contexto para Inferência LLM com Quantização de Cache KV
Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.
Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.
Grátis · sem cartão · cancele quando quiser[NeurIPS 2024] KVQuant: Rumo a 10 Milhões de Comprimento de Contexto para Inferência LLM com Quantização de Cache KV
KVQuant tem 431 estrelas no GitHub. Foi bifurcado 46 vezes. KVQuant é escrito principalmente em Python. Está em desenvolvimento ativo desde 2024. Os seus principais temas são: compression, efficient-inference, efficient-model, large-language-models.
[NeurIPS 2024] KVQuant: Rumo a 10 Milhões de Comprimento de Contexto para Inferência LLM com Quantização de Cache KV
KVQuant é um projeto de código aberto.
Sim. KVQuant é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.
KVQuant é escrito principalmente em Python.
Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.
[](https://opensourceai.tech/project/squeezeailab-kvquant.html)
Medido a partir dos topics do GitHub comuns aos dois projetos, ponderados pela sua raridade.