[NeurIPS 2024] KVQuant: Rumo a 10 Milhões de Comprimento de Contexto para Inferência LLM com Quantização de Cache KV
Implemente processamento eficiente de longos contextos para modelos de linguagem usando técnicas de armazenamento de dados de baixa precisão.
Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.
Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.
Grátis · sem cartão · cancele quando quiser[NeurIPS 2024] KVQuant: Rumo a 10 Milhões de Comprimento de Contexto para Inferência LLM com Quantização de Cache KV
KVQuant tem 433 estrelas no GitHub. Foi bifurcado 48 vezes. KVQuant é escrito principalmente em Python. Está em desenvolvimento ativo desde 2024. Os seus principais temas são: compression, efficient-inference, efficient-model, large-language-models.
[NeurIPS 2024] KVQuant: Rumo a 10 Milhões de Comprimento de Contexto para Inferência LLM com Quantização de Cache KV
KVQuant é um projeto de código aberto.
Sim. KVQuant é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.
KVQuant é escrito principalmente em Python.
Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.
[](https://olud.ai/project/squeezeailab-kvquant.html)
Medido a partir dos topics do GitHub comuns aos dois projetos, ponderados pela sua raridade.