Quantização de LLM de baixo bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & esparsidade; técnicas de compressão de modelo líderes em PyTorch, TensorFlow e ONNX Runtime
Aplique técnicas avançadas para reduzir o tamanho de modelos de aprendizado de máquina para melhor desempenho em frameworks populares.
Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.
Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.
Grátis · sem cartão · cancele quando quiserQuantização de LLM de baixo bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & esparsidade; técnicas de compressão de modelo líderes em PyTorch, TensorFlow e ONNX Runtime
neural-compressor tem 2.7k estrelas no GitHub. Foi bifurcado 318 vezes. neural-compressor é escrito principalmente em Python. Está em desenvolvimento ativo desde 2020. neural-compressor está disponível sob a licença Apache-2.0. Os seus principais temas são: auto-tuning, awq, fp4, gptq.
Quantização de LLM de baixo bit SOTA (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & esparsidade; técnicas de compressão de modelo líderes em PyTorch, TensorFlow e ONNX Runtime
neural-compressor é um projeto de código aberto. É distribuído sob a licença Apache-2.0.
Sim. neural-compressor é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.
neural-compressor está disponível sob a licença Apache-2.0.
neural-compressor é escrito principalmente em Python.
Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.
[](https://opensourceai.tech/project/intel-neural-compressor.html)