[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention alcança aceleração de 2-5x em comparação com FlashAttention, sem perder métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.
Acelere o processamento de modelos de IA sem perder precisão usando técnicas de atenção eficientes em seus projetos.
Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.
Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.
Grátis · sem cartão · cancele quando quiser[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention alcança aceleração de 2-5x em comparação com FlashAttention, sem perder métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.
SageAttention tem 3.5k estrelas no GitHub. Foi bifurcado 447 vezes. SageAttention é escrito principalmente em Cuda. Está em desenvolvimento ativo desde 2024. SageAttention está disponível sob a licença Apache-2.0. Os seus principais temas são: attention, cuda, efficient-attention, inference-acceleration.
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention alcança aceleração de 2-5x em comparação com FlashAttention, sem perder métricas de ponta a ponta em modelos de linguagem, imagem e vídeo.
SageAttention é um projeto de código aberto. É distribuído sob a licença Apache-2.0.
Sim. SageAttention é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.
SageAttention está disponível sob a licença Apache-2.0.
SageAttention é escrito principalmente em Cuda.
Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.
[](https://olud.ai/project/thu-ml-sageattention.html)