[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention ottiene un'accelerazione di 2-5x rispetto a FlashAttention, senza perdere metriche end-to-end tra modelli di linguaggio, immagine e video.
Accelera l'elaborazione dei modelli AI senza perdere precisione utilizzando tecniche di attenzione efficienti nei tuoi progetti.
Rivendica la sua pagina: indicizzata qualunque sia il rango, tradotta in sei lingue e arricchita con le tue parole.
Ricevi un avviso via email alla prossima release o quando decolla — non perderti nulla.
Gratis · senza carta · disdici quando vuoi[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention ottiene un'accelerazione di 2-5x rispetto a FlashAttention, senza perdere metriche end-to-end tra modelli di linguaggio, immagine e video.
SageAttention ha 3.5k stelle su GitHub. È stato forkato 447 volte. SageAttention è scritto principalmente in Cuda. È in sviluppo attivo dal 2024. SageAttention è disponibile con licenza Apache-2.0. I suoi temi principali sono: attention, cuda, efficient-attention, inference-acceleration.
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] Quantized Attention ottiene un'accelerazione di 2-5x rispetto a FlashAttention, senza perdere metriche end-to-end tra modelli di linguaggio, immagine e video.
SageAttention è un progetto open source. È rilasciato con licenza Apache-2.0.
Sì. SageAttention è gratuito e open source: puoi usarlo, modificarlo e ospitarlo autonomamente.
SageAttention è disponibile con licenza Apache-2.0.
SageAttention è scritto principalmente in Cuda.
Aggiungi questo badge live al tuo README — le tue stelle GitHub e il ranking della directory, aggiornati quotidianamente.
[](https://olud.ai/project/thu-ml-sageattention.html)