[ICLR2025, ICML2025, NeurIPS2025 Spotlight] L'attention quantifiée atteint une accélération de 2 à 5 fois par rapport à FlashAttention, sans perdre les métriques de bout en bout à travers les modèles de langue, d'image et de vidéo.
Accélérez le traitement des modèles d'IA sans perdre en précision en utilisant des techniques d'attention efficaces dans vos projets.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout moment[ICLR2025, ICML2025, NeurIPS2025 Spotlight] L'attention quantifiée atteint une accélération de 2 à 5 fois par rapport à FlashAttention, sans perdre les métriques de bout en bout à travers les modèles de langue, d'image et de vidéo.
SageAttention compte 3.5k étoiles sur GitHub. Il a été forké 447 fois. SageAttention est écrit principalement en Cuda. Il est développé activement depuis 2024. SageAttention est disponible sous licence Apache-2.0. Ses principaux thèmes sont : attention, cuda, efficient-attention, inference-acceleration.
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] L'attention quantifiée atteint une accélération de 2 à 5 fois par rapport à FlashAttention, sans perdre les métriques de bout en bout à travers les modèles de langue, d'image et de vidéo.
SageAttention est un projet open source. Il est distribué sous licence Apache-2.0.
Oui. SageAttention est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
SageAttention est disponible sous licence Apache-2.0.
SageAttention est écrit principalement en Cuda.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://opensourceai.tech/project/thu-ml-sageattention.html)